Hugging Face Blog·· 2026-07-08精选AI 评分80
vLLM 推出原生速度的 Transformers 建模后端
Native-speed vLLM transformers modeling backend
AI 导读
vLLM 的 Transformers 建模后端现已实现与原生手写实现相当或更快的推理速度。该更新利用 torch.fx 和 AST 在运行时动态应用层融合等优化,支持 Qwen3 等多种架构及并行策略。用户只需添加 --model-impl transformers 标志即可直接运行 Hugging Face 模型,无需为推理单独编写优化代码。
推荐理由
通过运行时动态优化使 Transformers 后端在 vLLM 中达到原生速度,模型作者无需移植代码即可享受高性能推理。
来源:Hugging Face Blog · huggingface.co