跳到正文
Hugging Face Blog·· 2026-07-08精选AI 评分62

vLLM 的 transformers 建模后端达到原生推理速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已追平甚至超过 vLLM 手写原生实现的吞吐。该后端通过 torch.fx 做静态图分析、用 ast 重写算子,在运行时动态应用推理专用层融合,覆盖 MoE 专家并行、TP 张量并行等场景。

推荐理由

原文给出 transformers 后端在 vLLM 中追平原生实现的具体机制与启用方式,读者可据此判断自家模型能否免移植获得同等推理速度。

来源:Hugging Face Blog · huggingface.co