vLLM升级0.17.1:MoE后端、Mamba缓存和MTP处理一起修,推理框架继续做细底层兼容
AI资讯 vLLM 0.17.1 没有铺陈太多概念,直接把补丁落在推理底层:TRTLLM 的 MoE 路径、Mamba 和 Qwen3.5 的缓存块处理,以及 MTP 的索引优化都被列进官方说明。对跑推理服务的团队来说,这种版本往往比大而全的新功能更有用。 推理框架一旦进入复杂模型和异构后端,很多问题并不是“能不能跑”,而是某个后端、某种精度或某条缓存链路会不会在负载下出错。vLLM 这次就是针对这些细节继...
AI导航 • • 101 次阅读