Baseten 在 2026 年 10 月 2 日发布的官方工程博客里,公布了一次让 AI 自己写推理引擎的实验结果:由 Claude Code(Fable 5)自动构建的引擎 VibeQwen,在单张 NVIDIA B200 上为通义千问 Qwen-3.6-35B-A3B(NVFP4 量化)做推理,单流解码速度比调优过的 vLLM 0.25.1 快最多 90%,首 token 延迟从 28 毫秒降到 12 毫秒。这不是新模型发布,而是一次方法验证:把目标、约束和验证标准定清楚之后,让编程智能体用一周时间反复试错,自己磨出一套只服务于单一模型与单一硬件的专用引擎。
成绩单:三组数字都赢了通用引擎
对照测试在同一张 B200 上进行。在偏投机解码友好的重复、结构化文本上,VibeQwen 单流输出 1792 token/秒,vLLM 为 943 token/秒,领先 90%;首 token 时间 12 毫秒对 28 毫秒,快约 2.3 倍;并发 32 的单副本吞吐为 10307 token/秒对 6030 token/秒,高 71%。实验目标原本只定在全面领先 vLLM 20% 且精度不输基线,最终成绩明显超过这个门槛。需要说明的是,精度口径有让步:工程师允许生成引擎的数值输出与 NVFP4 参考实现有细微差异,前提是对 BF16 基线的整体精度不低于原版。
一周、约 17 亿 token 和 200 个 B200 小时
过程比结果更能说明这种做法的成本结构。工程师给 Claude 提供了 MetaInfer 论文及其仓库、一台 B200 工作站的 SSH 访问、量化权重与全精度权重(用作精度对照),并设定目标让它自主推进。Claude 大部分时间无人值守运行,经历多次自动上下文压缩,消耗约 17 亿 token(绝大多数是缓存输入)和约 200 个 B200 小时,工程师只偶尔介入纠偏,防止它过度盯住某一种流量形态。头几天它就追平了 vLLM,之后继续打磨才拉开差距。第二个实验换到完全不同的模型类型:为 Meta 的 SAM 3.1 图像分割模型写的推理服务 Sammie,在单张 H100 上达到每秒 91 张,比官方参考服务快 50%,只用了约两天和约 2 亿 token。
边界:专用引擎换的是通用性
Baseten 自己把话说得很清楚:VibeQwen 和 Sammie 都还只是实验,没有承接生产流量。vLLM 这类开源引擎的价值在于对大量模型、硬件和负载的通用支持,代价是不为任何单一组合做极致优化;自动生成的专用引擎正好反过来,只对一个模型加一种硬件加一类负载负责,换部署组合就要重跑。第二个实验也没有做对照测试,官方承认它对知识库复用价值的证明只是提示性的。对推理成本敏感的团队,这条路线值得跟踪的信号是价格:Baseten 估算这类优化的花费在数百到数千美元量级,而大厂每年的推理支出以千万美元计,哪怕只省下个位数百分比也足够可观。