AI导航

Baseten 让 Claude 写推理引擎:单流解码比 vLLM 快 90%

AI资讯
3 min read
1 次阅读

Baseten 在 2026 年 10 月 2 日发布的官方工程博客里,公布了一次让 AI 自己写推理引擎的实验结果:由 Claude Code(Fable 5)自动构建的引擎 VibeQwen,在单张 NVIDIA B200 上为通义千问 Qwen-3.6-35B-A3B(NVFP4 量化)做推理,单流解码速度比调优过的 vLLM 0.25.1 快最多 90%,首 token 延迟从 28 毫秒降到 12 毫秒。这不是新模型发布,而是一次方法验证:把目标、约束和验证标准定清楚之后,让编程智能体用一周时间反复试错,自己磨出一套只服务于单一模型与单一硬件的专用引擎。

成绩单:三组数字都赢了通用引擎

对照测试在同一张 B200 上进行。在偏投机解码友好的重复、结构化文本上,VibeQwen 单流输出 1792 token/秒,vLLM 为 943 token/秒,领先 90%;首 token 时间 12 毫秒对 28 毫秒,快约 2.3 倍;并发 32 的单副本吞吐为 10307 token/秒对 6030 token/秒,高 71%。实验目标原本只定在全面领先 vLLM 20% 且精度不输基线,最终成绩明显超过这个门槛。需要说明的是,精度口径有让步:工程师允许生成引擎的数值输出与 NVFP4 参考实现有细微差异,前提是对 BF16 基线的整体精度不低于原版。

一周、约 17 亿 token 和 200 个 B200 小时

过程比结果更能说明这种做法的成本结构。工程师给 Claude 提供了 MetaInfer 论文及其仓库、一台 B200 工作站的 SSH 访问、量化权重与全精度权重(用作精度对照),并设定目标让它自主推进。Claude 大部分时间无人值守运行,经历多次自动上下文压缩,消耗约 17 亿 token(绝大多数是缓存输入)和约 200 个 B200 小时,工程师只偶尔介入纠偏,防止它过度盯住某一种流量形态。头几天它就追平了 vLLM,之后继续打磨才拉开差距。第二个实验换到完全不同的模型类型:为 Meta 的 SAM 3.1 图像分割模型写的推理服务 Sammie,在单张 H100 上达到每秒 91 张,比官方参考服务快 50%,只用了约两天和约 2 亿 token。

边界:专用引擎换的是通用性

Baseten 自己把话说得很清楚:VibeQwen 和 Sammie 都还只是实验,没有承接生产流量。vLLM 这类开源引擎的价值在于对大量模型、硬件和负载的通用支持,代价是不为任何单一组合做极致优化;自动生成的专用引擎正好反过来,只对一个模型加一种硬件加一类负载负责,换部署组合就要重跑。第二个实验也没有做对照测试,官方承认它对知识库复用价值的证明只是提示性的。对推理成本敏感的团队,这条路线值得跟踪的信号是价格:Baseten 估算这类优化的花费在数百到数千美元量级,而大厂每年的推理支出以千万美元计,哪怕只省下个位数百分比也足够可观。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。