Prime Inference 在 2026 年 10 月 2 日由 Prime Intellect 正式发布。这是一个专为前沿开源模型准备的推理平台,同时提供 Serverless 端点和预留容量,跨多个数据中心运行,接口与 OpenAI SDK 兼容。它不是从零起步的新产品:Prime 内部早已用这套系统支撑强化学习 rollout、合成数据生成、评测和长时间运行的编码智能体,每天处理近一万亿 token;今年 1 月起,它也在为外部客户做规模化生产部署,这次发布是把内部系统正式对外开放。
首个公开端点选了 GLM-5.3,跑在 Blackwell 上
对外的第一张名片是 GLM-5.3 端点:9 月 22 日先在 OpenRouter 上线,按 Prime 的说法,它是 OpenRouter 上速度最快的 GLM-5.3 端点之一,工具调用错误率接近零,上线以来可用率保持 100%。硬件侧目前用 NVIDIA Blackwell,Vera Rubin 在后续计划中。商业形态上,它把 Serverless 的弹性计费和预留容量的稳定性放在同一平台,统一账单、按团队统计用量,自动在数据中心之间做故障切换——瞄准的是已经把开源模型用进生产、开始被可用性和账单管理拖住的团队。
架构核心:把预填充和解码拆到两组 GPU 上
长上下文智能体负载有个典型麻烦:新会话带着十几万 token 的历史进来做预填充时,正在生成的会话会被拖慢。Prime 的解法是分离部署:预填充和解码跑在不同的 GPU 组上,由 NVIDIA Dynamo 负责路由和编排、vLLM 执行模型计算,实测把词间延迟的 p90 拉低了约 40%。还有一个不起眼的调度修正:他们发现请求哪怕缓存已经就位,也可能因为排不上当前批次而干等,于是把每步预填充的 token 预算从 8000 砍到 4000,中位排队等待从 550 毫秒降到 110 毫秒,首 token 时间整体下降约 20%。在其设定的每用户每秒 100 token 交互线下,1 比 4 的预填充与解码配比能撑起每组 66 个并发会话。
KV 缓存压缩约五成,工具调用的静默丢弃被修掉
第二组优化在缓存上:他们用 NVFP4 压缩多头潜在注意力的 KV 缓存,每个解码器能缓存的 token 从约 109 万涨到约 163 万,多出近五成;换用 BLHNC 块布局后,跨节点传输的描述符数量降到约十分之一,平均传输时间从 146 毫秒降到 78 毫秒,原生内核还以实验性算子的形式贡献给了 FlashInfer。智能体场景的可靠性问题更隐蔽:原系统会静默丢弃调用了未声明工具的请求,表面正常结束,智能体却无从纠错。Prime 给 Dynamo 补了结构化标签构建器,用 xgrammar 在解码阶段强制工具调用的格式,并对最终接口响应做了参数类型、必填字段、枚举、流式与非流式一致性等一整套回归测试。
路线图清楚,但性能数字仍需拿自己的负载复核
Prime 公布的后续计划包括面向离线大作业的批量与异步推理,以及在自有预留容量上一键部署自家训练出的微调模型,试图把训练与推理闭环补完整。需要提醒的是,这篇发布中的性能数字来自 Prime 自测,基准用的是 SemiAnalysis 的 AgentX 回放多轮智能体会话,与自家业务的提示词长度、并发形状未必一致;端点的价格与限额细节以官方文档为准。适合认真评估它的人,是已经在用开源前沿模型、且对延迟和工具有 SLA 要求的团队;还在试验阶段的个人项目,先用按量端点小规模实测,比看任何榜单都可靠。