AI导航

Prime Inference 发布:前沿开源模型推理服务上线,首个端点是 GLM-5.3

AI资讯
3 min read
1 次阅读

Prime Inference 在 2026 年 10 月 2 日由 Prime Intellect 正式发布。这是一个专为前沿开源模型准备的推理平台,同时提供 Serverless 端点和预留容量,跨多个数据中心运行,接口与 OpenAI SDK 兼容。它不是从零起步的新产品:Prime 内部早已用这套系统支撑强化学习 rollout、合成数据生成、评测和长时间运行的编码智能体,每天处理近一万亿 token;今年 1 月起,它也在为外部客户做规模化生产部署,这次发布是把内部系统正式对外开放。

首个公开端点选了 GLM-5.3,跑在 Blackwell 上

对外的第一张名片是 GLM-5.3 端点:9 月 22 日先在 OpenRouter 上线,按 Prime 的说法,它是 OpenRouter 上速度最快的 GLM-5.3 端点之一,工具调用错误率接近零,上线以来可用率保持 100%。硬件侧目前用 NVIDIA Blackwell,Vera Rubin 在后续计划中。商业形态上,它把 Serverless 的弹性计费和预留容量的稳定性放在同一平台,统一账单、按团队统计用量,自动在数据中心之间做故障切换——瞄准的是已经把开源模型用进生产、开始被可用性和账单管理拖住的团队。

架构核心:把预填充和解码拆到两组 GPU 上

长上下文智能体负载有个典型麻烦:新会话带着十几万 token 的历史进来做预填充时,正在生成的会话会被拖慢。Prime 的解法是分离部署:预填充和解码跑在不同的 GPU 组上,由 NVIDIA Dynamo 负责路由和编排、vLLM 执行模型计算,实测把词间延迟的 p90 拉低了约 40%。还有一个不起眼的调度修正:他们发现请求哪怕缓存已经就位,也可能因为排不上当前批次而干等,于是把每步预填充的 token 预算从 8000 砍到 4000,中位排队等待从 550 毫秒降到 110 毫秒,首 token 时间整体下降约 20%。在其设定的每用户每秒 100 token 交互线下,1 比 4 的预填充与解码配比能撑起每组 66 个并发会话。

KV 缓存压缩约五成,工具调用的静默丢弃被修掉

第二组优化在缓存上:他们用 NVFP4 压缩多头潜在注意力的 KV 缓存,每个解码器能缓存的 token 从约 109 万涨到约 163 万,多出近五成;换用 BLHNC 块布局后,跨节点传输的描述符数量降到约十分之一,平均传输时间从 146 毫秒降到 78 毫秒,原生内核还以实验性算子的形式贡献给了 FlashInfer。智能体场景的可靠性问题更隐蔽:原系统会静默丢弃调用了未声明工具的请求,表面正常结束,智能体却无从纠错。Prime 给 Dynamo 补了结构化标签构建器,用 xgrammar 在解码阶段强制工具调用的格式,并对最终接口响应做了参数类型、必填字段、枚举、流式与非流式一致性等一整套回归测试。

路线图清楚,但性能数字仍需拿自己的负载复核

Prime 公布的后续计划包括面向离线大作业的批量与异步推理,以及在自有预留容量上一键部署自家训练出的微调模型,试图把训练与推理闭环补完整。需要提醒的是,这篇发布中的性能数字来自 Prime 自测,基准用的是 SemiAnalysis 的 AgentX 回放多轮智能体会话,与自家业务的提示词长度、并发形状未必一致;端点的价格与限额细节以官方文档为准。适合认真评估它的人,是已经在用开源前沿模型、且对延迟和工具有 SLA 要求的团队;还在试验阶段的个人项目,先用按量端点小规模实测,比看任何榜单都可靠。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。