AI导航

OpenRouter 上线 Batch API:批量推理半价,7 分钟出结果

AI资讯
2 min read
0 次阅读

2026年9月22日,AI 模型 API 聚合平台 OpenRouter 正式推出 Batch API。逻辑很直接:把不着急要结果的请求打包提交,供应商可以在 24 小时的时间窗口内自行选择何时执行,作为交换,价格通常只有正常按 token 计费的一半,部分模型甚至更低。新 API 上线即支持 70 多个模型,调用入口为 api/v1/batches。

用法也不复杂:向 api/v1/batches POST 一批请求,指定 endpoint 形状——chat completions、responses、messages、embeddings 都支持;然后轮询 GET /api/v1/batches/:id,等状态变成 completed、failed、expired 或 cancelled,完成的 batch 结果会直接内联返回。每条请求独立返回结果,几条坏数据不会拖垮整批。

便宜是真便宜,慢也没想象中慢

官方公布了两周 Beta 期、23 万多次 batch 的实测数据:中位数 7 分钟完成,90% 在 1 小时内拿到结果。也就是说“24 小时窗口”更多是上限承诺,实际等待很少接近它。

但有个时间规律值得记下:太平洋时间凌晨 5 点到中午提交的 batch 明显更慢,最慢的 10% 要 2 到 4.5 小时;避开这个时段,90 分位能压到 1.1 小时以内;太平洋时间下午 6 点之后提交则不到 50 分钟。单条请求的 batch 也一样:5 到 11 分钟完成,1000 条以上的大 batch 中位数 12 到 21 分钟。

哪些任务最适合扔进 batch

标注语料、回填 embedding、跑 eval 集、批量摘要工单、连夜对几千行数据跑同一个 prompt——共同点是“对延迟不敏感、量大、结果可独立”。这类离线任务以前要么按实时价硬扛,要么自己搭队列削峰,现在直接半价。费用细节:折扣只针对按 token 的价格,不同模型折扣力度不同,动手前先查目标模型的 batch 定价;配置了 BYOK 的用户,batch 会走自己的 key,只付 BYOK 费用;输入和结果保留 30 天,可手动删除。

先看清限制再动手

图片和文件输入必须是公开 URL;音频、视频以及 OpenRouter 自带的 web search 插件暂不支持 batch;web search 调用按标准价格计费,不打折。实时性要求高的对话类应用继续走实时 API——凡是“今晚跑完、明早看结果”的离线任务,Batch API 基本就是白捡的五折,先从非关键任务小批量试起,再决定是否把 eval 和标注流水线整体切过去。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。