2026年9月22日,AI 模型 API 聚合平台 OpenRouter 正式推出 Batch API。逻辑很直接:把不着急要结果的请求打包提交,供应商可以在 24 小时的时间窗口内自行选择何时执行,作为交换,价格通常只有正常按 token 计费的一半,部分模型甚至更低。新 API 上线即支持 70 多个模型,调用入口为 api/v1/batches。
用法也不复杂:向 api/v1/batches POST 一批请求,指定 endpoint 形状——chat completions、responses、messages、embeddings 都支持;然后轮询 GET /api/v1/batches/:id,等状态变成 completed、failed、expired 或 cancelled,完成的 batch 结果会直接内联返回。每条请求独立返回结果,几条坏数据不会拖垮整批。
便宜是真便宜,慢也没想象中慢
官方公布了两周 Beta 期、23 万多次 batch 的实测数据:中位数 7 分钟完成,90% 在 1 小时内拿到结果。也就是说“24 小时窗口”更多是上限承诺,实际等待很少接近它。
但有个时间规律值得记下:太平洋时间凌晨 5 点到中午提交的 batch 明显更慢,最慢的 10% 要 2 到 4.5 小时;避开这个时段,90 分位能压到 1.1 小时以内;太平洋时间下午 6 点之后提交则不到 50 分钟。单条请求的 batch 也一样:5 到 11 分钟完成,1000 条以上的大 batch 中位数 12 到 21 分钟。
哪些任务最适合扔进 batch
标注语料、回填 embedding、跑 eval 集、批量摘要工单、连夜对几千行数据跑同一个 prompt——共同点是“对延迟不敏感、量大、结果可独立”。这类离线任务以前要么按实时价硬扛,要么自己搭队列削峰,现在直接半价。费用细节:折扣只针对按 token 的价格,不同模型折扣力度不同,动手前先查目标模型的 batch 定价;配置了 BYOK 的用户,batch 会走自己的 key,只付 BYOK 费用;输入和结果保留 30 天,可手动删除。
先看清限制再动手
图片和文件输入必须是公开 URL;音频、视频以及 OpenRouter 自带的 web search 插件暂不支持 batch;web search 调用按标准价格计费,不打折。实时性要求高的对话类应用继续走实时 API——凡是“今晚跑完、明早看结果”的离线任务,Batch API 基本就是白捡的五折,先从非关键任务小批量试起,再决定是否把 eval 和标注流水线整体切过去。