2026 年 10 月 1 日,AI 模型聚合平台 OpenRouter 在官方博客发布了一套 Agent 模型成本与质量权衡选型框架,核心主张很直接:别再按排行榜名次给 Agent 选模型。先给任务定一条质量线,再用自己的样例测出每个候选模型的"每质量点成本",最后选最便宜的那个过线者。
为什么排行榜不够用
OpenRouter 的理由有两层。第一,排行榜是跨任务取平均,平均分第一的模型在你的具体任务上未必第一:编码榜第一的模型,做结构化数据抽取可能还不如一个中档模型。Agent 的任务往往很窄——分个工单、抽一个字段、拿不准就升级人工——便宜模型在窄任务上达到同样准确率是常事,不测不知道。
第二,Agent 的成本不是一次聊天。一次普通对话按一次请求计费,Agent 的每次工具调用、每个中间步骤、每次重试都要单独付钱:一个三步循环没出结果之前,token 单价至少被收了三遍。按排行榜选最强模型,等于为一个便宜模型也能干好的活付三遍前沿价格。
三步:定线、实测、带余量选
框架分三步。第一步,按任务定质量线:答错即担责的任务(合规、医疗、法务复核)把线设高,接受更高的单次成本;高并发客服这类场景看的是整体解决率,一个解决 90% 常规请求、剩下 10% 干净升级的便宜模型完全可以接受;延迟敏感的任务(欺诈检测、实时聊天)再加一条延迟约束——便宜又准但太慢的模型直接出局。
第二步,用自己的数据实测。拿 20 到 50 条真实业务样例(工单、文档、提示词),让便宜、中档、前沿三档候选模型各跑一遍,用同一套评分标准打分,再用"每 1000 次请求成本 ÷ 质量分"算出每质量点成本。关键细节:成本从响应里的 usage.cost 字段直接读账单金额,别拿官网单价乘估算 token 数自己算。
第三步,选过线且有余量的最便宜模型。余量不是拍脑袋定的:把候选模型多跑几遍,记录分数在运行间的自然波动,要求胜出者过线的幅度大于这个波动,避免上线后一次正常抖动就跌破线。
一个例子:85% 的线,三档模型怎么选
官方给了一个客服分诊的算例。质量线定在 85%:GPT-5.6 Luna 每千次请求 0.32 美元、82 分,没过线,再便宜也出局;Gemini 3.7 Flash 每千次 1.09 美元、89 分,过线且有 4 分余量;Claude Opus 5 每千次 7.25 美元、97 分,也过线但贵了 6 倍多。结论:选 Gemini 3.7 Flash。把线挪到 95%(比如分诊错一次就丢 SLA),答案立刻变成只有 Claude Opus 5 能用——线不同,答案不同,这正是框架要表达的。
同一套方法换到别的任务,结论跟着变:支持分诊 80% 的线用便宜档就够,代码评审 88% 的线选中档,合规审查 95% 的线只能上前沿。但 OpenRouter 也提醒,测出来的结论只在测量当天有效:2026 年 5 月到 9 月,它的目录里就新增了四个 Gemini Flash 版本。模型一更新、价格一变,就得把脚本和样例集拿出来重跑一遍。
这套框架适合正在为 Agent 落地做选型的工程师和技术负责人,尤其适合已经被 token 账单吓到、但又不想无脑降级牺牲质量的团队。OpenRouter 同日还发布了配套的实战指南,包括如何在 CI 里用 LLM 评测集做 PR 门禁、以及用置信度阈值做便宜模型到强模型的分级升级路由,思路都是同一个:把"够不够好"变成可测量的数字,再谈省钱。