2026年9月23日,Fireworks AI 在官方博客发布 Ember-1:这是 Fireworks Research 推出的首款专用模型,基于月之暗面的 Kimi K3 构建,推理时少用约 40% 的 token,质量与 Kimi K3 持平。发布当天,Ember-1 即以 Research Preview 形式在 Fireworks Serverless 上线,企业可直接调用。
Ember-1 不拼更大的参数,也不追更高的榜单分数,它盯住的是 Agent 时代最实在的一笔账:推理 token。Fireworks 的做法是让模型"学会偷懒"——在训练中砍掉不必要的推理步骤,只保留真正影响答案的那部分思考。官方称,他们在外部基准、真实客户的 A/B 测试,以及内部的代码与 Agent 工作负载上都做了验证,质量在各种场景下都没有掉。
这一定位很务实。对把大模型当生产力工具的团队来说,推理成本直接决定 Agent 能跑多大规模、能撑多长的任务链。Ember-1 把 Kimi K3 级别的质量和 40% 的 token 降幅打包在一起,意味着同样的预算能多跑近一倍的 Agent 任务,或者把原来舍不得开的高推理强度模式变成默认选项。
少掉的 40% token 去哪了
关键在于"专用"二字。Ember-1 不是通用大模型,而是在 Kimi K3 的基础上,针对开发者真实想要的工作负载做了专项训练:砍掉的是通用推理里那些冗余的自我复述和过度展开,保留的是解题真正需要的思考链。Fireworks 把这条路线的名字就叫 Ember,寓意是"余烬"——同样的火,更少的柴。
谁最先受益
三类人会最先感受到变化:一是 Agent 重度用户,长任务链的 token 开销直接打四折效果;二是做代码生成、自动化测试等高频调用的团队,单次调用便宜,规模化才划算;三是自建推理的企业——Fireworks 同步推出了针对 Ember-1 的训练支持,企业可以用自己的数据,定制更贴合自身场景的 token 高效模型。
下一步看什么
两件事值得盯:一是 Research Preview 之后正式版的价格与可用区域,这决定了它能不能真的进生产;二是其他推理服务商会不会跟进。如果"专用蒸馏"这条路走通,2026 年下半年的模型竞争可能从拼分数,转向拼"每块钱能买多少有效推理"——而这对用户来说,是比榜单更好的一件事。