AI导航

Fireworks 发布 Ember-1:基于 Kimi K3,推理 token 直降 40%

AI资讯
2 min read
0 次阅读

2026年9月23日,Fireworks AI 在官方博客发布 Ember-1:这是 Fireworks Research 推出的首款专用模型,基于月之暗面的 Kimi K3 构建,推理时少用约 40% 的 token,质量与 Kimi K3 持平。发布当天,Ember-1 即以 Research Preview 形式在 Fireworks Serverless 上线,企业可直接调用。

Ember-1 不拼更大的参数,也不追更高的榜单分数,它盯住的是 Agent 时代最实在的一笔账:推理 token。Fireworks 的做法是让模型"学会偷懒"——在训练中砍掉不必要的推理步骤,只保留真正影响答案的那部分思考。官方称,他们在外部基准、真实客户的 A/B 测试,以及内部的代码与 Agent 工作负载上都做了验证,质量在各种场景下都没有掉。

这一定位很务实。对把大模型当生产力工具的团队来说,推理成本直接决定 Agent 能跑多大规模、能撑多长的任务链。Ember-1 把 Kimi K3 级别的质量和 40% 的 token 降幅打包在一起,意味着同样的预算能多跑近一倍的 Agent 任务,或者把原来舍不得开的高推理强度模式变成默认选项。

少掉的 40% token 去哪了

关键在于"专用"二字。Ember-1 不是通用大模型,而是在 Kimi K3 的基础上,针对开发者真实想要的工作负载做了专项训练:砍掉的是通用推理里那些冗余的自我复述和过度展开,保留的是解题真正需要的思考链。Fireworks 把这条路线的名字就叫 Ember,寓意是"余烬"——同样的火,更少的柴。

谁最先受益

三类人会最先感受到变化:一是 Agent 重度用户,长任务链的 token 开销直接打四折效果;二是做代码生成、自动化测试等高频调用的团队,单次调用便宜,规模化才划算;三是自建推理的企业——Fireworks 同步推出了针对 Ember-1 的训练支持,企业可以用自己的数据,定制更贴合自身场景的 token 高效模型。

下一步看什么

两件事值得盯:一是 Research Preview 之后正式版的价格与可用区域,这决定了它能不能真的进生产;二是其他推理服务商会不会跟进。如果"专用蒸馏"这条路走通,2026 年下半年的模型竞争可能从拼分数,转向拼"每块钱能买多少有效推理"——而这对用户来说,是比榜单更好的一件事。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。