2026 年 9 月 21 日,xAI 正式发布 Grok 4.7。这是 Grok 4.6 一个多月后的换代版本,定位收得很窄:xAI 迄今最擅长编程与知识工作的模型,而非全方位的通用升级。发布当天即通过 xAI API、Cursor、Grok Build 上线,GitHub Copilot 开始分阶段推送,API 价格与 4.6 完全持平。
值得注意的是发布前的插曲:4.7 被马斯克多次预告又多次跳票。最终版本没有去拼参数规模,而是选择在自己最强的赛道上加码——更久的强化学习、更难的任务配比、更好的自我校验。
三个关键变化
更大的基座模型与更久的强化学习:训练权重偏向需要连续工作数小时才能完成的问题,目标是让模型更擅长检查自己的输出,在长上下文任务里少犯低级错误。
新增最高推理档位 xhigh:在 low、medium、high 之上再加一档,开发者可按任务难度决定投入多少推理算力。这对深度编码任务是利好,但也意味着账单更难预测。
知识截止期推进到 2026 年 5 月,上下文窗口保持 50 万 token,输入支持文本和图像。
价格:加量不加价
标准定价与 Grok 4.6 完全相同:每百万输入 token 2 美元、输出 6 美元,另有输出速度翻倍、价格翻倍的快速版本。横向对比依然激进:GPT-5.6 Sol 为 4 美元 / 20 美元,Claude Fable 5.1 为 10 美元 / 50 美元。
但输出便宜不等于任务便宜:独立评测显示,Grok 4.7 在高强度推理档位下单任务 token 消耗明显更多,实际成本会被部分抵消。不同渠道的长上下文计价也可能有差异,下单前建议以实际使用渠道的定价页为准。
官方成绩 vs 独立评测
xAI 在发布时主打两个自家基准:CursorBench 4.0 得 46.3%(4.6 为 40.4%),DeepSWE v1.1 高强度档位下 71.0%(上代 65.2%),都围绕多文件、长时间运行的编码任务设计。
Artificial Analysis 同一天给出了另一组数字:Intelligence Index 46 分(+2),Coding Agent Index 56 分,长程知识工作榜 AA-Briefcase 1657 Elo(+111),排在三款 Claude 之后、Claude Opus 5 之前。但在 Terminal-Bench 4.0 这类智能体编码测试上,Grok 4.7 只有 26%,远低于 GPT-6 Astra 的 60% 和 Claude Fable 5.1 的 55%。
两套数字放在一起,结论很清晰:在 xAI 自己选的赛道上有实质进步,在更广泛的智能体编码能力上仍明显落后于第一梯队。马斯克引用评测称 xAI 在智能体编码领域“位列第三”,这个说法本身不假,但第三名和前两名的差距依然很大。
安全:新防护栈,内部测试通过率 3.3%
xAI 为 4.7 构建了全新的安全防护体系,而非沿用 4.6 的方案。在内部测试 HackerBench v0.3(衡量模型放行高风险提示的比例)上,Grok 4.7 的通过率为 3.3%。公司还表示,已开始向部分网络安全合作伙伴开放红队能力的邀请制访问,用于防御性研究。不过 xAI 尚未发布与 Anthropic、OpenAI 同等详细程度的完整系统卡,这部分仍有待观察。
对开发者意味着什么
如果你已经在用 Grok 4.6 做编码任务,升级到 4.7 几乎没有门槛:同价、同速、同渠道。对成本敏感、编码任务偏“多文件、长时间”特征的团队,4.7 是一个值得试的选项。但如果你期待的是一个能全面替代 Claude 或 GPT-6 级别模型的存在,独立评测的差距说明现在还不是时候——更务实的做法是把它放进现有的模型路由里,简单的任务走它,难的任务继续走第一梯队。
下一步值得关注什么
一是消费端何时跟进:grok.com 和 X 上的普通用户版本官方尚未公布时间。二是马斯克已经预告的 Grok 4.8(2.5 万亿参数、全新自研 C++ 技术栈),迭代加速意味着 4.7 的窗口期可能不会太长。三是完整系统卡和第三方安全评估是否会补上,这关系到企业客户敢不敢把它放进生产环境。
常见问题
Q:Grok 4.7 和 Grok 4.6 最大的区别是什么?
A:基座模型更大、强化学习训练更久更难,新增最高推理档位 xhigh,知识截止期更新到 2026 年 5 月。价格、速度和上下文窗口与 4.6 相同,本质是一次“同价升级”,主攻编程与长程知识工作场景。
Q:普通用户什么时候能在 grok.com 上用上 Grok 4.7?
A:xAI 这次先开放了开发者渠道(API、Cursor、Grok Build)和 GitHub Copilot,消费端应用随后跟进,具体时间官方尚未公布。
Q:Grok 4.7 真的比 GPT-5.6 和 Claude 便宜很多吗?
A:按标价是的,输出 token 价格只有 GPT-5.6 Sol 的约三分之一。但高强度推理档位下单任务 token 消耗更大,实际账单要按你的任务类型实测,不能只看标价。