AI导航

xAI 发布 Grok 4.7:编程与知识工作再升级,价格保持不变

AI资讯
4 min read
0 次阅读

2026 年 9 月 21 日,xAI 正式发布 Grok 4.7。这是 Grok 4.6 一个多月后的换代版本,定位收得很窄:xAI 迄今最擅长编程与知识工作的模型,而非全方位的通用升级。发布当天即通过 xAI API、Cursor、Grok Build 上线,GitHub Copilot 开始分阶段推送,API 价格与 4.6 完全持平。

值得注意的是发布前的插曲:4.7 被马斯克多次预告又多次跳票。最终版本没有去拼参数规模,而是选择在自己最强的赛道上加码——更久的强化学习、更难的任务配比、更好的自我校验。

三个关键变化

更大的基座模型与更久的强化学习:训练权重偏向需要连续工作数小时才能完成的问题,目标是让模型更擅长检查自己的输出,在长上下文任务里少犯低级错误。

新增最高推理档位 xhigh:在 low、medium、high 之上再加一档,开发者可按任务难度决定投入多少推理算力。这对深度编码任务是利好,但也意味着账单更难预测。

知识截止期推进到 2026 年 5 月,上下文窗口保持 50 万 token,输入支持文本和图像。

价格:加量不加价

标准定价与 Grok 4.6 完全相同:每百万输入 token 2 美元、输出 6 美元,另有输出速度翻倍、价格翻倍的快速版本。横向对比依然激进:GPT-5.6 Sol 为 4 美元 / 20 美元,Claude Fable 5.1 为 10 美元 / 50 美元。

但输出便宜不等于任务便宜:独立评测显示,Grok 4.7 在高强度推理档位下单任务 token 消耗明显更多,实际成本会被部分抵消。不同渠道的长上下文计价也可能有差异,下单前建议以实际使用渠道的定价页为准。

官方成绩 vs 独立评测

xAI 在发布时主打两个自家基准:CursorBench 4.0 得 46.3%(4.6 为 40.4%),DeepSWE v1.1 高强度档位下 71.0%(上代 65.2%),都围绕多文件、长时间运行的编码任务设计。

Artificial Analysis 同一天给出了另一组数字:Intelligence Index 46 分(+2),Coding Agent Index 56 分,长程知识工作榜 AA-Briefcase 1657 Elo(+111),排在三款 Claude 之后、Claude Opus 5 之前。但在 Terminal-Bench 4.0 这类智能体编码测试上,Grok 4.7 只有 26%,远低于 GPT-6 Astra 的 60% 和 Claude Fable 5.1 的 55%。

两套数字放在一起,结论很清晰:在 xAI 自己选的赛道上有实质进步,在更广泛的智能体编码能力上仍明显落后于第一梯队。马斯克引用评测称 xAI 在智能体编码领域“位列第三”,这个说法本身不假,但第三名和前两名的差距依然很大。

安全:新防护栈,内部测试通过率 3.3%

xAI 为 4.7 构建了全新的安全防护体系,而非沿用 4.6 的方案。在内部测试 HackerBench v0.3(衡量模型放行高风险提示的比例)上,Grok 4.7 的通过率为 3.3%。公司还表示,已开始向部分网络安全合作伙伴开放红队能力的邀请制访问,用于防御性研究。不过 xAI 尚未发布与 Anthropic、OpenAI 同等详细程度的完整系统卡,这部分仍有待观察。

对开发者意味着什么

如果你已经在用 Grok 4.6 做编码任务,升级到 4.7 几乎没有门槛:同价、同速、同渠道。对成本敏感、编码任务偏“多文件、长时间”特征的团队,4.7 是一个值得试的选项。但如果你期待的是一个能全面替代 Claude 或 GPT-6 级别模型的存在,独立评测的差距说明现在还不是时候——更务实的做法是把它放进现有的模型路由里,简单的任务走它,难的任务继续走第一梯队。

下一步值得关注什么

一是消费端何时跟进:grok.com 和 X 上的普通用户版本官方尚未公布时间。二是马斯克已经预告的 Grok 4.8(2.5 万亿参数、全新自研 C++ 技术栈),迭代加速意味着 4.7 的窗口期可能不会太长。三是完整系统卡和第三方安全评估是否会补上,这关系到企业客户敢不敢把它放进生产环境。

常见问题

Q:Grok 4.7 和 Grok 4.6 最大的区别是什么?

A:基座模型更大、强化学习训练更久更难,新增最高推理档位 xhigh,知识截止期更新到 2026 年 5 月。价格、速度和上下文窗口与 4.6 相同,本质是一次“同价升级”,主攻编程与长程知识工作场景。

Q:普通用户什么时候能在 grok.com 上用上 Grok 4.7?

A:xAI 这次先开放了开发者渠道(API、Cursor、Grok Build)和 GitHub Copilot,消费端应用随后跟进,具体时间官方尚未公布。

Q:Grok 4.7 真的比 GPT-5.6 和 Claude 便宜很多吗?

A:按标价是的,输出 token 价格只有 GPT-5.6 Sol 的约三分之一。但高强度推理档位下单任务 token 消耗更大,实际账单要按你的任务类型实测,不能只看标价。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。