马斯克旗下的人工智能公司 SpaceXAI 日前发布了新一代前沿模型 Grok 4.6,重点面向长时间运行的智能体、编程和知识工作场景,并采用更具竞争力的定价策略来降低这些工作负载的运行成本。

Grok
在第三方评测机构 Artificial Analysis 的智能指数中,Grok 4.6 得分 61,超越月之暗面的开源模型 Kimi K3,与 OpenAI 的 GPT-5.6 Sol Max 持平,相比上一代 Grok 4.5 提升 5 分。目前榜单前两名分别由 Anthropic 的 Claude Opus 5 和 Claude Fable 5 占据,Grok 4.6 与 GPT-5.6 Sol Max 并列全球第三。
编程和智能体能力是 Grok 4.6 升级的重头戏。在 DeepSWE v1.1 基准测试中,其得分从 54% 跃升至 65.9%;APEX-Agents 智能体基准从 47.1% 升至 57.5%,提升 10.4 个百分点,略超 GPT-5.6 Sol Max 的 56.7%;Terminal-Bench v3.0 也从 15.7% 提升至 26%。不过在后两项测试中,Claude Fable 5 Max 仍保持领先,说明 Grok 4.6 虽然进步明显,但尚未实现对竞争对手的全面压制。










