Meta 支棱起来了吗?
这是最值得追问的地方。2025 年 7 月,OpenAI 与 Google DeepMind 双双拿下 IMO 金牌(35/42,六题解出五题)时,OpenAI 研究员把它称作行业的「登月时刻」。一年过去,坐标系已经完全变了。
2026 年 7 月的上海 IMO 结束后,华为的 Celia 与小红书的 dots-note-3.0 先后宣布拿到 42/42 满分,小红书称此前从未有大模型在 IMO 官方评审流程下拿到满分。参阅机器之心报道《AI 首次拿下 IMO 官方满分金牌,背后藏着一套自我纠错机制》。
此外也有报告称 Anthropic 的 Claude Opus 5 在不使用 agent 框架和工具的条件下一次通过全部六题,四份独立解答全部正确。
换句话说,在 IMO 这一项上,Meta 的「金牌」放进 2026 年的排位里并不格外显眼。真正有分量的反而是两项物理理论满分--前提是这些成绩能被独立验证。
更值得警惕的是,奥赛作为推理能力标尺正在以肉眼可见的速度失效。Meta 给出的理由是「为了理解我们在推理上是否取得了真正的进展」,但当同一批竞赛在一年之内从「难以企及」变成「多家实验室都能刷满」,这把尺子能提供的信息量正在急剧衰减。
数学界早有提醒:陶哲轩在 2025 年就指出,AI 能做到什么很大程度上取决于测试方法本身。奥赛题有标准答案、有明确评分标准、有充足历史题库可供训练,这些恰恰是现实科研问题不具备的条件。

那么,Meta 支棱起来了吗?从 Muse Spark 到 Muse Code 再到这份成绩单,它至少不再是那个只能靠开源叙事维持存在感的公司。但要说重回第一梯队,还需要拿出更多的东西,尤其是一个真正能被用起来的产品。










