纯推理:禁用一切工具
Meta 特意强调,为了测试纯粹的推理能力,模型被禁用了所有工具:不能搜索,不能写代码,不能用计算器。
这个约束很重要。过去一年里,奥赛榜单上不少顶尖成绩其实是靠「强模型 + 验证器 + 多轮精修」的 agent 流水线拿到的。有研究者用 Gemini 3.1 Pro 搭了一个结构相当简单的 agent,在 IPhO 2025 理论题上跑五次、五次满分;但作者自己也提示,该模型发布晚于竞赛,数据污染无法排除。

https://arxiv.org/pdf/2603.03352
Meta 把工具全部关掉,等于主动放弃了这条最容易刷分的路径。
不过物理竞赛还有一层没被提及:IPhO 和 APhO 都包含实验考试,Meta 报告的应该仅是理论部分。
从 Llama 到 Muse
2025 年是 Meta AI 最难熬的一年。Llama 4 Maverick 在 Artificial Analysis 智能指数上只拿到 18 分,Behemoth 因内部对能力不满而推迟,扎克伯格随后亲自下场重组,斥巨资引入 Alexandr Wang 与 Scale AI 团队成立 Meta Superintelligence Labs(MSL),把预训练架构、数据管线和 RL 后训练系统整个推倒重建。
2026 年 4 月 8 日,MSL 交出第一款模型 Muse Spark,原生多模态、262k 上下文,智能指数从 18 跳到 52。7 月 9 日 Muse Spark 1.1 上线,主打 agentic 与编程,也是 Meta 第一个收费 API 模型。
就在本周,基于 Muse Spark 1.2 的终端编程智能体 Muse Code 进入 beta,据说能力相当出色。

按这个节奏看,这份奥赛成绩单更像是下一代 Muse 模型的预告片。










