不敲代码不靠工具,30B轻量模型凭什么狂飙10万Token冲上奥赛金牌线?
导语:上海AI实验室推出30B规模推理模型SU-01,仅靠自然语言推理,在IMO和USAMO夺得金牌级评分。
在当下的AI学术圈和工程界,大家都习惯了用参数规模来定义模型的上限。要攻克奥林匹克级别的科学推理,在许多人的惯性认知中依赖两种路径:要么套用一个千亿甚至万亿参数的超大底座,要么在后台悄悄接上Python解析器、外部符号计算器等一系列复合“外挂”。
然而,上海人工智能实验室最近发布的一份技术报告直击这个问题核心:在不调用任何外部工具、不执行任何代码、不接入任何专用符号求解器的纯粹自然语言环境下,一个看似轻量级的30B-A3B模型,硬是依靠自发的逻辑修正,在数学和物理的顶级奥赛评测中摸到了金牌线。这个被命名为“SU-01”的系统展现出了一种令人惊喜的高效逻辑演进路线。

卸掉常规“外挂”,30B小钢炮直面硬核科学推理
奥赛级别的证明题和常规的数学问答完全不在一个难度维度。在国际数学奥林匹克(IMO)或者美国数学奥林匹克(USAMO)这类硬核场景中,机器只给出一个最终数值是没有任何意义的。从起点到终点,模型必须建立长达数万字的逻辑闭环,妥善管理各种前置假设、中间分支判断以及稍纵即逝的边界条件。中间任何一个逻辑滑坡、或者漏掉某一种情况的分步讨论,都会导致整个推导瞬间崩塌。
以往,为了让模型维持哪怕几千字的逻辑不“胡言乱语”,开发者们往往要煞费苦心地构建极其沉重的工具链。但SU-01的反向操作相当大胆:研究团队选择了一条极为质朴也极为艰难的路径,让模型的一切构思、证明、纠错和优化步骤,完全在原生的自然语言中完成。这种对模型底层逻辑纯度的极致压榨,指向了一个清晰的设问:如果只留自然语言,小巧的30B模型到底能走多远?
重塑造、重惩奖、重修正:拆解三阶段训练路线
要在一个百亿参数级的模型里塞下如此复杂的深度思考能力,上海人工智能实验室并没有采用大力出奇迹的数据轰炸,而是对模型的训练和推理范式进行了一次精细的手术。这套精简优化的流程主要由三部分构成:
1. 自适应的“反向困惑度课程监督微调”
为了让模型形成长程且严密的思维习惯,团队收集并清洗了大约33.8万条涵盖科学、数学、代码推理的高质量长链路轨迹数据,并在其中揉入了大量的自我纠错和验证样本。有意思的是数据喂给模型的方式:团队引入了自适应的“反向困惑度课程学习”。在这种设计下,样本并不是随机灌给模型的,而是按照初始模型困惑度从高向低排列——先让模型暴露于与其当前解题直觉冲突最大的复杂轨迹中,然后再回头打牢基础、消化更熟悉的思路,从而高效率地重塑了长程推理框架。
2. 从“算得对”进化为“证得好”的强化学习
仅有行为规范还不够。在接下来的两阶段强化学习中,第一阶段侧重通过可量化结果反馈来快速拉升模型的解题输出正确率;而第二阶段则把重心移到了证明细节的无缝和严密性上。在这里,团队创新地引入了证明质量奖励模型和自修正经验回放。在这种机制下,系统一旦生成了存在细微瑕疵或缺口的解答,它会被强制引导去重新检视这些步骤,在发现痛点后自主编写补丁式的新证明,反复循环,使模型学会在失败中提炼有效路径。
3. 推理阶段的“生成-验证-修正”闭环
这也是SU-01最核心的战斗力来源。当面对真正的奥数魔鬼题时,模型不再被要求一次性完美作答,而是把有限的算力用在推理过程的自我博弈上。模型会进入多轮的“草稿纸时间”,先构思一份雏形,再启动自体验证流程挑毛病,并在发现不严密逻辑后执行小范围的定向重写。
这不仅是把文章写长,而是10万级别的深度长跑
很多人可能会产生疑问:所谓的“推理时扩展”,是不是只是大模型在不停地念经,把答案无谓地拉长?数据给出了否定的回答。在实际考核中,SU-01展现出的证明搜索和修正行为,极具针对性和策略性。

在IMO-ProofBench评测中,SU-01在直接生成模式下拿到了同尺寸模型中最顶级的57.6%得分;而一旦开启“推理时扩展”机制,这一成绩直接狂飙到了70.2%,极为逼近闭源巨无霸Gemini 3.1 Pro Thinking的72.6%水平。不仅如此,除了经典的竞赛基准之外,它在更接近一线科研真实形态的FrontierScience-Research上也拿到了同尺寸第一,证明了这种通过长思考带来的逻辑质量提升,是可以平滑泛化到更广阔的科学研究领域之中的。

根据对USAMO考试轨迹的深入剖析可以发现,SU-01在推理扩展期间,首个生成草案的中位长度约为10.6万字符(token),而其后续自我排查和纠偏的中位长度也足足达到了8.3万字符。这意味着即使在百亿级别的轻量底座上,模型也能够非常稳定地调度并消化巨量的上下文推理额度,将其百分之百地转化成逻辑求证、反向验证和缺陷修复的实际算力。
征服USAMO硬骨头:在人类平均0.01分的难关上砍下满分
空谈模型框架是没有意义的,最后的答案还是要交由竞赛的严酷数据来评判。在这场针对奥林匹克顶级数学与物理赛事的终极对决里,SU-01交出了一份惊艳的答卷。
在数学奥赛板块,经过推理扩展的SU-01在IMO 2025评测中斩获35分,妥妥踏过了当年高昂的金牌线(35分);而在美国数学奥林匹克USAMO 2026中,SU-01同样狂砍35分,不仅仅是大幅度碾压了25分的金牌及格线,更是追平了人类顶尖参赛选手的全场最高得分纪录。

如果剖析这届USAMO 2026的人类统计细节,你更能直观感受到这个成绩的含金量:在那场考试中,340名天之娇子一般的人类奥数选手平均分只有惨不忍睹的8.59分,中位数是区区6分,全场前12名的划线也不过是26分。其中第三题(P3)堪称整场噩梦,高难度的几何逻辑压制得人类平均分跌落至0.01分,无一人得分跨过5分门槛,而SU-01在面对同一个地狱题时,竟然冷静地拿下了全额满分。
SU-01是如何解出这道被称为“人类灭绝题”的USAMO P3的?它并没有像一般人类解题者那样去苦思冥想复杂的辅助线或是进行痛苦的角度追寻,而是展示了极为高超的全局抽象能力:它优雅地采用了复数方法,通过建立一套严密的代数解析框架,将单位圆、等边三角形旋转、复杂的切线约束条件统一合并成纯粹的代数计算。这种极具降维打击感的方法,巧妙避开了人工推演容易走入的死胡同。
除了这道几何奇迹,在IMO 2025 P2中,它通过高效的解析归约同样把几何问题降维成纯粹坐标计算;在数论与离散数学方向的USAMO P4(进位动态规划)和USAMO P6(将欧拉同余、Vieta jumping与斐波那契结构无缝粘连的宏伟数论证明)中,也都展现出了极富灵性且扎实的方法论。
而在同样硬核的物理奥赛(IPhO 2024/2025)战场,经过“推理时扩展”后的SU-01,也稳稳地拔高了分数,成功跨过了往届物理竞赛的金牌线。
结语:更高效的智能进化新通路
上海人工智能实验室SU-01的突破,最大的价值不在于给行业提供了一个新的刷榜分数,而是用真刀真枪的数据验证了一条往往被主流忽略的路线的可能性:AI的高精尖科学推理,其实根本不需要强行绑定万亿级大底座或是笨重的异构解释器。
以一个极具性价比例的30B中尺度优秀模型为起点,只要你能把行为约束、精准反馈惩奖以及推理阶段的“自我博弈”理顺,有限的算力预算就能以极高的质量兑现为严丝合缝的逻辑链条。这种轻巧却深邃的演进路径,或许正是未来通用科学智能走向大面积解耦、落地的真正前哨哨音。
学术界与开发者们如果对这一框架感兴趣,可以通过以下公开渠道关注该团队的全新进展:
- 论文地址:https://arxiv.org/abs/2605.13301
- 项目开源库:https://github.com/Simplified-Reasoning/SU-01

