上海 AI Lab / 清华 / 浙大等联合提出 TRICE:一套完整的工具集成推理(TIR)训练流水线,在 Qwen3 4B/30B 上达到 AIME 2025 的 96.7%/99.2%,开源 SOTA。
论文: Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning 作者: Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding†, Yu Cheng†, Yun Luo†, Ganqu Cui†(上海 AI Lab / 清华 / 浙大 / 北大 / 港中文 / 中科大 / 上交) 链接: https://arxiv.org/abs/2605.06326
一、核心问题
直接给较强的推理模型(如 Qwen3-Thinking)接上 Python 沙箱后,工具调用反而降低推理性能:Qwen3-30B-Thinking 在 BeyondAIME 上 tool/no-tool 的 Pass@4 从 68% 跌到 58%,且几乎不主动调用工具(平均 0 次调用)。模型只把代码执行器当成”最后验证一次答案”的 late-pass verifier,而不是融入推理循环。
论文研究的问题:如何让强思考模型学会真正的交错式工具推理,同时不牺牲其原生纯文本推理能力。
二、六项训练发现
T1: 教师模型选择——工具使用模式的可学习性比准确率更重要
| 教师 | 准确率 | 调用频率 | 模式 | 学生效果 |
|---|---|---|---|---|
| GPT-OSS-120B | 高 | 高频轻量(12.2次/题) | 短代码片段 + 复用沙箱状态 | 55.8% |
| MiniMax-M2.7 | 高 | 低频重载(5.1次/题) | 长自包含程序 | 17.8% |
高频轻量模式将计算分解为简单、单一步骤,4B 模型能可靠生成;低频重载需要更长自包含程序,自回归错误累积严重。
T2: 选择工具优势问题 (tool-advantaged problems) 作为 SFT 输入
比较教师模型在有/无工具下的 pass@k,选出差值大的问题——这些问题的难点在「计算结构」而非「概念洞见」。使用工具优势问题的轨迹训练,HMMT25 准确率从 69.6% → 75.0%。
T3: 混合 TIR + 纯文本轨迹,防止灾难性遗忘
纯 TIR 轨迹 SFT 后,纯文本推理严重退化:准确率 54.3% → 34.1%,截断率飙升到 44%。模型内化了「写代码→伪造输出→基于伪造结果推理」的循环。将纯文本轨迹混入训练集即可恢复:49.0% 准确率,截断率降至 19%。
T4: 过滤过长轨迹,防止学生模仿推理长度
将轨迹限制在 16K token 以内,HMMT25 反而从 78.3% → 82.5%。过长的轨迹让学生学到”长=好”的伪信号。
T5: SFT 训练呈”形式→实质→噪声”三阶段演化
- Stage 1(形式模仿): 工具调用频率陡升但不产生有效 TIR,性能下降
- Stage 2(学习实质): 调用稳定,工具提供有效中间证据,pass@1/pass@8 上升
- Stage 3(吸收噪声): 过拟合教师轨迹的噪声(如长度),训练-推理分布不匹配(KL 散度 5× 增大)
选择 RL 初始化 checkpoint 的标准: pass@k 最优 + 响应长度可控的点(而非训练 loss 最低)。
T6: TIR RL 必须 on-policy + Rollout Routing Replay (R3)
- 简单的 off-policy RLVR 在 TIR 场景下迅速崩塌
- 切换为 完全 on-policy 训练即可稳定
- 加上 R3(推理时路由分布回放训练)进一步提升稳定性
因为工具返回 token 天然是 off-policy 的,任何额外分布偏移都会放大不稳定性。
三、数据工程
SFT 数据管线
- 源数据: Nemotron-Math-v2(~347K 数学问题)
- 教师轨迹: GPT-OSS-120B 在有状态沙箱中生成一次轨迹,每问题保留 1 条
- 筛选: 保留工具优势问题(TIR 准确率高于纯文本准确率)
- 混合: TIR 轨迹 + 纯文本轨迹混合
- 长度过滤: 去除 >16K token 的轨迹
最终训练集:16K 条混合轨迹
RL 数据管线
从竞赛数学书 + 在线谜题站收集 ~20K 原始问题,经过结构化提取 + 去重 + 可验证性过滤 + 难度过滤(DeepSeek-Speciale 8 次采样 < 6 次正确),最终得到 4,325 道 IMO-level 问题。训练不直接奖励工具调用,而是通过高难度问题让模型学习何时使用工具有助于解题。
四、核心结果
竞赛数学表现 (Table 7)
| 模型 | Tool | AIME25 | HMMT25 | BeyondAIME | IMOAnswerBench | APEX25 |
|---|---|---|---|---|---|---|
| Qwen3-4B-Thinking | ✗ | 82.5 | 68.8 | 54.3 | 57.0 | 2.8 |
| TRICE-4B | ✓ | 96.7 | 86.7 | 71.3 | 68.9 | 13.9 |
| Qwen3-30B-A3B-Thinking | ✗ | 88.8 | 75.6 | 65.9 | 66.1 | 0.0 |
| TRICE-30B | ✓ | 99.2 | 92.5 | 82.5 | 80.3 | 16.7 |
效率对比
TIR 不仅更准,还更短:工具调用将冗长手算压缩为简洁可执行代码,TRICE-30B 响应长度显著短于同规模 TIR 模型(Nemotron-3-Nano、GLM-4.7-Flash)。
跨域泛化 (Table 9)
仅在数学数据上训练,泛化到:
- FrontierScience:+14.5%
- GPQA-Diamond:+4.4%
- LiveCodeBench:+11.7%
跨模型迁移
将方法应用于 GLM-4.7-Flash(已有原生 TIR),GLM-4.7-Flash w/ recipe 在各基准上进一步提升,表明这套训练方法可以进一步改善已有工具能力。
五、工具如何参与推理
1. 用代码探索规律、搜索和验证
对 TRICE-30B 解题轨迹分类(Figure 7):
- 经验发现 30.1% — 计算小实例猜规律
- 算法搜索 24.4% — 枚举组合空间 / DP
- 计算卸载 21.2% — 精确算术 / 符号操作
- 猜想验证 12.2%
代码更多用于”探索和发现”而非仅仅”算数”。
2. 工具可以补充模型的计算能力
TIR 解决的是 code-critical 算法搜索类问题——这些问题对纯文本缩放天然不友好(自然语言模拟迭代计算既低效又容易出错)。
超越更大纯文本模型 (Table 8)
TRICE-30B(带工具)超越 Qwen3-235B-Thinking 和 DeepSeek-V3.2-Thinking:
- HMMT25:92.5 vs 88.8 / 90.8
- BeyondAIME:82.5 vs 71.8 / 76.8
六、训练配置
| 参数 | Qwen3-4B | Qwen3-30B-A3B |
|---|---|---|
| SFT Epochs | 12 | 8 |
| SFT LR | 1×10⁻⁵ | 1×10⁻⁵ |
| SFT Max Seq | 16K | 16K |
| SFT 精度 | bf16 | bf16 |
| SFT GPU | 8×H200 | 8×H200 |
| RL 算法 | GSPO w/ TIS | GSPO w/ TIS |
| RL LR | 1×10⁻⁶ | 1×10⁻⁶ |
| RL Max Seq | 65K | 65K |
| RL Max Calls | 128 | 128 |
| RL Rollout N | 8 | 8 |
| RL GPU | 64×H200 | 64×H200 |
| 框架 | Slime | Slime |
| 额外 | Partial Rollout, Dynamic Sampling, MoE Freeze Router, R3 | 同左 |
七、案例分析
纯文本推理退化案例
TIR-only SFT 后,模型在无工具时写出完整 Python 代码,伪造执行输出,基于幻觉结果推理,最终陷入 1500+ 次无意义循环直到 token 耗尽。
Stage 1 形式模仿案例
早期 SFT checkpoint 频繁调用工具但无法诊断错误(错误函数名),陷入 import→错误调用→报错→重新 import 的死循环 80+ 次,随后退化到重复文本枚举。
TRICE 成功案例(Burnside 引理 + 项链计数)
模型通过文本推理识别 Burnside 框架,将每个 Fix(g) 计算卸载到沙箱,利用 stateful sandbox 跨调用复用变量,最后用轨道枚举做独立验证——9 次工具调用得到正确结果 88。
八、局限与未来
- 当前仅覆盖竞赛数学(有正确答案、可验证)
- 4B/30B 已表现不同训练动态,更大模型可能引入新稳定性问题
- 计划扩展到软件工程工作流、网页交互等更广泛 agentic 场景
- 模型和数据集即将开源