1651 字
8 分钟
教思考模型用工具推理:工具集成推理全流程方案

上海 AI Lab / 清华 / 浙大等联合提出 TRICE:一套完整的工具集成推理(TIR)训练流水线,在 Qwen3 4B/30B 上达到 AIME 2025 的 96.7%/99.2%,开源 SOTA。

论文: Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning 作者: Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding†, Yu Cheng†, Yun Luo†, Ganqu Cui†(上海 AI Lab / 清华 / 浙大 / 北大 / 港中文 / 中科大 / 上交) 链接: https://arxiv.org/abs/2605.06326


一、核心问题#

直接给较强的推理模型(如 Qwen3-Thinking)接上 Python 沙箱后,工具调用反而降低推理性能:Qwen3-30B-Thinking 在 BeyondAIME 上 tool/no-tool 的 Pass@4 从 68% 跌到 58%,且几乎不主动调用工具(平均 0 次调用)。模型只把代码执行器当成”最后验证一次答案”的 late-pass verifier,而不是融入推理循环。

论文研究的问题:如何让强思考模型学会真正的交错式工具推理,同时不牺牲其原生纯文本推理能力。


二、六项训练发现#

T1: 教师模型选择——工具使用模式的可学习性比准确率更重要#

教师准确率调用频率模式学生效果
GPT-OSS-120B高高频轻量(12.2次/题)短代码片段 + 复用沙箱状态55.8%
MiniMax-M2.7高低频重载(5.1次/题)长自包含程序17.8%

高频轻量模式将计算分解为简单、单一步骤,4B 模型能可靠生成;低频重载需要更长自包含程序,自回归错误累积严重。

T2: 选择工具优势问题 (tool-advantaged problems) 作为 SFT 输入#

比较教师模型在有/无工具下的 pass@k,选出差值大的问题——这些问题的难点在「计算结构」而非「概念洞见」。使用工具优势问题的轨迹训练,HMMT25 准确率从 69.6% → 75.0%。

T3: 混合 TIR + 纯文本轨迹,防止灾难性遗忘#

纯 TIR 轨迹 SFT 后,纯文本推理严重退化:准确率 54.3% → 34.1%,截断率飙升到 44%。模型内化了「写代码→伪造输出→基于伪造结果推理」的循环。将纯文本轨迹混入训练集即可恢复:49.0% 准确率,截断率降至 19%。

T4: 过滤过长轨迹,防止学生模仿推理长度#

将轨迹限制在 16K token 以内,HMMT25 反而从 78.3% → 82.5%。过长的轨迹让学生学到”长=好”的伪信号。

T5: SFT 训练呈”形式→实质→噪声”三阶段演化#

  • Stage 1(形式模仿): 工具调用频率陡升但不产生有效 TIR,性能下降
  • Stage 2(学习实质): 调用稳定,工具提供有效中间证据,pass@1/pass@8 上升
  • Stage 3(吸收噪声): 过拟合教师轨迹的噪声(如长度),训练-推理分布不匹配(KL 散度 5× 增大)

选择 RL 初始化 checkpoint 的标准: pass@k 最优 + 响应长度可控的点(而非训练 loss 最低)。

T6: TIR RL 必须 on-policy + Rollout Routing Replay (R3)#

  • 简单的 off-policy RLVR 在 TIR 场景下迅速崩塌
  • 切换为 完全 on-policy 训练即可稳定
  • 加上 R3(推理时路由分布回放训练)进一步提升稳定性

因为工具返回 token 天然是 off-policy 的,任何额外分布偏移都会放大不稳定性。


三、数据工程#

SFT 数据管线#

  1. 源数据: Nemotron-Math-v2(~347K 数学问题)
  2. 教师轨迹: GPT-OSS-120B 在有状态沙箱中生成一次轨迹,每问题保留 1 条
  3. 筛选: 保留工具优势问题(TIR 准确率高于纯文本准确率)
  4. 混合: TIR 轨迹 + 纯文本轨迹混合
  5. 长度过滤: 去除 >16K token 的轨迹

最终训练集:16K 条混合轨迹

RL 数据管线#

从竞赛数学书 + 在线谜题站收集 ~20K 原始问题,经过结构化提取 + 去重 + 可验证性过滤 + 难度过滤(DeepSeek-Speciale 8 次采样 < 6 次正确),最终得到 4,325 道 IMO-level 问题。训练不直接奖励工具调用,而是通过高难度问题让模型学习何时使用工具有助于解题。


四、核心结果#

竞赛数学表现 (Table 7)#

模型ToolAIME25HMMT25BeyondAIMEIMOAnswerBenchAPEX25
Qwen3-4B-Thinking✗82.568.854.357.02.8
TRICE-4B✓96.786.771.368.913.9
Qwen3-30B-A3B-Thinking✗88.875.665.966.10.0
TRICE-30B✓99.292.582.580.316.7

效率对比#

TIR 不仅更准,还更短:工具调用将冗长手算压缩为简洁可执行代码,TRICE-30B 响应长度显著短于同规模 TIR 模型(Nemotron-3-Nano、GLM-4.7-Flash)。

跨域泛化 (Table 9)#

仅在数学数据上训练,泛化到:

  • FrontierScience:+14.5%
  • GPQA-Diamond:+4.4%
  • LiveCodeBench:+11.7%

跨模型迁移#

将方法应用于 GLM-4.7-Flash(已有原生 TIR),GLM-4.7-Flash w/ recipe 在各基准上进一步提升,表明这套训练方法可以进一步改善已有工具能力。


五、工具如何参与推理#

1. 用代码探索规律、搜索和验证#

对 TRICE-30B 解题轨迹分类(Figure 7):

  • 经验发现 30.1% — 计算小实例猜规律
  • 算法搜索 24.4% — 枚举组合空间 / DP
  • 计算卸载 21.2% — 精确算术 / 符号操作
  • 猜想验证 12.2%

代码更多用于”探索和发现”而非仅仅”算数”。

2. 工具可以补充模型的计算能力#

TIR 解决的是 code-critical 算法搜索类问题——这些问题对纯文本缩放天然不友好(自然语言模拟迭代计算既低效又容易出错)。

超越更大纯文本模型 (Table 8)#

TRICE-30B(带工具)超越 Qwen3-235B-Thinking 和 DeepSeek-V3.2-Thinking:

  • HMMT25:92.5 vs 88.8 / 90.8
  • BeyondAIME:82.5 vs 71.8 / 76.8

六、训练配置#

参数Qwen3-4BQwen3-30B-A3B
SFT Epochs128
SFT LR1×10⁻⁵1×10⁻⁵
SFT Max Seq16K16K
SFT 精度bf16bf16
SFT GPU8×H2008×H200
RL 算法GSPO w/ TISGSPO w/ TIS
RL LR1×10⁻⁶1×10⁻⁶
RL Max Seq65K65K
RL Max Calls128128
RL Rollout N88
RL GPU64×H20064×H200
框架SlimeSlime
额外Partial Rollout, Dynamic Sampling, MoE Freeze Router, R3同左

七、案例分析#

纯文本推理退化案例#

TIR-only SFT 后,模型在无工具时写出完整 Python 代码,伪造执行输出,基于幻觉结果推理,最终陷入 1500+ 次无意义循环直到 token 耗尽。

Stage 1 形式模仿案例#

早期 SFT checkpoint 频繁调用工具但无法诊断错误(错误函数名),陷入 import→错误调用→报错→重新 import 的死循环 80+ 次,随后退化到重复文本枚举。

TRICE 成功案例(Burnside 引理 + 项链计数)#

模型通过文本推理识别 Burnside 框架,将每个 Fix(g) 计算卸载到沙箱,利用 stateful sandbox 跨调用复用变量,最后用轨道枚举做独立验证——9 次工具调用得到正确结果 88。


八、局限与未来#

  • 当前仅覆盖竞赛数学(有正确答案、可验证)
  • 4B/30B 已表现不同训练动态,更大模型可能引入新稳定性问题
  • 计划扩展到软件工程工作流、网页交互等更广泛 agentic 场景
  • 模型和数据集即将开源
教思考模型用工具推理:工具集成推理全流程方案
https://blog.lpkt.cn/posts/papers/teaching-thinking-models-tir-recipe/
作者
lollipopkit
发布于
2026-05-09
许可协议
CC BY-NC-SA 4.0