人们期待 AI 在被提醒后能改对自己的答案,常规训练却给不出这种能力。ThinkTwice 把这件事直接写进训练目标。
发布重点
- 问题:常规强化学习只奖励第一次作答,模型从未练习过复查和修正自己。
- 方法:每道题先解一次,再把自己的输出喂回去修正;两步都只看最终对错。
- 发现:Qwen3-4B 在 AIME pass@4 上总计提升 +11.5pt,其中精修提供额外增益。
- 意义:不用 critic 模型、不用过程奖励、不用人工点评数据,自我精修可以直接训练。
继续阅读
研究页包含领域背景、方法、关键图表和论文入口;评测设置与合作研究,欢迎直接联系实验室。
