告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答
8026点击    2026-07-25 11:37

生成式奖励模型(GRM)是当前LLM推理增强的重要方向——通过Chain-of-Thought(CoT)让模型在输出答案之前先走一遍推理链,从而提升复杂问题的准确率。


这个方法在数学推理、代码生成等领域效果显著,但有个明显的问题:无论问题简单还是复杂,GRM一律要求模型走完整条CoT推理链。


比如问“1+1=?”也要先“Let’s think step by step”,这在计算上是巨大的浪费。


腾讯混元团队敏锐地抓住了这个痛点:既然模型在推理时会表现出不确定性波动,为什么不反过来用这种不确定性来判断“这个问题值不值得深想”?


E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


发表:ACL 2026(Pages 23302–23319)


背景


场景与痛点


GRM的基本流程是:给模型喂一个prompt(比如“Evaluate the response:…”),让模型先输出一段推理链,然后再给出评分判断。CoT推理链越长、质量越高,最终判断越准——这已经是RewardBench榜单上的共识。


但两个核心问题一直没有解决:


  • 问题一:CoT对简单输入是浪费。


现有GRM把CoT当“标配”,对每个输入都走一遍推理链。RM-Bench中约一半的prompt其实不需要复杂推理,直接判断就够。强制CoT反而引入不必要的token开销和延迟。


  • 问题二:投票制评分太粗糙。


当前主流GRM对CoT输出的评估依赖“多采样后投票”——采样N条推理路径,选出现次数最多的答案。这种机制的问题在于:它只看最终答案,不评价推理路径本身的质量。一条答对的推理路径可能逻辑全是错的(蒙对的),但投票机制无法区分。


E-GRM的答案:不确定性决定是否需要CoT,混合损失判别评分器替代投票。


论文做了什么


  • Dynamic CoT Triggering:M次并行解码→计算答案一致性→一致性高就跳过CoT
  • Discriminative Scorer:混合Huber回归+Hinge排序损失,细粒度评估推理路径质量
  • 两阶段训练:SFT混合短答/长CoT→GRPO偏好优化,让模型同时学会“快答”和“深想”


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


E-GRM整体框架


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


动态CoT触发与判别评分框架


技术方案


动态CoT触发(Dynamic CoT Triggering)


这是E-GRM最核心的创新:用模型自身的输出一致性来判断输入复杂度。


具体流程:


输入Prompt→M次并行解码(不同温度)→统计答案分布→计算Consensus

    ↓

Consensus0.8

    →YES:直接输出答案(跳过CoT,省时间)

    →NO:触发CoT+判别评分(深想一下)


M次并行解码(M=5):


对同一个prompt,用不同温度参数(T∈{0,0.3,0.7,1.0})解码5次:


  • 温度低(T=0):确定性输出,模型给出最“自信”的答案
  • 温度高(T=1.0):随机性强,可能跑偏


如果这5次解码的答案高度一致(比如5次都选了同一选项),说明模型对这个输入“很有把握”——这是一个简单问题,不需要深度推理。反之,如果5次答案五花八门,说明模型自己也拿不准——这是一个复杂问题,值得触发CoT。


一致性计算公式:


Consensus(x)=max(y)Count(y)/M


即:出现最多的答案的次数÷总采样次数。取值范围[0.2,1.0]。


  • =1.0:5次全一致
  • =0.2:5次全不同(最不一致)


阈值τ的作用:


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


这种不确定性估计不需要任何外部模型或手工特征——完全依赖模型自身的输出分布。


判别评分器(Discriminative Scorer)


当Consensus<τ时,触发CoT推理。但CoT生成了多条推理路径,怎么选最好的?


传统方法:投票。E-GRM用的是轻量级判别评分器+混合损失函数来给每条推理路径打分。


混合损失(Hybrid Loss):


L_hybrid=(1−α)×Huber_loss(y_pred,y_true)+α×Hinge_loss(pairs)


两个分量各有分工:


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


α=0.3:回归占70%、排序占30%。


类比理解:Huber负责“打分准不准”,Hinge负责“排名对不对”。两者合在一起,确保评分器不仅能给每个推理路径一个准确的分数,还能保证分数之间的相对大小是正确的。


打分流程:


N条CoT路径→特征提取(长度/步数/关键性词汇等)→轻量FFN→[01]分数→取最高分


评分器结构极其简单(一个2层MLP),推理开销可以忽略不计。


两阶段训练


阶段一:SFT混合训练


E-GRM不是一个“推理时就切模式”的方法——它在训练阶段就教会模型两种回答风格:


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


这样模型在推理时可以根据输入复杂度灵活切换:低不确定性→短答模式;高不确定性→CoT模式。


阶段二:GRPO偏好优化


在SFT基础之上,用成对偏好数据进一步微调评分器:


  • 对同一个prompt生成多条推理路径
  • 用判别评分器打分
  • 取“高分路径×低分路径”作为偏好对
  • 用混合损失(Huber+Hinge)进一步优化


GRPO的加入让模型不仅会“快答”和“深想”,还能在深度推理场景中选出最高质量的推理链。


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


GRPO公式对比


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


配对奖励函数公式


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


扩展GRPO优化目标


推理时的完整流程


输入Prompt

    ↓

M=5次并行解码(变温/变Top-p)

    ↓

计算Consensus

    ↓

┌───Consensus≥τ(0.8)──→直接输出答案(~58%样本)

└───Consensus<τ(0.8)──→CoT生成→判别评分→取最优→输出


整个过程的关键词是无外部依赖——不需要传统分类器判断复杂度、不需要额外的reward model、不需要手工规则。一切信号来自模型自身。


实验结果


效率:延迟降低62%


以RM-Bench上全CoT基线为100%:


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


延迟降到原来的1/3以下,同时准确率还上升了——说明很多简单输入不仅不需要CoT,走了CoT反而可能引入推理噪声。


准确率:三个基准全线上涨


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


CoT触发率


42%的样本被路由到CoT,58%的样本直接输出。这58%的“直答”样本平均延迟只有CoT模式的约1/5。


性能vs阈值(τ)的权衡


告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答


τ=0.8是效率和精度的最佳平衡点。值得注意:τ=0.9时精度反而低于τ=0.8,说明有些输入走CoT反而效果更差(验证了“过推理”或“推理噪声”的存在)。


项目价值


学术价值


  • 首次将模型内部不确定性引入生成式奖励建模,提出了一种通用的、无需外部信号的CoT选择性触发机制
  • 混合Huber+Hinge损失提供了一种比投票更精细的推理路径评估方式


实践指导意义


  • “磨刀不误砍柴工”在此不成立。不是所有任务都需要推理链。对简单问题走CoT反而增加噪声和延迟,E-GRM证明了“快答”有时比“深想”更有效。
  • 并行解码是一种便宜的复杂度探针。不需要训练一个单独的分类器来预测“是否需要CoT”,跑几遍M=5的快速采样就够了。
  • 混合损失比纯回归或纯排序都好。Huber保绝对精度、Hinge保相对排序,两者缺一不可。
  • SFT混合训练很关键。如果在训练时只用CoT风格数据,推理时就算模型“想”直接回答,也输出不好短风格答案。
  • GRPO是点睛之笔,但不是必须。纯SFT已经能取得不错的效率提升;GRPO在排序精度上提供+0.5%~1%的增量,适合对精度有极致要求的场景。


作者团队


腾讯混元大模型团队(Tencent Hunyuan Team)&新南威尔士大学(UNSW),14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。


该工作入选ACL 2026


同期另一篇工作:同一团队在ACL 2026主会发表了Why Supervised Fine-Tuning Fails to Learn,系统性揭示了SFT训练中15.3%样本“假学会”的问题及其五大根因。详见GitHub。


论文(arXiv):https://arxiv.org/abs/2604.10072

论文(ACL Anthology):https://aclanthology.org/2026.findings-acl.1167/

代码(GitHub):https://github.com/xccc-8071/reason-only-when-needed


文章来自于微信公众号 “量子位”,作者 “量子位”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0