亚马逊研究人员让人类和五款大模型在相同条件下回答一次,再阅读自己或他人的答案进行第二次修改。人类在三项任务上整体提高,多数模型却没有稳定获益;面对电影评分这类主观任务,五款模型的第二次结果全部变差。
被测试的模型包括Mistral Large、Llama 3.1 405B、Claude 3.5、GPT-4o和DeepSeek-R1。论文附录又测试GPT-5-mini和GPT-5.2,两款模型在算法题上的第二轮准确率分别下降0.42和1.07个百分点。
论文图1:参与者先独立回答,再看到上一轮答案,并选择保留或修改。
三类任务分别测试主观判断和客观纠错
实验框架HRF包含三项任务。IMDb-Rating要求根据影评预测评分,答案带有主观分布;MalAlgoQA要求识别带缺陷的算法推理;TISER测试社会推理。每个参与者都经历两轮,第二轮可以看到自己的答案、同类参与者的答案,或另一类参与者的答案。
研究使用信息增益衡量修改有没有让预测更接近目标。客观任务中,大模型通常接近零,效果类似在已有答案条件下重新采样;主观任务中信息增益为负,输出会向模型偏好的平均分布靠拢。
论文图2:MalAlgoQA多数结果接近零,IMDb-Rating所有模型均为负值。
Claude在电影评分任务上退步29.2%
IMDb-Rating用均方误差衡量,数值越低越好。Claude 3.5从1.594升到2.058,相对变化为-29.2%;GPT-4o从1.760升到2.021,变化为-14.8%;Llama 3.1 405B下降11.5%。五款模型无一改善。
人类平均误差从2.431降到1.997,提升17.8%;表现最好的三名人类标注者提升24.8%。人类第一轮未必强于模型,但第二轮更能判断何时应该改、应该改多少。
论文图7:人类修改频率较低,但修改命中率更高;模型更容易把正确答案改坏。
模型能识别错误,修正环节仍会失败
MalAlgoQA上,DeepSeek-R1自我反思后从94.8%升至95.3%,其他模型变化很小或略降。若研究人员直接告诉模型第一轮答案是错的,五款模型都能提高,错误恢复率为17.1%至41.3%,同时保留97.3%以上的正确答案。
这个对照说明,模型并非完全没有纠错能力。困难在于自主判断:它要先发现当前答案值得怀疑,再生成更好的替代答案。通用的“重新检查”指令没有可靠地完成这两个步骤。
论文图8:五款模型的第二轮输出都更靠近任务先验,人类没有出现同样的系统性移动。
不能据此否定所有反思型智能体
实验是受控的两轮标注任务,没有测试代码执行、浏览器工具、外部验证器或长时间智能体循环。能运行单元测试、查询数据库或调用独立评审器的系统,纠错条件与只读上一轮文本不同。
结果更适合约束产品宣传:增加一句“请再想一遍”不等于获得可靠自我纠错。涉及高风险决策时,应把错误检测和答案修复拆开测量,并用可验证证据决定是否接受第二轮修改。