被放大不等于可预测:思维模型推理行为研究

论文代表图:figure-01-p002-01

本文提出 Behavioral Lift 指标,在 15,282 条推理轨迹上发现思维模型放大的行为(自我纠正、假设检验、不确定性承认)并非与正确性最相关的行为,而置信度校准等未被放大的行为才是最强正确性信号。