为什么重要
大语言模型在解数学题、规划任务时,常常会“思考”很长时间。但这带来两个问题:一是思考过程可能又臭又长,明明答案已经出来还继续啰嗦;二是无论简单还是复杂问题,都耗费固定的巨量计算,不经济也不聪明。最近的三篇论文,分别从不同角度让AI的推理过程变得更高效、更拟人。
一、让AI不再“想太多”
一句话: 训练AI时直接剪掉那些在正确答案出现后多余的“思维废话”,模型便学会快刀斩乱麻。
现状: 许多推理模型在强化学习训练中会产生一个奇怪的习惯——明明已经得出正确结果,却还要继续生成一大段无效推理,俗称“过度思考”。这既浪费计算资源,又可能引入新的错误。
新方法: 研究人员发现,训练数据里一些成功解题的样本,其实后半段就是无效的。他们提出“动态回滚编辑”技术,在训练过程中自动识别出正确答案首次出现的那个“顿悟时刻”,然后把后面的胡思乱想直接截断,只保留前面的有效部分。用这些干净数据继续训练,模型就逐渐改掉了絮叨的毛病。
对我意味着什么: 未来我们使用的AI助手,不再为了显得“努力”而长篇大论,回答更快、更直接,不浪费你的时间。
二、机器人学会“以终为始”地思考
一句话: 新模型让机器人先在脑中想象出任务完成后的画面,再反向推导出如何一步步操作。
现状: 大多数机器人大脑是“看到什么就做什么”,面对复杂的长步骤任务(如整理房间、组装零件)往往手足无措,因为它们不擅长规划。
新方法: 这名叫ThinkingVLA的模型,模仿了人类下棋时的思考方式——先琢磨最终要达到什么状态(比如桌子收拾干净的样子),然后脑补出中间的过渡画面,再根据这些脑补的画面生成具体的操作动作。整个过程中,文字推理和图像想象交织进行,互相校正。
对我意味着什么: 家用机器人离“眼里有活”更近了。未来它们不仅能听懂“把碗洗了”,还能自己琢磨如何挪开障碍物、按什么顺序清洗更高效,做事更靠谱。
三、把思考深度交给AI自己定
一句话: 不再硬性规定模型必须想几步,而是让它像解方程一样,一直想到“想通”为止。
现状: 传统的循环推理模型,都是转固定圈数就停止,对付难题圈数不够,简单问题又白白空转。
新方法: 基于Transformer的定点推理模型(FPRM),引入了一个巧妙机制:它不断将当前的“知识状态”带入网络加工,直到两次加工的输出几乎没差别,就像计算器上的数字停止跳动一样。这样,简单问题很快收敛,复杂问题自动多跑几轮,计算量完全按需分配。
对我意味着什么: 未来的AI系统能更聪明地分配脑力,复杂决策(如法律分析、战略规划)不会被死板的步数限制框死,而日常小事则秒回不卡顿。