多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

大模型困于局部最优,持续学习或成下一代AI关键

大模型困于局部最优,持续学习或成下一代AI关键 Rich Sutton最近的一个判断在AI圈里引起了不小的讨论大模型可能正被困在“局部最优”真正的智能必须学会持续学习。这个观点从强化学习之父嘴里说出来分量和普通技术评论不太一样。如果你正在做大模型应用开发或者研究强化学习算法这篇文章值得认真读完。先说我对这个判断的理解Sutton不是在否定大模型的成就而是在指出一个更深层的结构性问题——当前大模型的学习范式本质上是一次性的训练完成之后模型就凝固了。人类智能不是这样的。人每天醒来都在用新经验调整自己的认知遇到新任务时能快速适应不会把昨天学到的东西全部忘掉。这篇文章会从三个层面展开第一为什么说大模型处于“局部最优”这个判断的推理逻辑是什么第二持续学习在技术上到底是什么和传统微调、上下文学习有什么区别第三对做AI应用开发和算法研究的读者来说这个判断意味着什么有哪些值得关注的技术方向。1. 这篇文章真正要解决的问题先从一个具体的痛点说起。很多做AI应用的团队都会遇到这种情况模型刚上线的时候效果很好但跑了一个月之后用户的问题开始变得奇怪起来模型开始答非所问。传统的解决办法无非两条路一条是把新的对话数据捞回来做微调另一条是升级到参数更大的模型。但这两条路都有问题。微调需要标注数据、需要算力、需要评估回归而且经常出现“学了新知识忘了旧知识”的灾难性遗忘。换大模型更直接但成本成倍增长而且换完之后过几个月还是会遇到同样的问题。这个问题的本质是什么是模型通过学习获得的知识是静态的。你训练它的那一刻它的世界观就被冻结了。你后续做的所有“更新”本质上都是在一个已经冻结的系统上打补丁。Sutton说的“局部最优”就是这个意思。当前大模型的能力曲线看起来很高但它是朝着“一次性学习”这个方向优化出来的局部最高点。这个方向上已经很难再有质的突破。真正的突破可能需要换成另一条优化曲线——一条让系统能无限学习、持续演化、与真实环境不断互动的曲线。这篇文章适合三类读者正在做大模型应用开发被数据更新和模型迭代问题困扰的工程师研究强化学习、持续学习方向的算法同学想了解这些技术和大模型的结合点对AI技术趋势感兴趣的读者想理解“后大模型时代”技术走向的判断依据2. 大模型的“局部最优”Sutton判断的核心逻辑要理解Sutton的判断先得理解“局部最优”和“全局最优”这两个概念的区别。在优化理论里局部最优是指一个解在周围的小范围内已经是最好的了但放到整个解空间里还有更好的区域存在只是你目前看不到、走不到。全局最优则是整个解空间里最好的解。Sutton是把整个AI发展路径看成了一次巨大的优化过程。当前大模型的路线——海量数据预训练、人类反馈对齐、超大参数规模——在这条路线上已经做到了极致。GPT系列、Claude、Gemini等模型展现出的能力就是这条路线上的“局部最优”解。但问题在于这条路线的优化目标和真正的智能目标之间存在着根本偏差。再回到Sutton的著名文章“痛苦教训”The Bitter Lesson。那篇文章的核心观点是70年来AI研究最大的教训就是靠人类手工设计的知识最终都会被大规模的算力和搜索方法打败。1990年代的专家系统和手工特征工程输给了机器学习2010年代的人工设计网络结构输给了大规模深度学习。从这个逻辑推导下来当前大模型的大规模预训练是“用算力代替手工设计”的又一次胜利。但Sutton认为这个胜利也不该被当成终点。下一次突破依赖的是更通用的学习机制尤其是让智能体在与环境的持续交互中自主发现规律而不是继续靠人类批量制造静态的、预先标注好的数据。顺着这个思路看当前大模型的技术路线会发现几个明显的结构性问题。第一个问题是训练目标与实际应用的错位。大模型的训练目标是预测下一个token本质上是在“模仿”训练数据的统计规律。你在部署一个客服机器人的时候你希望的是它能理解业务逻辑、能应对没见过的新问题、能从错误反馈中改进。但训练目标从来没有直接优化过这些能力。第二个问题是知识的固化。模型一旦完成训练所有知识就被冻结在权重里。你让模型“学会”一个新领域的规则只能通过微调让它把新知识“覆盖”进去或者通过RAG在推理时临时拼接外部信息。这两种方式都不是真正的持续学习——一种是修改旧系统一种是绕过旧系统系统的核心学习能力并没有提升。第三个问题是缺乏真实反馈闭环。人类学习最有效的方式是行动、获得反馈、调整策略。大模型在训练阶段基本没有这个机制。RLHF虽然在形式上引入了奖励模型但它本质上是人类偏好的静态映射而不是模型与真实世界互动产生的动态奖励信号。这三个结构性问题的叠加构成了Sutton所说的“局部最优”——当前范式在最优化自身的目标函数上已经很强但那个目标函数本身和真正的智能不是一回事。3. 从“痛苦教训”到持续学习Sutton主张的演变要理解Sutton说“AI必须学会持续学习”这句话的分量需要把这个判断放回到他近三十年的研究脉络里看。这不是一个突然冒出来的观点而是长期思考的延续。Sutton在强化学习领域的地位不需要多介绍。他和Barto合著的《Reinforcement Learning: An Introduction》是公认的强化学习经典教材。他的研究重心一直没有离开过“智能体如何从与环境的交互中学习”这个核心问题。“痛苦教训”那篇文章把第一层意思说清楚了不要手工设计复杂机制要让学习算法从数据和计算中自己找规律。到了2019年之后随着大模型能力越来越强他的关注点自然地转向了第二层问题这些“从数据中学出来”的系统要如何获得持续更新的能力。一个值得注意的背景是Sutton长期关注在线学习和时序差分学习Temporal Difference LearningTD Learning。这种学习范式和当前大模型的批处理训练有本质区别。TD学习的特点是边行动边学习每一步都在用新的经验更新自己的价值估计不需要把所有历史数据重新过一遍。这就是持续学习的核心思想学习不是一个“训练-部署”的两阶段过程而是部署之后还在继续发生的实时过程。模型在使用过程中不断吸收新信息、调整策略、优化行为。从技术史的角度看这个主张是对“学习”这个概念的一次回归。在早期AI研究里学习系统被设计成和环境紧密耦合的。后来深度学习的成功改变了行业对学习的理解——学习变成了一个离线的、大规模计算的过程你收集海量数据用显卡集群跑几天得到一组权重然后部署上线。Sutton的持续学习主张本质上是想重新夺回“在线”这个维度。他可能认为强化学习的真正优势不在于现有的游戏AI和机器人控制而在于提供了一个思考“智能体如何与环境持续互动”的完整框架。4. 持续学习的技术内涵概念与核心挑战持续学习Continual Learning在机器学习领域已经有比较明确的定义。它研究的是模型在面临新任务、新数据时如何在不彻底遗忘旧知识的前提下持续更新能力。围绕持续学习有几个核心问题值得逐一拆开看因为它们恰恰是理解Sutton判断的关键。第一个核心问题是“稳定性-可塑性困境”。稳定性指的是模型维持已有知识的能力可塑性指的是模型学习新知识的能力。理想状态下两者兼得但实际训练中这是一对天然矛盾。要吸收新知识权重就要发生较大改变权重改变幅度一大旧知识就被破坏了。这个矛盾在经典的监督学习和现在的预训练模型里都普遍存在。第二个核心问题是灾难性遗忘。这是持续学习中被研究得最多的现象。一个模型在任务A上训练到收敛再去训练任务B之后模型在任务A上的表现会大幅下降。原因是神经网络在任务B的梯度更新中把对任务A有用的特征表示给覆盖了。第三个核心问题是数据分布的漂移。真实世界的数据不是固定不变的。用户的提问风格在变业务规则在变知识在更新。离线训练假设“训练数据和测试数据同分布”在长周期的真实场景中基本不成立。持续学习需要让模型主动跟踪分布变化而不是被动地接受分布偏差带来的效果衰减。从强化学习的视角看持续学习还有一个额外维度策略与环境的共同演化。智能体在学习的同时它的行为也在改变环境反馈的分布。这比被动的监督学习更复杂但更接近人类学习的真实状态。当前研究界在持续学习方向上探索了几条技术路径。路径一是记忆回放也就是在训练新任务时把旧任务的样本混入训练集一起学习。这个方法简单有效但依赖历史样本的存取对大模型的提示词记忆机制而言相当于在推理层面不断拼接历史上下文。路径二是正则化约束通过对权重的更新施加约束来减少对重要旧知识的破坏。代表算法如EWCElastic Weight Consolidation其思路是识别对旧任务最重要的参数在更新时限制这些参数的变化幅度。路径三是参数隔离与扩展为新任务动态新增参数模块旧模块保持不动。渐进式网络和专家混合模型都属于这一类思路。在LLM场景里LoRA本身就有参数隔离的特征——你为某个新任务训练了一组低秩适配器原模型权重没变。路径四是基于强化学习的方法。智能体不是在静态的数据集上学习而是在环境中通过试错获得奖励信号来调整策略。这种学习方式天然就是持续的——环境在变策略在跟着变没有“训练结束”的时刻。技术背景说完再看Sutton判断的微妙之处。他说的“AI必须学会持续学习”可能不只是指让当前的大模型在推理时读取更多上下文或者定期做增量微调。他可能是在指向一种范式层面的转变让智能体在真实环境中边行动边学习用不断产生的真实经验去驱动自身能力的持续增长。这种转变一旦发生AI的评估方式、训练方式、部署方式都会发生根本性的变化。5. 当前大模型应对“持续变化”的三种方案与局限现在实际工程领域已经有一些试图让大模型应对持续变化的方案它们各有各的价值但也都没有真正实现“持续学习”。搞清楚这些方案的边界才能理解Sutton判断的针对性到底在哪里。第一种方案是上下文学习也就是把新信息写进系统提示词让模型在推理时“临时”拥有这些知识。ChatGPT的联网搜索、各类AI助手的插件机制本质上都是这个模式。你不需要改模型权重把外部信息塞进上下文就行。这种方案的优点是即插即用、即时生效、没有训练成本。但天花板非常明显上下文窗口有限放不下持续增长的知识量每次调用都要重复输入大段上下文推理成本和延迟都在上升而且模型只是在“借用”信息它没有真正把知识内化到自己的认知结构里。你关掉对话窗口模型还是原来的模型。第二种方案是微调包括全参微调和LoRA这类参数高效微调。LoRA的优点是只训练一小部分低秩矩阵参数成本远低于全参微调在很多垂直领域任务上都有效果提升。但微调同样不等同于持续学习。它本质上还是离线批处理收集一个固定数据集训练一次评估一次部署。下一次数据变了又要重新来一遍。而且你每做一次微调都要面对灾难性遗忘风险和保护原有能力的平衡问题。微调周期再短它也是“离散事件”而不是“持续过程”。第三种方案是RAG检索增强生成。这个方案解决了知识更新的时效性通过外挂向量数据库把最新资料提供给模型。不重新训练模型知识就更新了。RAG的问题在于它把“知识”和“认知”割裂了。检索到的文档只是模型可以参考的外部素材模型本身的推理能力、判断能力、对新问题的泛化能力没有因为检索而提升。当问题需要多步推理、需要把检索到的信息和模型的内部知识深度融合时RAG的表现并不稳定。从这三种方案的局限看Sutton的批评是有力的。当前大模型处理变化的方式本质上都是“绕开变化”要么临时抄信息要么定期打补丁。没有一种方案把“持续适应变化”作为模型的核心能力来设计。6. 强化学习框架下的持续学习几个关键技术方向如果顺着Sutton的判断往前走真正值得关注的是强化学习框架下的持续学习技术。这个方向目前还不是主流但已经出现了几个值得留意的技术路径。第一个值得关注的是基于模型的强化学习。主流深度强化学习算法分两种无模型方法直接根据环境反馈学习策略样本效率很低打一局游戏要试错上万次。基于模型的方法先学习一个环境动态模型再在这个模型里进行想象和规划大幅提高样本效率。这一点对持续学习的意义很直接。真实环境中不可能有无限试错机会。一个能学习“环境规律”的系统可以把新经验快速泛化到类似场景而不需要每个新情况都从头开始。第二个方向是世界模型。从材料看Sutton一直强调从与环境交互中获取知识世界模型就是这个思想的技术实现路径。世界模型构建了一个简化外部环境的内部表示使用智能体像人类一样对“如果做了X会怎样”进行模拟预测。世界模型与持续学习的连接也在这里真实环境在变世界模型本身就应该持续更新。当模型发现预测出现偏差就说明环境变了系统就会主动去更新自己的世界模型。这种机制是当前大模型完全没有的能力。第三个方向是离线强化学习。这个方向解决的是“强化学习依赖在线交互”这个工程瓶颈。在很多真实场景里你只能从既有数据中学习无法边做边学。离线强化学习专门研究如何从固定数据集里学到好策略算法代表包括IQLImplicit Q-Learning等。具体的思路是在IQL中通过估计数据集里的行动价值分布来学习策略而不是对所有未尝试过的行动做乐观估计。这个技术的价值在于它为强化学习类算法引入真实业务场景提供了路径——先离线学习历史经验再逐步向在线策略演化。第四个方向是分层强化学习。持续学习的场景往往是复杂任务的长周期决策问题。分层强化学习的核心思想是把一个大任务分解成若干子任务上层策略选择子目标下层策略执行具体动作。这种结构天然适合持续学习的场景。这个技术方向值得关注的原因在于当环境变化时变更的是部分子策略而不是整个策略体系。7. 对开发者的启示现在能做什么Sutton的判断是战略层面的但它的影响会传导到工程层。作为开发者或研究者现在能做什么这里给几个明确的建议。第一别迷信“一次性完美模型”。如果项目是长期运行的从一开始就用工程机制把模型设计成“可迭代”的结构。把评估体系建好把数据回流管道建好把模型版本管理好不要等到效果崩了再开始救火。第二关注在线再训练的工程链路。目前环境里强化学习类算法在在线持续迭代场景已经有了很多实践案例比如推荐系统中的在线学习框架、机器人控制中的Sim2Real迁移方案。在CV或NLP任务中也可以通过在线数据回流和增量训练框架来模拟“持续学习”的闭环。第三把RAG和微调当手段而不是终点。RAG解决时效性问题很好用微调可以让模型更贴近垂直领域但它们都只是“让系统跟上变化”的辅助手段。选择时先搞清楚你的项目到底缺的是知识更新还是行为调整。知识更新优先RAG行为调整才需要考虑微调或强化学习类算法方法。第四在人才培养上保持跨学科视野。持续学习恰好位于多领域交叉位置。如果你带团队或者自己规划技术成长路线建议同时关注强化学习、在线学习、元学习这几个方向的进展因为它们已经有很多理论储备可以被持续学习借鉴。第五形成“评估持续创新能力”的意识。现在评估模型能力基本都是跑静态基准测试给一批固定题目对比分数。如果未来AI系统真的要持续学习静态评测就不够用了。需要的是动态评测比如新任务出现后系统的适应速度有多快。8. 常见误区持续学习不是记忆更多数据围绕持续学习这个方向CSDN评论区里常见的几种误区值得单独说一下。误区一“持续学习就是让模型记住更多东西”。如果只是记忆更多RAG已经做到了把你的知识库无限扩大就行。但持续学习的核心是让模型获得更新知识结构的能力不只是让它们能被检索到。误区二“持续学习和微调是一回事”。微调是在固定数据集上推进模型朝一个确定目标偏移持续学习是希望模型在开放环境中无限适应。工程上看起来都是“更新模型”但目标函数完全不同。微调模型更新时目标就是当前这批数据持续学习每次更新都要考虑对旧能力的保护和对未来能力的预留。误区三“有了大模型就不用强化学习了”。这个把反对意见理解反了。Sutton强调强化学习的研究传统本身就是对齐大模型和智能这个终极目标的关键路径。强化学习不会因为大模型而失去价值恰恰会成为下一阶段AI演化的核心机制。误区四“持续学习还太远跟我们无关”。从工程上看其实没那么远。任何长期运行的系统都面临数据分布漂移的问题。你在为一个业务系统做大模型应用最迟三个月后就会遇到知识更新和效果衰减的挑战。持续学习要解决的是这些问题也是你现在就可以行动的技术方向。9. 总结与后续思考回到Sutton的判断本身。他认为大模型被困在局部最优不是否定大模型的成果而是在推动AI研究走向下一个阶段。当前的大模型范式确实在“从静态数据中学习”这个方向上已经接近极限要真正逼近AGI级别的能力必须让系统具备持续学习能力——在与环境的交互中不断吸收经验、调整策略、演化能力。这个判断的技术基础是扎实的。从强化学习的在线交互、基于模型的规划、世界模型构建到离线强化学习带来的实际应用路径这些方向共同构成了“持续学习”的技术底座。大模型已经在语言理解、知识问答等任务上证明了“规模数据”的力量而下一代突破的钥匙很可能就在于如何让规模化的智能真正跑起来、学起来。如果你正在做AI方向的开发或研究Sutton的判断解释了不少你正在遇到的工程困境。静态模型应对动态环境的结构性矛盾会长期存在。期待在评论区看到你的实践心得一起讨论这个方向上的具体问题。
返回列表