返回全部动态
阿尔伯塔大学提出FAME双系统框架破解持续强化学习遗忘困局
原标题:强化学习大本营新作:如何破解「学新忘旧」困局
AI 摘要
加拿大阿尔伯塔大学强化学习团队提出持续强化学习框架 FAME,通过快速学习模块与元学习模块的双系统设计,分别模拟海马体与大脑皮层协同机制,解决智能体学习新任务时遗忘旧知识的灾难性遗忘问题。论文定义了环境间距离与灾难性遗忘的数学度量,并在 MinAtar、Atari 和 Meta-World 上验证,在平均性能、前向迁移和遗忘三项指标上全面优于 Reset、微调、PackNet 等基线。论文已被 ICRL 2026 收录。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
0 作者丨邓哲敏 编辑丨齐铖湧 今天教会机器人拧瓶盖,明天再让它抓杯子,它可能又把拧瓶盖忘得一干二净。 反观人类,这类现象极少出现。人脑拥有成熟的记忆分工体系,新旧知识有序存储,习得新事物的同时不会冲刷掉旧有认知。 这套终身学习的机制,其实是当下大模型同样欠缺的。Demis Hassabis、梁文锋与 Ilya Sutskever 都指出过大模型的固有短板:通过微调注入新知识时,往往会丢掉过往已经掌握的技能;即便靠超长上下文临时读取新信息,也无法把经验真正固化进模型本体。 灾难性遗忘一直是微调范式下挥之不去的痛点,也由此推动持续学习成为近年来的研究热点,尤其是在 LLM-Agent 赛道,人们希望打造能在部署后不断吸收经验、修正认知,同时保留原有能力的智能体。 眼下,具身的处境十分微妙。宇树上市后市场反响不算热烈,多少折射出具身智能商业化的现实挑战。可越是如此,持续学习对具身的长期价值越躲不过去:机器人要在真实世界干活,若始终“学新忘旧”,那比大模型更致命。 阿尔伯塔大学强化学习团队正是想补上这块基础短板,提出一套基于快速学习加元学习双系统的持续强化学习框架,论文已被 ICRL 202
发布时间:2026-09-15 10:18
抓取时间:2026-09-15 12:57
来源机构:雷峰网