组合持续学习机制实现长时程记忆
该论文提出「长时程记忆」设定:模型通过持续监督微调依次学习100个问答任务,且不保留旧训练样本、推理时也不提供任务标识。作者将数据锚、函数锚、权重锚与合并式低秩更新(merged LoRA)组合,并构建三个100任务数据集,用任务级逐次减半搜索与因子实验评估。最佳方法在三个数据集上均进入前三,将平均最终保留率从朴素顺序微调的1.2%提升至34.9%,约28倍
技术方向 · 长期记忆、上下文管理与会话状态 · 共 113 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文提出「长时程记忆」设定:模型通过持续监督微调依次学习100个问答任务,且不保留旧训练样本、推理时也不提供任务标识。作者将数据锚、函数锚、权重锚与合并式低秩更新(merged LoRA)组合,并构建三个100任务数据集,用任务级逐次减半搜索与因子实验评估。最佳方法在三个数据集上均进入前三,将平均最终保留率从朴素顺序微调的1.2%提升至34.9%,约28倍
NVIDIA 技术博客对比了稠密模型与 MoE(混合专家)架构,解释 MoE 如何让 30B 参数模型每 token 仅激活约 3B 参数,并仍利用大模型容量。文章以 Nemotron 3.5 Lightning 为例,说明 MoE 通过路由网络为每个 token 选择部分专家 FFN,注意力与嵌入权重仍全量参与。核心结论是 MoE 将显存成本(总参数)与计
Mastra 发布更新,新增 Studio Workflow Builder 后端,可通过 workflowBuilder 选项启用编辑器自有的 agent 来编写持久化工作流定义,并暴露受权限控制的服务端端点。同时推出 @mastra/connect 包,将平台集成连接转为 agent 工具,由平台代理注入凭证并刷新令牌,应用无需处理密钥。此外还支持线程所
研究者提出 BudgetBench,一个以每次调用输入 token 预算为自变量的记忆策略评估协议与参考工具,在 2K 至 32K 预算下测量质量、预算利用率、延迟和预算违规率。初步实验使用本地 qwen2.5:1.5b、托管的 Qwen3 30B-A3B 以及 LongMemEval 研究,暴露了预算合规失败和非单调质量曲线,但预算与全上下文方向仍未定论。
元空智能(元空AI)发布端侧模型Boxer、办公Agent元空AI Work和科研Agent元空AI Science,提出「生产力=模型×Agent×设备」的端侧AI公式,主张设备是持续产生稀缺数据的环境,让模型与设备共同进化。其Boxer-35B-A3B-v0-0819在自建WorkArena评测中得73.1分,并在40 TOPS、不到8GB内存占用下保留
MemTensor 提出 MemRetriever,一种将长期记忆检索建模为多步搜索过程的智能体式检索模型,通过并行搜索、串行搜索和反思去噪三种动作,主动规划检索与停止时机。研究使用 ReAct 风格轨迹做监督预热,并用 GRPO 强化学习优化证据覆盖、降噪和答案充分性。在 LOCOMO、LongMemEval、HotpotQA、MuSiQue 和 2Wik
该论文提出一个信息论框架,将闭卷问答中的事实幻觉分解为两个可分离的来源:未观测事实的覆盖缺失,以及已观测事实因有限记忆被迫压缩存储而导致的失真。作者用覆盖-压缩模型证明了一个率失真下界,并通过理论模拟和在现代语言模型上的受控事实注入实验验证了预测特征。该工作为选择性记忆、强制压缩、检索和长上下文组织等行为提供了统一的信息论解释。
9月14日,豆包手机助手消费者版本正式发布,以豆包App为基础与手机厂商在系统层面合作,强调稳定性和日常可用性。该版本支持语音、AI键等多种唤醒方式,具备屏幕问答、本地记忆检索和任务执行能力,并以Beta版开放“操作手机”功能,同时推出屏幕自动化操作声明协议(SAEP)并启动30天规则公示。首个消费者版本将搭载于努比亚NaviX Ultra手机,9月16日正
量子位报道了米羊科技在外滩大会路演中推出的桌面Agent产品白艾莉(Alice),提出「关系型生产力Agent」概念,将生产力任务交付与人格化陪伴结合。白艾莉具备自研AI人格系统(四层架构)、世界模拟引擎(接入高德地图API、330个真实场馆)以及专业子Agent协作能力,并支持朋友圈互动、拉黑等关系化行为,官方称次日留存73%、7日留存45%、90日留存1
生数科技发布世界模型Motus2,在前代基础上将行动、预测、评估三种能力整合进同一模型,形成「生成动作→预测后果→评估结果→更新策略」的闭环,初步探索递归自我改进(RSI)。模型新增触觉专家模块与记忆机制,并基于约13万小时人类第一视角Ego数据加百小时级机器人数据训练,部署于22自由度Sharpa Wave等灵巧手平台。真机测试中,规划与基于模型的强化学习
Mastra 发布 @mastra/core@1.66.0 等更新,为 Mastra Cloud 引入部署范围的 worker 配置清单与运行时拓扑对比端点,并增强 trace 查询能力,支持按 span 字段、metadata、feedback 和 scores 过滤,覆盖 Postgres、ClickHouse、DuckDB 等存储后端。同时新增可观测性
研究团队在真实博卡拉湖畔地理环境中构建了一个由100个带记忆的LLM智能体组成的封闭、货币守恒的空间经济系统,运行长达26个模拟周(远超同类研究1-2周),共91次有效运行、244万次决策、215亿token。结果显示货币传导在到达企业后停止:12%的旅游需求冲击使企业收入上升4.62,但工资仅变动1.03,仅0.3%的菜单项被重新定价;随机现金转移后96.
Mem0 发布了 Pi Agent 插件 v0.3.0,该版本重构了插件以复用共享的对话准备、记忆格式化及作用域工具,同时保持 Pi 原生扩展 API 和包名不变。新版本移除了 Dream consolidation 和 pin 命令,仅保留 remember、search、forget、tour、scope 和 status 命令,并修复了全局记忆作用域、
Mem0 发布了 OpenCode 插件 v0.3.0,将源代码从 integrations/mem0-plugin/.opencode-plugin/ 移至 integrations/opencode-plugin/ ,并保留包名和原生 OpenCode 钩子。该版本移除了自动 Dream 整合功能及相关技能,要求用户更新现有配置。同时,全局记忆工具范围需
Mem0 发布了 DeepSeek 插件 v0.3.0,新增了在系统提示组装期间自动召回记忆、在对话回合完成后自动捕获记忆的功能,并默认启用 autoRecall 和 autoCapture。该插件现在以独立的 ESM 包形式发布,并支持跨用户覆盖需显式开启。
Mem0 发布了 OpenClaw 插件 v1.1.0,该版本复用共享的对话准备、编辑和遥测功能,同时保留 OpenClaw 的原生记忆后端、工具、CLI 及平台/OSS 模式。移除了 Dream 整合功能,包括自动调度、锁定和相关命令、配置及技能。修复了状态命令在未配置安装时的崩溃问题,并移除了 2000 字符的提取截断限制,确保消息全文保留。
MERIT 基准测试评估了工具使用型 LLM 代理中长期记忆的边际效用,通过 23,440 个带成本核算的片段发现,记忆可将依赖任务的成功率从 0 提升至 0.55-1.00,但嵌入检索在更新事实时表现不稳定,而结构化事实存储和 LLM 摘要等更新时写入的记忆更稳健。研究还表明,记忆实现的选择可导致任务成功率相差 60 个百分点,且完整重放不经济。该基准、测
Claude Code 发布了 2.1.32 版本更新,新增了 Opus 4.6 模型支持,并推出了实验性的多智能体协作功能 agent teams。该版本还引入了自动记忆功能,可记录和回忆工作上下文,并支持从消息选择器进行部分对话摘要。此外,修复了多个 bug,并优化了技能字符预算与上下文窗口的缩放。
Claude Code 2.1.50 版本发布,新增了 LSP 服务器 startupTimeout 配置、WorktreeCreate/WorktreeRemove 钩子事件以及 agent 定义中的 worktree 隔离支持。该版本修复了多个内存泄漏问题,包括 agent 团队、LSP 诊断数据、任务输出等,并优化了长会话的内存使用。同时改进了 CLA
Claude Code 发布 2.1.59 版本更新,新增自动保存上下文到 auto-memory 的功能,并可通过 /memory 命令管理。新增 /copy 命令,在存在代码块时提供交互式选择器,允许用户选择单个代码块或完整回复。改进复合 bash 命令的权限前缀建议,优化多代理会话中的内存使用,并修复了多个并发运行时的 bug,如 MCP OAuth