EverMind三篇论文交出全栈自进化首份答卷
EverMind,由盛大集团孵化的AI研究团队,通过连续发布三篇论文,系统性地提出了自进化AI的全栈技术方案,覆盖脚手架、技能和模型权重三个层面。论文分别提出了HarnessBank框架、SkillCorpus技能库和DASH算法,旨在解决AI自我改进中的过拟合、技能管理和训练信号分配问题。此举被视为中国团队在自进化AI领域的一次重要突破,与海外NeoLab
技术方向 · 长期记忆、上下文管理与会话状态 · 共 27 条
EverMind,由盛大集团孵化的AI研究团队,通过连续发布三篇论文,系统性地提出了自进化AI的全栈技术方案,覆盖脚手架、技能和模型权重三个层面。论文分别提出了HarnessBank框架、SkillCorpus技能库和DASH算法,旨在解决AI自我改进中的过拟合、技能管理和训练信号分配问题。此举被视为中国团队在自进化AI领域的一次重要突破,与海外NeoLab
Hugging Face 每日论文发布了一篇关于 Activity Frames 的研究,提出了一种确定性、零模型的编译器,可将本地捕获的屏幕活动编译为代理可信任的记忆,并将重复任务转化为可重放脚本。在单用户语料库上,该编译器将一天的原始捕获压缩为 86 倍小的上下文块,耗时 68 毫秒,代理回答问题的准确率达 98.4%,优于 LLM 摘要的 66-80%
arXiv 发布了一项名为 MemArena 的基准测试,用于评估端侧个人记忆助手。该基准通过 MASim 模拟器生成了 50 个智能体在 15 天内的对话数据,并测试了多种记忆后端。结果显示,记忆后端的选择对内容准确性的影响大于模型规模,且权限感知访问在所有后端中均表现不佳。
FinPerMA是一个针对LLM代理的个性化记忆基准测试,基于理论信息和事件驱动,用于评估代理在长期金融咨询场景中维护和更新用户模型的能力。该基准包含2994个问题,覆盖276个用户画像,测试结果显示前沿LLM和多种记忆配置均未达到饱和,最高准确率仅约0.47。分析表明,基于摘要的记忆方法在保留事实细节的同时丢失了偏好信号,简单检索方法在事件冲击后表现优于专
AWS 宣布 Amazon Bedrock AgentCore harness 正式可用,并推出开源社区节点 @aws/n8n-nodes-agentcore,将生产级 AI 代理能力集成到 n8n 可视化编辑器中。该节点支持持久记忆、真实工具调用和多模型提供商(如 Bedrock、OpenAI、Gemini),用户无需编写基础设施或代理代码即可构建代理。节
Mem0 发布了 Node CLI v0.2.12,为 add、search、list、update 和 delete 命令新增了多个标志,以匹配平台 API 的字段。同时修复了 help --json 在 agent 模式下的输出问题,并调整了 add 命令中 categories 参数的处理。此外,该版本还更新了 Node 依赖中的 postcss 版本
Mem0 发布了 Node SDK 3.1.4,新增了搜索选项 referenceDate 和 keywordSearch,并修复了多个客户端和内存管理问题。这些修复包括优化 ping 调用、改进连接复用、防止元数据覆盖身份范围,以及修复 Redis 过滤表达式。这些改进提升了 SDK 的性能和稳定性。
Mem0 发布了 Python SDK v2.0.16,新增了搜索选项(如 reference_date、latest_only、keyword_search)以与平台 API 同步。同时修复了多个 bug,包括元数据不再影响记忆的身份范围、Upstash 过滤键值验证、FastEmbed 返回类型修正、HuggingFace 嵌入 API 密钥传递、Oll
OpenAI 于 7 月 9 日发布了面向知识工作的智能体产品 ChatGPT Work,整合了多个模型和桌面应用,并支持云和本地两种模式。该产品基于 Codex 框架,提供持久化云计算机、插件和工件生成功能,上线三周用户已超 1000 万。文章还分析了其记忆机制、任务工作区以及与 ChatGPT 的合并计划。
MemSFT 提出了一种通过外部参数化记忆来缓解对齐税的方法,在不更新骨干网络的情况下,训练外部记忆模拟非参数检索器在领域数据上的行为,并通过学习到的路由器在解码时动态融合记忆和骨干输出分布。在生物、地球科学和法律领域,使用 Qwen3-8B 到 Qwen3-235B-A22B 的模型评估显示,MemSFT 显著提升了领域性能,同时通用性能几乎无下降,而完整
MAPLE-Guard 是一种针对基于 LLM 的多智能体系统(MAS)中记忆链接投毒攻击的新型防御机制。它通过监控记忆生命周期,在写入、检索、提升和跨智能体重用等环节设置门控,以隔离风险记忆、过滤不安全检索并阻止中毒的私有记忆进入共享记忆。在 LongMemEval 和 AppWorld 基准测试中,MAPLE-Guard 将攻击成功率分别从 38.2%
arXiv 论文提出 MemoryForge 框架,用于为 LLM 智能体合成类人的终身记忆。该框架通过记忆条件化替代传统提示方法,包含上下文生成器、生活组织器和多分辨率模拟器三个组件。实验表明,MemoryForge 生成的记忆库能使冻结的 LLM 在角色扮演和用户模拟任务中表现出更类人的行为。
AgentMemBench 是一个用于评估对话式 AI 代理长期记忆管理策略的统一基准,在相同条件下测试了五种策略(ICW、EKV、GEM、CBS、WAM),并使用三个公共数据集和 491 个标注问题进行了评估。结果显示,外部键值存储(EKV)在所有质量指标上表现最佳,尤其在长距离回忆方面显著优于其他策略,但代价是更高的内存占用。研究还评估了 MemGPT/
该论文研究了长时程智能体在KV缓存重用中,被保留的缓存条目在源事件被移除后是否仍具有信息量。通过省略早期观察的对照实验,发现下游事件的缓存行能独立反映已消失输入的计算结果,称为语义物化。论文还展示了通过精心措辞的载体事件可将捐赠者对齐恢复率从6%提升至51%,并总结了稀疏事件KV服务的记忆契约。
Zero-Mem 提出了一种零 token 记忆操作方案,使 LLM 代理在长交互中无需额外 LLM 调用即可管理记忆。它通过实体-上下文图和时间层次结构组织原始交互痕迹,仅最终问答阶段调用 LLM。在长记忆和长上下文问答基准上,Zero-Mem 达到竞争性性能,并将记忆操作时间成本降低 57.6%。
TransMem 是一种轻量级推理时参数记忆模块,可将冻结的大语言模型(LLM)的稀疏历史隐藏状态转换为可复用的记忆表示,通过门控网络动态干预当前隐藏状态,无需重复编码先前上下文。实验表明,TransMem 在 LoCoMo、HotpotQA 和 MemoryAgentBench 上均取得显著性能提升,验证了稀疏历史隐藏状态作为长上下文 LLM 智能体有效记
Meta AI 研究人员提出了一种双智能体记忆系统,通过一个独立的记忆智能体监控任务进度,并在适当时机向主智能体发送提醒,以解决长任务中的行为状态衰减问题。该系统在 Terminal-Bench 2.0 和 tau2-Bench 基准测试中显著提升了任务完成率,并优于现有记忆系统。
Mastra 发布 2026 年 7 月 28 日更新,AgentController 新增聊天频道支持,可在 Slack、Discord、Telegram 等平台运行持久化代理会话,并支持流式输出、工具审批卡片和打字指示器。MongoDB 向量存储支持自带集合和混合检索(向量+全文)。新增精确元数据过滤、平滑流式传输和更快的沙箱执行。同时包含多项破坏性变更
Agno 发布了 v2.8.4 版本,包含多项修复和新功能。修复了嵌套执行器需求序列化、技能脚本/参考工具中空路径参数的问题;新增了 TrustedRouter 作为 OpenAILike 模型类,并重构了实体记忆以增强第二大脑功能。新贡献者 jperla 首次参与。
OpenAI 发布了 openai-agents-python 库的 v0.18.3 版本,包含多项功能增强和错误修复。主要改进包括可配置的任务和追踪跨度、实时响应使用跟踪、内存序列化修复、模型参数冲突处理、交接消息保留、并发运行隔离、沙箱优化、流式会话输入保留、会话清理修复、文档字符串解析、JSON Schema 转换限制以及错误详情脱敏。此外,还更新了托
Anthropic 发布了 Java SDK 的 2.48.0 版本,主要新增了 agent-memory-2026-07-22 测试版 API 头。该更新为开发者提供了对 agent 记忆功能的早期访问,可能影响基于 Anthropic 模型的 agent 应用开发。
Mastra 发布 2026 年 7 月 1 日更新,新增心跳 API 支持定时调度 agent,引入基于文件系统的 agent 定义与自动注册,增强人机协同的挂起运行发现,并升级观察记忆提取器。同时,InngestAgent 与 DurableAgent 功能对齐,并包含若干破坏性变更,如 Vercel 沙箱导出重命名。
微软研究院发布了 Memora,一种面向长期任务 AI 代理的可扩展记忆系统,通过解耦存储内容与检索方式,平衡抽象与具体性,显著提升代理效率。Memora 在 LoCoMo 和 LongMemEval 基准上达到最先进性能,相比全上下文推理减少高达 98% 的 token 使用。该论文发表于 ICML 2026,代码已在 GitHub 开源。
微软发布了 AutoGen Python 库的 v0.7.2 版本,主要更新包括将 DockerCommandLineCodeExecutor 设为 MagenticOne 团队的默认执行器,为 CodeExecutorAgent 添加 approval_func 选项,支持 OpenAI 模型客户端的 parallel_tool_call 配置,以及修复结
Hugging Face 博客介绍了 ALTK-Evolve 与 ACE 两种智能体记忆系统,均通过将智能体历史轨迹转化为可复用经验并在推理时注入,避免压缩经验。ALTK-Evolve 采用按需检索少量指南的方式,而 ACE 每步注入完整手册。在 AppWorld 基准上,ALTK-Evolve 在 DeepSeek-V3.2 上准确率更高且 token 消
RoMeRL 提出了一种用于自进化 LLM 智能体的降阶记忆强化学习方法,通过固定维度的语义坐标表示记忆状态,解决反馈分散和记忆-奖励陷阱问题。在 ALFWorld 和 LifelongAgentBench 基准上,该方法将 Cold-Q 比率降低 80.0%,反馈密度提高约 6 倍,内存占用减少 84.4%,LLM 调用减少 21.1%。代码已开源。
本文提出了一种名为Agent Memory Distillation (AMD)的无训练框架,通过层次化记忆将大型教师智能体的结构化知识迁移到小型学生智能体。AMD构建了工作流记忆、子任务记忆和函数记忆三种互补记忆类型,并在三个工具使用基准上使用四个学生模型进行评估,平均准确率分别提升27.2%、11.2%和3.4%。分析表明子任务记忆贡献最大,教师有效性取