通过强化学习实现渐进式智能体技能生成
Skill-α是一种通过强化学习逐步生成高质量智能体技能的方法。它将技能生成视为一个顺序编辑过程,并引入回滚奖励来评估每次编辑。实验表明,Skill-α在文档到技能和经验到技能两种设置下均优于基于启发式或流水线的方法,在CL-Bench和tau2-bench上分别将下游成功率提高了3.3和6.7个百分点。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2501 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Skill-α是一种通过强化学习逐步生成高质量智能体技能的方法。它将技能生成视为一个顺序编辑过程,并引入回滚奖励来评估每次编辑。实验表明,Skill-α在文档到技能和经验到技能两种设置下均优于基于启发式或流水线的方法,在CL-Bench和tau2-bench上分别将下游成功率提高了3.3和6.7个百分点。
SKT 是一种基于验证的合成数据生成流水线,用于提升语言模型代理的技能使用能力。它从 2000 个公共技能中生成 4000 个任务包和 27164 条验证轨迹,并通过监督微调显著提升模型性能。研究还构建了 SkillEval 基准,验证了该方法在不同模型和代理框架中的有效性。
SWE-Touch是一个新框架,用于在共享工作空间中测试编码代理,通过注入与任务冲突的用户编辑来模拟真实开发场景。在SWE-bench Verified上,Counter-Edit使平均解决率下降7.7个百分点,并重新洗牌了模型排名。Claude Opus 4.8和GPT 5.5表现出较强的韧性,而开源模型在自主基准上表现良好但在协作场景中显著退化。结果表明
BANDMAS 是一个面向 LLM 多智能体协作的语义包调度框架,通过因果启发的重放估值将消息分解为数据包,仅传输贡献超过资源成本的包,以降低带宽和推理开销。在 SciFact、HotpotQA 和 FanOutQA 数据集上,使用冻结的 Qwen3-4B 模型,BANDMAS 在选定上限下将应用层字节减少 53.2% 至 77.3%,并在所有三个工作负载上
arXiv 发布论文《MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing》,提出一个开放、可检查的基准框架,用于在共享执行模型下比较智能体工作流路由的元决策策略。基准包含 180 个合成任务、8 种路由策略和 30 对随机种子,在 43,200 条轨迹
MAPLE-Guard 是一种针对基于 LLM 的多智能体系统(MAS)中记忆链接投毒攻击的新型防御机制。它通过监控记忆生命周期,在写入、检索、提升和跨智能体重用等环节设置门控,以隔离风险记忆、过滤不安全检索并阻止中毒的私有记忆进入共享记忆。在 LongMemEval 和 AppWorld 基准测试中,MAPLE-Guard 将攻击成功率分别从 38.2%
arXiv 论文提出 MemoryForge 框架,用于为 LLM 智能体合成类人的终身记忆。该框架通过记忆条件化替代传统提示方法,包含上下文生成器、生活组织器和多分辨率模拟器三个组件。实验表明,MemoryForge 生成的记忆库能使冻结的 LLM 在角色扮演和用户模拟任务中表现出更类人的行为。
PhysAgent是一个用于远程心率估计的多智能体框架,由arXiv论文提出。该框架利用多个基础估计器生成候选心率,并通过轻量级4B多模态大语言模型Qwen3-VL-4B驱动多智能体推理,结合确定性生理验证器进行融合,以提高心率估计的稳定性和可靠性。实验表明,PhysAgent在多个公共基准上优于直接预测和传统融合方法,代码即将发布。
arXiv 论文提出 HIERA,一种用于内容发现系统的层级多智能体相关性评估框架,包含四个专业智能体:相关性法官、查询分析器、条目分析器和关系分析器。法官决定何时需要专家分析,关系分析器协调查询和条目分析及外部知识以做出最终判断。消融实验表明,层级协调本身是性能提升的关键。在五个数据集上的评估显示,相比 11 个基线,HIERA 在 Home Depot
AutoFOAM 是一个基于大型语言模型的自进化智能体,可根据自然语言指令自动创建、评估、运行和优化 OpenFOAM 计算流体力学模拟。该模型基于 Qwen-coder 2.5-14B 微调,采用七阶段进化循环和三种防退化机制,旨在降低 CFD 使用门槛并加速原型设计。
该研究提出了一种可执行的基准测试和预算感知的元路由器,用于组合智能体工作流中的异构操作。基准包含216个训练、72个开发、108个测试和108个锁定词汇转移挑战任务,覆盖数据分析、冻结语料库研究和文档处理。学习策略在测试集上达到100%成功率,比静态工作流高6.5个百分点,成本降低43%;但在挑战集上成功率降至75.9%,落后于静态路由的93.5%,表明词汇
该研究针对多智能体系统(包括LLM智能体群体)的性能极限问题,提出一个定量资源模型,以群体宽度、智能体内存和观测延迟为三种资源。研究发现,平坦同质系统的性能下限由智能体内存决定,而非架构层级;三种资源不可完全互换,并存在硬性交换边界;残余性能下限由观测延迟和环境不可预测性决定。研究通过受控测试平台验证了结论,并为实践者提供了四条设计规则。
RubricReviewer是一个全新的同行评审框架,通过将评分标准生成作为显式中间步骤,并融合无训练代理(Scout)与人类对齐训练模型(Aligner),解决了现有LLM评审员的两大结构性局限。实验表明,该框架生成的评审比现有系统更全面、更具区分度,且对对抗性提示注入攻击的鲁棒性最强。消融研究证实了每个组件的必要性。
该研究针对长时程智能体的跨基准泛化问题,对开放权重混合专家模型Qwen3.5-122B-A10B进行后训练,使用363个MCP任务和两阶段SFT-RL流程。训练后的模型在五个外部基准上均有提升,包括Toolathlon、tau^2-Bench、BFCL-V4、SWE-Bench Pro和Terminal-Bench 2,其中软件工程基准的提升尤为显著,尽管训
AgentMemBench 是一个用于评估对话式 AI 代理长期记忆管理策略的统一基准,在相同条件下测试了五种策略(ICW、EKV、GEM、CBS、WAM),并使用三个公共数据集和 491 个标注问题进行了评估。结果显示,外部键值存储(EKV)在所有质量指标上表现最佳,尤其在长距离回忆方面显著优于其他策略,但代价是更高的内存占用。研究还评估了 MemGPT/
阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。
TRAE Work 官方上线了一个面向内容创作者的 AI 工作知识库,包含工具使用教程和实战经验,覆盖七大工作场景。文章作者通过自身实践展示了如何利用 TRAE Work 搭建 AI 工作流,如生成大厂 AI 日报、确定选题角度、辅助内容发布和分析写作。该知识库旨在帮助内容创作者系统化地学习和应用 AI 工具,提升工作效率。
Hugging Face 上发布了 Qwopus3.6-27B-Coder 的 NVFP4 量化版本,该模型基于 Jackrong/Qwopus3.6-27B-Coder,采用 W4A4 量化,大小约 18GB,相比 bf16 原始模型减少约 33%,在 wikitext-2 上困惑度为 6.63,支持 256K 上下文,专为 NVIDIA Blackwel
PydanticAI 发布 v2.23.0 版本,新增了 Bedrock 对 ModelSettings.extra headers 的支持、恢复 gemini-3-pro-image 和 gemini-3.1-flash-image 网关别名、在 RunUsage 中添加 cost 字段及 UsageLimits 中添加 cost limit,并新增 To
Steve Yegge 在博客中回顾了其项目 Gas Town 的失败经历,指出该工具本应可复用,但最终仅用于构建自身。随着 Opus 4.7 的发布,模型出现“再改进两件事”的倾向,导致 Gas Town 无法收敛到可实际工作的状态,最终项目被放弃。