Haystack v2.30.2 修复 Agent 过早退出问题
Haystack 发布了 v2.30.2 版本,主要修复了 Agent 在默认退出条件下过早退出的问题。此前,当 LLM 生成无效工具调用被丢弃后,空文本的助手消息会触发退出,导致 Agent 无法恢复。现在 Agent 会继续循环,让模型在下一轮迭代中恢复。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2515 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Haystack 发布了 v2.30.2 版本,主要修复了 Agent 在默认退出条件下过早退出的问题。此前,当 LLM 生成无效工具调用被丢弃后,空文本的助手消息会触发退出,导致 Agent 无法恢复。现在 Agent 会继续循环,让模型在下一轮迭代中恢复。
RAGFlow 发布 v0.26.1 版本,新增功能包括允许用户修改现有模型配置的模型类型,支持将 RAGFlow 助手部署为 Discord 和飞书等外部消息平台上的聊天机器人,并在 Langfuse 中按会话对多轮聊天追踪进行分组以方便调试。此外,该版本修复了多个 bug,包括令牌计费不准确、嵌入截断限制、错误处理重构,以及为 /chat/complet
微软发布了 Semantic Kernel Python 1.43.1 版本,主要更新包括为 Azure AI 和 OpenAI Assistant 代理添加 function choice behavior 支持,修复了 MessagePack 问题,并改进了 JSON Schema 类型数组的处理。此外,该版本还增强了 OpenAPI 插件的安全性,拒绝
Google DeepMind 与英国政府合作,基于 Gemini 开发了一款 AI 规划原型工具,旨在将房屋规划申请的处理时间缩短 50%。该工具已在 Barnet、Dorset 和 Camden 进行试点,计划于 2027 年向全国所有议会推广。它通过数据整合、政策识别、反馈总结和报告起草等功能,辅助规划官员提高效率,同时确保官员保留最终决策权。
Google DeepMind 发布了 AI Control Roadmap,旨在保护内部系统免受日益强大但可能不完全对齐的 AI 代理的威胁。该框架采用纵深防御策略,将 AI 代理视为潜在内部威胁,并基于 MITRE ATT&CK 框架进行威胁建模,通过监督、预防和响应机制来管理风险。该路线图还规划了随 AI 能力提升而扩展的安全措施,包括应对模型隐藏推理
Interconnects AI 播客邀请 Ai2 的 Finbarr Timbers 回顾前沿后训练配方,重点介绍了 2026 年出现的多教师在线蒸馏(MOPD)模式,该模式由 MiMo Flash v2 引入,并被 DeepSeek V4 和 Nemotron 3 Ultra 扩展至 10 多个教师模型。节目还梳理了从 InstructGPT 到 202
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation 和 ARIA,并获 Google.org 支持,宣布一项最高 1000 万美元的研究资助计划,面向全球研究人员,聚焦多智能体 AI 系统的安全研究。该计划旨在应对大规模 AI 代理交互时可能出现的涌现行为和安全风险,并邀请学术界和独立研
Google DeepMind 发布了 Gemma 4 12B,这是一款面向笔记本电脑的无编码器多模态模型,支持原生音频输入,性能接近其 26B MoE 模型,但内存占用更小。该模型采用统一架构,视觉和音频输入直接进入 LLM 主干,无需传统编码器,并支持多 token 预测以降低延迟。模型以 Apache 2.0 许可开源,可在 16GB 内存的设备上本地
作者延续往年习惯,整理了2026年1月至5月期间值得关注的LLM研究论文清单,涵盖架构设计、推理效率、强化学习、智能体系统等多个类别。清单特别关注混合架构、状态空间模型、长上下文效率等趋势,并推荐了Nemotron 3等必读论文。作者强调这是个人精选而非完整列表,旨在帮助读者快速定位相关研究。
Spring AI 发布了 2.0.0-RC1 版本,包含多项新特性、错误修复和文档更新。新特性包括为 MessageWindowChatMemory 添加回合边界裁剪、移除模型默认值、将 advisors 移至独立模块、移除内部工具执行等。错误修复涉及流式处理、span 层级和 JSON schema 生成等问题。该版本旨在简化 API 并提升可维护性。
Ethan Mollick 在文章中指出,AI 正从协作式聊天机器人转向自主智能体,并引用研究称 AI 已编写 80% 的代码。他宣布新书《Co-Existence》将于 10 月 20 日出版,讲述如何与有时优于人类的 AI 共存。他分享了自己写作时谨慎使用 AI 的经历,并尝试通过网站上的提示来影响 AI 推荐,但发现旧方法已失效。
Hugging Face 发布了 smolagents v1.26.0,主要更新包括在 WebSearchTool 中新增 Exa 作为搜索选项,移除远程 WasmExecutor,并修复了文档和测试中的多处问题。该版本还引入了三位新贡献者。
Agent2Agent(A2A)协议发布了 v1.0.1 版本,主要修复了规范中的多个问题,包括 HTTP 绑定中优先使用 application/a2a+json 媒体类型、转码相关错误以及 TaskStatus 值的定义。该版本更新旨在提升协议实现的准确性和互操作性。
Semantic Kernel 发布了 .NET 版本 1.77.0,主要更新包括默认启用 OpenAPI 插件的服务器 URL 验证,更新了 Agent Framework 迁移示例以兼容 1.0 版本,并修复了 SharpCompress 的安全漏洞。这些改动增强了安全性和兼容性。
DSPy 发布 3.3.0b1 测试版,引入新模块 ReActV2 和类型化的 BaseLM 系统,并更新 GEPA 至 0.1.1,同时减少框架依赖。ReActV2 支持原生工具调用和并行工具调用,可降低最高 50% 的成本;BaseLM 提供类型化的 LMRequest/LMResponse 接口,为未来 LiteLLM 解耦做准备。此外,numpy 变
Anthropic 发布了 Claude Opus 4.8,相比 4.7 在编码、智能体技能、推理和实际知识工作方面有所改进。同时,企业版计划新增了连接器权限管理功能,允许管理员通过自定义角色控制连接器及其工具的访问权限。
Mistral AI 发布了 Mistral Medium 3.5,这是一个 128B 参数的开源权重模型,支持长时程编码和生产力任务,并成为 Le Chat 和 Mistral Vibe 的默认模型。同时推出了远程代理和 Le Chat 的 Work 模式,支持并行异步任务执行。该模型在 SWE-Bench Verified 上得分 77.6%,定价为每百
Cohere 发布了开源模型 Command A+,这是一个混合专家(MoE)模型,总参数 218B,激活参数 25B,支持 128K 上下文和 48 种语言,采用 Apache 2.0 许可证。该模型在推理、智能体任务、多模态和检索等企业工作负载上性能优于前代 Command A 系列,并可在低至两张 H100 或单张 B200 的硬件上高效运行。Comm
Google 在 Gemini API 中发布了 gemini-3.5-flash 的 GA 版本,这是面向智能体和编码任务的最强模型,现已成为 gemini-flash-latest 的底层模型。同时,Google 推出了 Managed Agents 公共预览版,允许开发者在 Google 托管的隔离 Linux 沙箱环境中构建和部署自主、有状态的智能体
澳大利亚养老护理提供商Regis开发了基于微软Copilot Studio和Foundry的AI助手RegiCare Assist,用于自动总结护理记录并分类临床问题,以减少护理管理者的文书工作。该工具已在72家养老院中约150名员工中使用,使管理者能更快掌握居民状况,腾出更多时间直接护理。Regis强调AI仅作辅助,不替代临床判断,并计划未来与现有护理管理