LangChain 1.3.15 发布:新增 trace_policy 与 reasoning_effort 支持
LangChain 发布了 1.3.15 版本,包含多项功能更新和错误修复。新增功能包括在 AgentMiddleware 中暴露 trace_policy、为 wrap_tool_call 添加 state_schema 参数、在 init_chat_model 中支持 LangSmith provider,以及将 reasoning_effort 作为标
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 40 条
LangChain 发布了 1.3.15 版本,包含多项功能更新和错误修复。新增功能包括在 AgentMiddleware 中暴露 trace_policy、为 wrap_tool_call 添加 state_schema 参数、在 init_chat_model 中支持 LangSmith provider,以及将 reasoning_effort 作为标
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
谷歌CEO桑达尔·皮查伊宣布,Gemini应用月活跃用户数突破10亿,成为谷歌第14个达到此里程碑的产品。Gemini的增长速度与OpenAI的ChatGPT相当,后者在6月达到10亿用户。谷歌持续将Gemini整合到搜索、工作空间、安卓等产品中,并推出Gemini 3.5 Flash模型以提升编码和AI代理任务能力。此外,63%的用户使用语音功能,Gemi
由xAI联合创始人Igor Babuschkin创立的AI初创公司River AI,在成立仅两个月后获得了由General Catalyst和AMP PBC领投的11亿美元融资,Nvidia、AMD Ventures、Y Combinator和Temasek参投。River AI旨在从头重建AI技术栈,包括训练、模型、产品层和硬件,以开发个人可训练的AI助手
Vercel AI SDK 发布 ai@6.0.249 版本,主要修复了取消操作后聊天流未正确停止以及恢复流时可能应用过期更新的问题。同时更新了 @ai-sdk/gateway 依赖至 3.0.169。
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并
另有 1 家信源报道
Google Research 与 Google DeepMind 在首次研究中展示了其医疗 AI 系统 AMIE 的实时临床视频咨询能力。该系统基于 Gemini 和 Project Astra 构建,采用多智能体架构,能够解读视觉和听觉线索,指导虚拟体检并进行实时诊断推理。在模拟咨询的随机研究中,临床评估者对其病史采集、诊断准确性、管理适当性和沟通质量给
另有 1 家信源报道
Anthropic 宣布其未发布模型在黎曼猜想上取得重大进展,显著提高了该猜想成立的下界。该模型在无专业数学训练的员工引导下,通过 60 个子代理协作,测试了 650 个想法,花费 3100 万输出 token,最终由两名子代理提出关键数学思想,并经内部数学家验证和 Lean 证明助手形式化。这一成果引发数学界对 AI 在数学发现中作用的争议,部分数学家担忧
First Orion 是一家品牌通信公司,其工程团队因开发速度超过 QA 测试能力而面临瓶颈。他们采用 Amazon Nova Act,将基于脚本的测试自动化转变为由 AI 驱动的智能代理,使 QA 分析师能用自然语言描述测试目标。该方案解决了回归测试非自助、新功能测试用例缺口和脚本脆弱等问题,提升了发布速度和质量。
AWS 发布了一篇关于部署 Anthropic Claude 应用网关(Claude apps gateway)的博客,该网关为 Claude Code 和 Claude Desktop 提供集中治理层,支持身份验证、模型访问控制、成本归属和支出限制。参考部署使用 AWS Fargate、RDS PostgreSQL、内部负载均衡器和 OIDC 身份提供商,
Nvidia发布了开源权重模型Nemotron 3.5 Lightning,该模型拥有316亿总参数但仅激活36亿参数,在智能指数上达到24分,与OpenAI的gpt-oss-120b持平,但推理速度接近每秒670个token,远超同类模型。该模型在代理基准测试中表现显著提升,采用宽松的OpenMDW-1.1许可证,并提供BF16和NVFP4权重,多家云服务
前 Kimi CLI 负责人 stdrc 在采访中提出,模型越强,Harness 反而越厚,但复杂度从能力层转移到协作层。他基于 Kimi CLI 的实践,指出底层 Harness 可被模型内化,但多智能体协作等上层需求催生更厚的 Harness。他创办的 Raft 公司直接实践这一理念,将成熟 AI 产品作为团队成员,专注多智能体协作的 Harness 架
安全公司 A Security 的研究人员利用不到 20 条 AI 提示词,发现 Zoom 存在一个严重安全漏洞,该漏洞可让攻击者在会议中劫持所有参会者的设备,无需受害者操作且无视觉提示。Zoom 已于周二发布修复补丁,影响 Windows、macOS、Linux、Android 和 iOS 平台。
LangGraph 发布了 1.2.11 版本,主要新增了在 add_node 上暴露 trace_policy 的功能,并进行了多项依赖更新和测试改进。同时,相关的 checkpoint 包(checkpoint-postgres 和 checkpoint-sqlite)也发布了新版本,修复了 delta 通道历史中的写入收集问题。
亚马逊近期简化了订单确认邮件,不再列出具体商品名称,仅显示商品类别,引发用户不满。亚马逊发言人表示此举是为了引导用户使用其应用和网站获取详细信息,并减少在外部共享客户信息以提升隐私。分析认为,这可能是亚马逊为应对AI购物代理(如Google的Gemini Spark)带来的竞争,保护其与消费者的直接关系。
Ollama 发布 v0.32.9 版本,新增对 NVIDIA Nemotron 3.5 Lightning 模型的支持。该模型是一个开放 30B 参数的混合专家(MoE)模型,仅有 3B 活跃参数,专为常驻 AI 代理的执行层设计,并支持 OpenClaw 和 Hermes Agent 等框架。此外,该版本还修复了 Muse Glimmer 函数调用解析器
另有 1 家信源报道
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr
另有 1 家信源报道
NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提
NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单
Langfuse 发布 v4.8.0 版本,主要新增了应用内代理功能,允许用户在一次对话中批准一次工具使用。同时修复了 OpenTelemetry 中 Anthropic 缓存令牌别名映射和评估过滤器选项加载的问题,并更新了依赖库版本。
OpenAI 为 ChatGPT Business 推出 Premium Seats,每位用户每月收费 125 美元(年付 100 美元),提供标准席位 5 倍的使用容量,且不受五小时限制。此举旨在满足代理式 AI 消耗更多 token 的需求,并允许工作区内混合使用不同席位。分析认为,这反映了 AI 实验室从低价策略转向盈利模式的趋势。
谷歌创始人布林紧急接管Gemini团队,但据SemiAnalysis分析,Gemini 3.5 Pro已被悄悄取消,谷歌面临旗舰模型缺失的困境。同时,谷歌内部发生重大人事变动,包括哈萨比斯卸任DeepMind CEO、Jeff Dean等元老离职,以及算力分配问题(如向Anthropic提供TPU)引发战略争议。布林重新深度参与Gemini战略,但谷歌在AI
Langfuse 发布了 v4.7.1 版本,主要包含两项更新:重构了应用内代理,移除了不再使用的前台运行时支持;修复了 worker 中 Mixpanel 导入请求超时的问题。该版本旨在提升稳定性和性能。
n8n 发布 2.35.0 版本,包含多项核心修复,重点优化 AI Agent 节点,防止工具调用前文本泄漏到响应中,并限制过大的代理工具结果。同时修复了 MCP 工具模式编译、OAuth2 参数去重、任务运行器健康检查等问题,提升了稳定性和安全性。
戴盟机器人宣布完成数亿元融资,由蚂蚁集团领投,老股东超额跟投,两个月内连续完成两轮融资。该公司孵化于香港科技大学,专注于触觉感知与物理AI,发布了全球首个触觉锚定世界模型Daimon-TWM,并已实现视触觉传感器万片级出货,服务全球200余家客户。融资将用于推动触觉感知、数据与模型的商业化落地,覆盖3C精密制造和汽车智造等场景。
另有 1 家信源报道
Langfuse 发布 v4.7.0 版本,包含多项新功能与修复。新功能包括新的会话头部、自动化 webhook 操作改进、应用内代理工具审批跟踪、OTel 流量自动直写、PostHog 和 Mixpanel 集成等。修复涉及代理会话取消、仪表板成本显示、MCP 工具模式验证、正则回溯 DoS 防护、Datadog 追踪中移除用户邮箱等。此外,还进行了多项性
OpenAI Agents JavaScript 库发布 v0.15.0,默认模型改为 gpt-5.6-luna,并支持 MCP v2 协议协商。新版本增强了 RunState 的持久化能力,包括输入、工具输出和重试状态,同时改进了沙箱挂载凭据的安全性。此外,还增加了对 React Native 和 Realtime 的支持,并提升了 OpenAI 和 AI
Anthropic 宣布其未公开的 Claude 研究模型在黎曼猜想上取得重大进展,将满足猜想的零点比例下界从 41.6% 提升至 67.2%。该研究由 60 个智能体协作完成,人类仅提供鼓励。结果已通过内部数学家审阅和形式化验证,但未完全解决猜想。
该研究提出了一种有状态的多智能体LLM验证流水线,用于汽车基于模型的系统工程中的跨视图接口对齐。该框架采用顺序生成矩阵和基于车辆信号规范的检索增强生成,并通过独立的AI验证器代理进行对抗性审计,以消除幻觉。在高级驾驶辅助系统场景中,该方法实现了97%的实体可追溯性和85%的F1分数,而标准RAG的实体可追溯性为0%。
NeuroPilot是一个多智能体系统,将神经影像处理、质量控制和数据管理数字化为三个LLM可调用的技能。该系统在17个队列(超过123,000名受试者)中部署,覆盖从婴儿到老年的多种MRI模态。QC代理筛选了558名生产受试者,婴儿处理流程在QC验证输入上实现了100%的完成率,并将传统2-3个月的训练和数据处理时间压缩到一周。
该研究提出一个基于主体的模拟框架,探讨移动性、有限记忆和网络拓扑如何共同影响少数派推动社会惯例转变的临界阈值。研究发现,在许多配置下,惯例转变几乎不可避免,因此重点转向收敛速度,并建立统一预测模型,表明移动性是主要加速因素,而记忆和连通性以系统方式调节收敛。该模型不仅适用于惯例转变,也适用于规范变化等传染类社会过程。
该研究提出一种验证驱动的闭环多智能体大语言模型框架,用于符合规范的结构设计。框架将外部物理验证器的反馈注入修复循环,结合三层有限元验证系统与双节点修复机制,使代码合规率从56.8%提升至98.6%,综合评分从63.8提升至71.4。研究还发现性能提升主要归因于外部验证器而非骨干模型,并开源了基准测试和实验脚本。
本文提出 VeloCity,一种面向网联自动驾驶汽车(CAV)的去中心化多智能体时空移动性规划框架,用于任意城市区域的交通管理。该框架将移动性优化分布到各车辆,通过本地协调器进行时空槽预留,无需场景特定调整即可保证无碰撞且物理可行的轨迹。在东京、曼哈顿、罗马和博洛尼亚四个真实城市地图上的大规模仿真表明,VeloCity 相比现有模型显著降低出行时间,并能在高
arXiv 上发布了一项名为 MasDrift 的新基准,用于评估多智能体系统中的授权保留能力。该基准包含 600 个跨八个领域的良性生产力任务,比较了单智能体、集中式和去中心化协调架构。研究发现,集中式层级在任务完成率上更高(93.9-98.6%),但未授权操作发生率也更高(2.7-19.8%),而重新锚定授权证据的防御方法能有效减少未授权操作,但会轻微降
arXiv 论文提出 SkillConsist 方法,用于检测 LLM 代理技能中的声明与实现不一致问题。该方法通过 LLM 分离声明和实现内容,构建行为图并进行双向图对齐和差异比较,以识别冲突。在包含 633 个技能的基准测试中,SkillConsist 在包级检测上达到 87.93% 的 F1 分数,比最佳基线提升 20.43 个百分点。
arXiv 论文提出 Search-G1,一种基于表征的内在奖励框架,用于训练搜索增强语言代理。该框架通过两个干预校准的读数(提示状态读数和答案承诺读数)衡量代理答案的操作性接地,以区分必要检索与冗余搜索,并在强化学习过程中周期性地重新拟合读数,使奖励与策略共同演化。实验表明,Search-G1 在多个基于搜索的问答基准上改善了接地与搜索成本的权衡,在保持竞
DocAtlas 是一个将长文档理解视为可变状态交互过程的系统,通过外部环境管理文档信息的搜索、读取、存储和展示。该系统结合了自改进检索、选择性证据访问和主动工作记忆,在固定上下文预算下运行。使用 GPT-5.4 时,DocAtlas 在 MMLongBench-Doc 上达到 71.4% 的准确率,超过人类专家参考水平;用 Qwen3.5-4B VLM 进
本文是一篇立场论文,主张用计算论证为可解释、可争议的评估型AI(EAI)提供形式化基础。EAI通过呈现竞争性假设及其正反证据来支持人类决策,而非给出单一推荐。作者提出将论证作为EAI的长期研究议程,旨在构建分布式、以人为中心的系统。