谷歌为AI智能体打造Wiki知识库,实现经验积累与技能进化
谷歌研究院推出 WikiSkill 框架,为 AI 智能体配备持久化知识库,通过类似 wiki 的结构记录每次运行中的失败与成功经验,并生成可复用的“Agent Skills”模块来指导后续行为。该框架在多个基准测试中显著提升了模型性能,如 Gemini-3.5-Flash 平均准确率从 49.5% 提升至 68.1%,且技能可跨模型迁移。研究受 Andre
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2400 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
谷歌研究院推出 WikiSkill 框架,为 AI 智能体配备持久化知识库,通过类似 wiki 的结构记录每次运行中的失败与成功经验,并生成可复用的“Agent Skills”模块来指导后续行为。该框架在多个基准测试中显著提升了模型性能,如 Gemini-3.5-Flash 平均准确率从 49.5% 提升至 68.1%,且技能可跨模型迁移。研究受 Andre
Anthropic发布研究,基于Claude Opus 4.8构建自动化对齐研究员(AAR)系统,让Claude自主完成查论文、提方案、训练模型等研究闭环,以时薪4美元的成本在10类AI安全问题上弥合了26%-96%的安全差距,部分任务表现优于人类研究员。研究还展示了较弱模型Claude Sonnet 5训练较强模型Claude Opus 4.8的案例,但过
阿里发布Qoder桌面端,新增桌宠形态,支持语音交互和自动执行编码任务,将Coding能力从IDE扩展到桌面环境。该产品基于Agentic Coding技术,已服务全球600万用户和10万家企业客户,旨在让非程序员也能通过自然语言实现软件开发。
OpenClaw 曾因开源 AI 智能体而爆红,三个月内 GitHub Star 超 25 万,但几个月后热度消退,被 Claude Code、Codex 等 Harness 取代。其创始人 Peter Steinberger 已加入 OpenAI 开发下一代 Agent,并投资 Linux 桌面基金会。OpenClaw 虽热度下降但仍在更新,国内厂商推出
TOTVS 公司的 Fabiane Nardon 在演讲中探讨了为 AI 代理构建数据层的问题。她指出,企业数据通常为事务系统或数据分析优化,而非为代理访问设计。她建议结合事务系统与数据平台,根据工作流需求选择数据源,并利用 MCP 等协议。她还强调了在确定性软件与概率性 AI 之间划分界限的重要性,以平衡精度、安全性和成本。
Anthropic 推出了 Model Hardware Standard (MHS),旨在为 AI 代理提供统一接口以控制和读取物理设备,如实验室和工厂中的显微镜和机械臂。该标准基于 MCP 扩展,可将设备集成时间从数周缩短至数小时。早期测试显示,Claude 能自主优化工作流程并生成无需语言模型运行的脚本,但在物理因果理解上仍有局限,需要人工监督。
另有 1 家信源报道
在2026中国国际大数据产业博览会期间,华为云举办数据要素大会,发布AI-Ready数据基础设施全链路能力,涵盖可靠管数、高效供数、智能用数和可信流通。华为云Stack通过混合云架构连接云、数据中心和生产现场数据,支撑模型训练与Agent运行。徐工集团、广东电网等企业展示了数据服务AI的实践案例。
UC Berkeley 和 MIT 的研究人员发布了 FreeToken,这是一个开源推理引擎,旨在通过动态协同执行,在消费级硬件上运行前沿 MoE 模型。FreeToken 采用 q 策略动态分配 CPU 和 GPU 计算,并引入语义锚点检查点,显著提升解码和预填充速度。基准测试显示,FreeToken 在 RTX 4060 笔记本上运行 Qwen3.6-
arXiv 论文提出 Procedura,一个基于大语言模型的智能体 3D 建模框架,通过将形状表示为带类型约束的程序化装配(CSG),实现高精度、可编辑且具有部件分解的 3D 生成。在 P3D-Bench 和 MechBench-36 上,Procedura 超越了原生 3D 生成器和先前的 3D 代码智能体,无需 3D 训练即可从文本提示生成精细的多部件
PydanticAI 发布了 v2.36.0 版本,新增了 --mcp-config 支持和工具调用流式传输到 clai ,并引入了 @durable operation 装饰器及公共后端 API,以支持第三方持久化执行引擎。此外,该版本为指令部分提供了稳定的 ID,并修复了测试模型生成和 Prefect 缓存键等问题。
剑桥大学计算机科学教授兼OCaml编译器核心维护者Anil Madhavapeddy报告称,OCaml项目在补丁讨论后几分钟内就遭到利用尝试,表明自动化监控者正关注公共仓库。现代编码代理能快速发现漏洞,仅凭漏洞传闻即可找到利用方法,这使现有开源安全披露流程面临挑战。rclone维护者Nick Craig-Wood也证实,该项目最近一个月收到超过40份安全披露
Anthropic 报告其 Claude Code 和 Claude Cowork 产品出现错误,原因是上游云提供商问题,导致部分会话无法启动或中断。团队已应用缓解措施并监控恢复,问题现已解决。
另有 1 家信源报道
谷歌DeepMind扩展了其多智能体系统Co-Scientist,使其不仅能生成假设,还能规划实验、编写代码、控制实验室设备并撰写科学论文。该系统在材料科学、生物学和计算机科学三个领域进行了验证,其中在计算机科学中实现了全自动运行。尽管可靠性模块将关键结果捏造率降至4%,但基准测试结果与人类评估相关性较弱,且系统仍存在选择性报告等问题。
Vercel AI SDK 发布了 ai@7.0.84 版本,主要更新包括在 streamText 结束回调中暴露解析后的结构化输出,修复了工具审批密钥设置和正则表达式处理等问题,并更新了相关依赖。
智东西报道,Hermes Agent 推出 Real Profile Browsing 功能,可复制 Chrome 登录态到隔离浏览器,使 Agent 能以用户身份访问网站。实测发现存在浏览器卡死、Cookie 覆盖、macOS 加密限制等问题,且与 Claude Code、OpenAI Codex 的浏览器方案相比,便利与风险并存,当前可用性有待优化。
Salesforce 在构建 Agentforce 时,面临 Amazon SageMaker AI 推理组件(IC)默认放置策略无法满足多可用区(Multi-AZ)高可用合规要求的问题。AWS 通过新增 SchedulingConfig 参数(含 AvailabilityZoneBalance 和 PlacementStrategy)实现了 IC 副本跨
LangChain 发布了 langchain 1.4.0a2 的 alpha 预览版,引入了第一方适配器 langchain.mcp,可将任何 MCP 服务器转换为 LangChain 工具,直接用于 create agent。该适配器支持多种传输方式,提供结构化输出、错误处理以及可选的 elicitation 中断机制,允许服务器在调用中向人类提问。此版
百度搭子发布专业办公新标准“交付即惊艳”,现场演示长程任务自动生成新闻稿、海报等17份交付物。产品月活环比增长1063.79%,位列AI办公桌面端榜单第二。企业版推出15个套件、96个Skills,覆盖四大职能域,并配备VPC版本保障安全。底层Harness引擎降低Token消耗75%。
Anthropic 发布了面向物理设备的 AI 代理接口标准 MHS(Model Hardware Standard)预览版,旨在解决科研和工业领域硬件接口碎片化问题。该标准通过统一翻译层让 AI 代理控制显微镜、机械臂、量子计算机等设备,已在卡内基梅隆大学和 QuEra 等机构应用,显著提升了实验效率和自动化水平。Anthropic 借此从工具提供商向行业
另有 1 家信源报道
Nebius CEO Arkady Volozh在访谈中表示,新云厂商的核心竞争力已从单纯拥有GPU转向构建全栈AI云基础设施,涵盖土地、电力、数据中心到上层云服务和智能体服务。Nebius计划通过大型裸金属合同融资,同时服务中小客户,并预测未来算力仍是制约因素。