GLM-5.3发布:Coding接近Fable 5,安全能力登顶开源
智谱今日发布GLM-5.3模型,在Coding能力上接近Claude Fable 5,并成为最强开源安全模型。该模型在CyberGym白盒代码审查中得分84.5%,高于前代及GPT-5.6 Sol。智谱联合清华、南开等机构进行了密集红队测试,累计发现2404个漏洞,其中1088个为中高危。实测显示GLM-5.3能完成可交付的模拟游戏开发,并能自主发现、修复安
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
智谱今日发布GLM-5.3模型,在Coding能力上接近Claude Fable 5,并成为最强开源安全模型。该模型在CyberGym白盒代码审查中得分84.5%,高于前代及GPT-5.6 Sol。智谱联合清华、南开等机构进行了密集红队测试,累计发现2404个漏洞,其中1088个为中高危。实测显示GLM-5.3能完成可交付的模拟游戏开发,并能自主发现、修复安
Deepseek 发布了 V4-Pro 模型的更新版本(V4-Pro-0813),在代理基准测试中得分显著提升,但仍落后于 Claude Opus 5 等顶级模型。同时,公司开源了其代理软件 Deepseek Harness(MIT 许可),并提高了 API 价格,尤其是缓存命中的费用。这些举措发生在公司融资和准备 IPO 的背景下。
Agno 发布了 v2.9.0 版本,新增 StudioRunnerTools 工具包,支持身份感知的组件调度,并修复了多个 bug。安全方面,阻止了 MCP 工具调用时覆盖 tool name 的漏洞,并修复了工具结果缓存的跨用户泄漏问题。此外,反序列化时遇到无法解析的引用现在会明确报错,而不是静默降级。
LangChain 发布了 langchain-anthropic 1.5.6 版本,主要修复了 tool search tool result 块的规范化问题,并更正了 Fable 5、Sonnet 5 和 Opus 4.1 的模型配置文件数据。该版本更新旨在提升 Anthropic 模型在 LangChain 框架中的兼容性和稳定性。
SpaceXAI 发布了新模型 Grok 4.6,在 Artificial Analysis Intelligence Index 上得分 61,与 OpenAI 的 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude Opus 5 和 Claude Fable 5。该模型在代理任务上表现优异,在 GDPval-AA v2 基准上排名
另有 1 家信源报道
根据Pangram、OpenRouter和Similarweb的最新数据,谷歌的Gemini在AI市场份额上持续下滑,从12%降至1.9%,而OpenAI的ChatGPT保持50%以上份额,Anthropic的Claude从4.3%升至14.9%。Similarweb显示谷歌网站市场份额微降,但同比仍大幅增长。数据来源各有局限,但均指向Gemini使用率下降
一篇研究论文展示了如何通过重放加密的推理块,从Claude、GPT和Gemini等前沿模型中提取隐藏的推理痕迹,并成功移植到其他模型或会话中,从而显著提升开源模型性能。初步扫描约7000个公共痕迹发现62个API密钥、33个邮箱和33个密码等敏感数据泄露。该漏洞已负责任披露,部分已修复,但类似攻击仍可能发生。
Hugging Face 发布新基准 VibeLifeBench,用于评估长期主动型生活代理,包含 200 个跨 10 个日常领域的多周任务,模拟 22 个模拟服务和 288 个工具。评估发现七个前沿模型表现均不佳,最佳模型 Claude Opus 5 平均得分仅 32.5,且所有模型在时间线推进中性能下降 10-15 分。该基准强调代理需主动发现静默变化并
本期早报涵盖AI行业多项动态:DeepSeek招聘土木工程师并组建Harness团队,拓展算力基础设施与代码智能体;原阿里千问负责人林俊旸创立语用科技,获腾讯等投资,聚焦下一代AI智能体;宇树科技公布中签结果;Manus将恢复独立运营;OpenAI前机器人业务负责人加入Anthropic;智谱ZCode用户破百万并上线新功能。
研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 36
另有 1 家信源报道
安全研究人员发现了一个影响所有主要AI提供商API的漏洞,可以读取推理模型的加密思维过程。通过越狱,他们使用较小的模型转录更强大模型的原始推理,并在公开会话中暴露了密码和API密钥。该漏洞还加剧了关于推理蒸馏的争议,并揭示了模型内部使用难以理解的语言或考虑欺骗行为。
OpenAI Agents JavaScript 库发布 v0.15.0,默认模型改为 gpt-5.6-luna,并支持 MCP v2 协议协商。新版本增强了 RunState 的持久化能力,包括输入、工具输出和重试状态,同时改进了沙箱挂载凭据的安全性。此外,还增加了对 React Native 和 Realtime 的支持,并提升了 OpenAI 和 AI
OpenAI Agents Python SDK 发布 v0.20.0 版本,将默认模型改为 gpt-5.6-luna,并支持 MCP Python SDK v1 和 v2。该版本还引入了 RunState.add input() 用于暂存持久化用户输入,并增强了沙箱挂载的凭证安全验证。此更新对使用自定义 MCP HTTP 传输的应用可能产生破坏性影响,需要
加州大学伯克利分校发布的CyberGym基准测试显示,国内机构与达酷诺威联合研发的DoGNAVY以90.8%的通过率排名全球第三、中国第一,超越OpenAI和Anthropic的模型。DoGNAVY仅使用开源的GLM-5.2模型,通过结构化工作流、漏洞可达性分析、动静结合分析和知识库实现高效漏洞挖掘。其背后的AgentDoG架构提供智能体安全诊断能力,用小模
Cloudflare 宣布了一项开发者预览功能,允许任何网站通过仪表盘中的单个开关启用 WebMCP(Web 模型上下文协议)接口。该功能使基于浏览器的 AI 代理能够通过结构化工具与未修改的网页交互,而无需抓取或猜测,从而保留人类流量和对原始站点的控制。Cloudflare 的实现基于一个注入的 bridge.js 模块,并包含两个工具包:内容凭证和站点
Cloudflare 在 Agents Week 期间发布了一系列面向 AI 代理的产品和工具,包括新的代理运行时 @cloudflare/computer、Cloudflare Agents 平台、Cloudflare Wallets、WebMCP 接口、Kitesurf 浏览器以及 MCPv2 协议。这些发布旨在构建一个开放、安全的 Agentic In
另有 1 家信源报道
Meta 发布了 30B 参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可,可在消费级 GPU 上本地运行,并在多数基准测试中优于同类竞品。扎克伯格同时发表文章,捍卫模型蒸馏的合法性,并呼吁美国在开放模型领域保持领先。Meta 计划未来几周发布更强模型 Muse Spark 1.2 的开放权重版本,并考虑通过云业务变现其数据中心
另有 2 家信源报道
初创公司Discovered Materials利用AI代理群寻找新型半导体材料,以解决芯片过热问题,并已获得900万美元种子轮融资。该公司结合Anthropic模型和自训练的物理模型进行材料筛选,已发现多种与现有芯片材料性能匹配的新材料,但尚未公开细节。其创始人认为,AI加速了材料发现过程,但实际合成仍是瓶颈。
气候科学家Zeke Hausfather通过分析其使用编程代理Claude Code八周的数据发现,AI代理的能耗远高于简单的聊天提示,每个提示平均消耗约150瓦时,是普通聊天提示的600倍。其全年重度使用预计排放约370公斤二氧化碳,相当于运行一年电热干衣机。Hausfather认为,降低AI碳排放的关键在于数据中心转向清洁能源,而非个人减少使用。
EverMind,由盛大集团孵化的AI研究团队,通过连续发布三篇论文,系统性地提出了自进化AI的全栈技术方案,覆盖脚手架、技能和模型权重三个层面。论文分别提出了HarnessBank框架、SkillCorpus技能库和DASH算法,旨在解决AI自我改进中的过拟合、技能管理和训练信号分配问题。此举被视为中国团队在自进化AI领域的一次重要突破,与海外NeoLab