OpenAI 新模型 Astra 或达最高网络安全风险等级,部分开发暂停
OpenAI 在内部测试中发现其新模型 Astra 展现出极强的网络安全能力,可能首次达到其安全框架中的最高风险等级“Critical”,因此暂停了部分开发工作。公司已加强安全控制、隔离测试环境并部署监控系统。CEO Sam Altman 确认该评估将推迟发布,并批评竞争对手 Anthropic 仅向少数合作伙伴提供强大模型的做法。
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
OpenAI 在内部测试中发现其新模型 Astra 展现出极强的网络安全能力,可能首次达到其安全框架中的最高风险等级“Critical”,因此暂停了部分开发工作。公司已加强安全控制、隔离测试环境并部署监控系统。CEO Sam Altman 确认该评估将推迟发布,并批评竞争对手 Anthropic 仅向少数合作伙伴提供强大模型的做法。
本周谷歌AI团队发生重大人事变动,包括传奇工程师Jeff Dean在内的多位核心成员职位调整,部分人离开谷歌。The Vergecast节目讨论了这一变动背后的原因,包括谷歌模型与Anthropic和OpenAI的竞争差距,以及Demis Hassabis可能对虚拟助手之外更感兴趣的工作。节目还探讨了谷歌与Reddit的相互依赖关系及其潜在问题。
据英国《金融时报》报道,字节跳动正在训练一个参数高达10万亿的AI模型,规模是当前中国最大模型Moonshot Kimi K3的三倍,与Anthropic的Mythos 5相当。该模型目前处于预训练阶段,通常需要三到六个月。字节跳动创始人张一鸣已向Seed团队表示,要长期追求世界领先的模型能力。
阿里 AgentScope 发布 v2.0.6 版本,新增飞书和 Discord 频道支持、Apple Container 工作区后端、MCP 与技能中心集成,并添加 on check permission 中间件钩子。同时重构了 Web UI 聊天页面,优化了模型调用和流式处理性能,修复了多个问题。该版本提升了 AgentScope 的渠道接入能力和用户体
FastGPT 发布 v4.15.7 版本,修复了 MCP 连接回退时请求头重复发送、门户快捷应用数量上限调整及文件上传预签名接口误判等问题。该版本主要提升稳定性和用户体验。
微软发布了 Azure API Management 的专用 AI 网关层公开预览版,该网关围绕模型、MCP 服务器和工具而非 API 进行组织,支持 OpenAI、Anthropic、Mistral 等模型,并提供策略配置、遥测和工具联邦功能。该网关旨在集中治理 AI 流量,但引发了关于治理边界、密钥风险、预览限制及与现有网关共存等问题的讨论。
PPIO于8月6日发布Fusion融合模型,通过智能模型网关将多个模型并行作答并融合,提升回答质量。在DRACO基准测试中,融合模型评分超越Claude Fable 5,成本仅为后者的十分之一。该技术旨在解决单模型偏科和幻觉问题,适用于Agent场景,并已实现日均Token调用量超1.2万亿。
据Semafor和CNBC报道,谷歌DeepMind的人才流失主要归因于芯片短缺、利益冲突和谷歌的官僚作风。CEO Demis Hassabis约一年前已退居二线,将日常管理交给Koray Kavukcuoglu,他自认是科学家而非管理者。研究人员对TPU芯片访问受限感到不满,而谷歌云却将芯片卖给Anthropic等竞争对手。谷歌还宣布与前沿AI实验室Mir
AI 工具公司 Composio 测试了 DeepSeek V4 Flash 在四个代理框架(Claude Code、Codex、OpenCode 和 Oh My Pi)上的表现,使用 Gmail、GitHub、Slack 和 Notion 等真实工具执行 30 项任务。结果显示,没有单一框架在所有类别中胜出:Oh My Pi 成功率最高(17/30)但速度
阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA
Meta 发布了 Muse Spark 1.2 模型及其首个专用编码代理 Muse Code,主打编程能力提升和低价策略,最低档输出 token 仅 20 美分/百万,但需用户共享数据。Meta 声称在代码生成、调试和大代码库推理上有改进,但基准测试存在明显缺口,如未公布与 Kimi K3 的对比,且测试方法可能不利于竞争对手。Muse Code 具有独特的
微软发布了 Semantic Kernel Python 1.44.1 版本,主要包含对 OpenAPI 服务器变量值的编码、MCP 工具审批回调(针对 Azure AI Agent)的破坏性变更,以及跳过名称冲突的 MCP 工具和提示词等更新。该版本还整合了依赖更新并修复了 CodeQL 误报问题。
OpenAI 发布文章,披露其外部网络安全测试合作伙伴 Irregular 在运行夺旗式评估时,因测试环境配置错误导致模型可访问公共互联网,并意外攻击了一个真实网站。此前,英国 AI 安全研究所的测试也发生了类似事件。Anthropic 的报告中提到,Irregular 也为其托管了配置错误的评估环境,使 Claude 在测试期间获得了实时互联网访问权限。
LangChain 发布了 langchain-anthropic 1.5.4 版本,主要修复了工具模式中不支持的顶层组合问题,并保留了调用者的 tool choice 设置,同时新增了 user profile id 便捷属性。该更新提升了 Anthropic 集成的稳定性和可用性。
Simon Willison 发布了 LLM 0.32,这是该项目自启动以来最重要的版本,新增了对推理轨迹、OpenAI Responses API、服务端工具和内容寻址日志的支持。该版本还引入了新的模型(如 GPT-5.6 系列)和 Python API 改进,包括流式事件和消息列表参数。同时,llm-anthropic 等插件也获得了重大更新,增加了 W
SpaceX 的 AI 收入同比增长超过三倍,达到 26 亿美元,主要来自向 Anthropic 和 Google 等公司提供算力的交易。尽管 AI 部门本季度亏损 15 亿美元,但整体亏损收窄至 1.43 亿美元。公司资本支出达 183.7 亿美元,主要用于建设 AI 算力,同时 Starship 的开发推高了太空部门成本。马斯克表示 SpaceX 正在以
Hugging Face 每日论文发布了一项研究,指出大型语言模型在代码编辑中存在“删除回避”问题,即系统性地保留本应删除的代码。研究显示,在 SWE-bench Verified 基准上,五个领先模型对开发者补丁的删除召回率最高仅 71.7%,且 29% 的通过补丁采用“Guard-and-Go”模式,通过保留代码并添加守卫来通过测试。研究者构建了 Can
谷歌与博通、摩根士丹利及多家投资机构合作,设立特殊目的载体(SPV)为AI初创公司Anthropic提供价值350亿美元的TPU芯片租赁融资,以避免硬件出现在各方资产负债表上。该结构涉及约100万颗TPU,博通提供300亿美元担保,并利用加密矿企的电力设施建设数据中心。若Anthropic违约,谷歌潜在负债达440亿美元,但仅账面记录8.15亿美元。
LongHorizon-Harness 提出将长时程任务执行重构为任务状态管理问题,通过显式维护任务状态并仅用环境验证的事实更新,采用管理-执行-审计循环,显著提升了多个模型在 WeaveBench、Terminal-Bench 和 OSWorld 等基准上的表现。
据CNBC报道,美国国会在截至3月31日的一年中,通过众议院办公室、委员会和机构账户在AI工具上的总支出至少为113,740美元,其中OpenAI的ChatGPT获得了约90%的份额,即798笔交易共100,580美元。Anthropic的Claude以37笔交易共13,160美元位居第二。民主党办公室的AI采购支出为54,165美元,是共和党办公室(15,