谷歌拆分DeepMind团队,布林重新督战Gemini
谷歌在DeepMind换帅后开始拆分其非技术团队,将其划归公司总部,以减少中间环节并加速Gemini进入产品。联合创始人谢尔盖·布林重新介入AI权力中心,推动资源向递归自我改进等方向倾斜。新负责人Koray Kavukcuoglu获得最终决策权,成为Gemini发展的核心人物。Gemini发布已推迟两个月,内部测试显示其编码能力落后于竞争对手,谷歌面临组织问
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 08:14
谷歌在DeepMind换帅后开始拆分其非技术团队,将其划归公司总部,以减少中间环节并加速Gemini进入产品。联合创始人谢尔盖·布林重新介入AI权力中心,推动资源向递归自我改进等方向倾斜。新负责人Koray Kavukcuoglu获得最终决策权,成为Gemini发展的核心人物。Gemini发布已推迟两个月,内部测试显示其编码能力落后于竞争对手,谷歌面临组织问
法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现更快的AI推理速度,其技术预览在Hacker News上引起关注,并获得了200个商业线索。Kog计划在9月前将首个大型模型推理速度提升10倍,以吸引投资并推动业务发展。
Cloudflare 宣布推出新的 Cloudflare One 功能,用于识别和检查 MCP(模型上下文协议)流量,显示哪些用户和服务器在生成该流量,并控制受管网络路径上的直接连接。这些控制措施结合 MCP Server Portals,帮助管理员确保代理使用经批准的路径,防止影子 MCP 流量。文章详细分析了 MCP 工具调用的结构,并比较了在客户端、网
本文报告了一项由AI编码代理在规范优先协议下完成的大规模架构重构案例研究。该任务涉及在717,725行代码的TypeScript应用中拆除核心生命周期不变量,跨越189个文件,且无测试预言机或人工代码审查。代理通过14轮规范细化、17轮验证循环,在31次审计中修正了201个缺陷,最终在三天内以2,430美元成本成功完成,软件行为符合规范且未观察到错误。完整规
智谱发布GLM-5.3模型,在基座不变的情况下,通过后训练技术使编程能力提升50%,并宣称在安全领域发现2436个漏洞,包括潜伏40年的DNS协议漏洞。该模型在多个评测中逼近或超越Claude Fable 5,并开源,同时推出编程工具ZCode和AutoClaw。
在InfoQ的演讲中,Baruch Sadogursky和Patrick Debois讨论了上下文工程,指出向LLM发送过多上下文(如大型CLAUDE.md文件)会导致性能下降和错误。他们提出使用技能(skills)进行懒加载,仅在需要时注入相关上下文,以优化token使用。演讲强调了上下文工程与提示工程的区别,并展示了如何通过技能描述触发上下文加载。
中国AI初创公司智谱AI发布了GLM-5.3模型,声称其是最强大的开源权重编码模型,所有改进均来自扩展的后训练。该模型在基于代理的任务上表现突出,并在网络安全方面通过训练发现软件漏洞,共发现2436个漏洞。GLM-5.3现已通过GLM编码计划提供,权重将在两周后开源。
Langfuse 发布 v4.11.0 版本,包含多项功能改进和修复。主要新增功能包括:在 trace 中如实展示超过加载上限的观测数据、暴露迁移观测证据、为应用内代理增加后台会话活动提示和 toast 卡片、为通过第三方提供商集成的旧 SDK 项目引入强制 v3 体验、使 Markdown 渲染字符限制可配置、在会话中显示现有标注计数,并在 v4 迁移侧边
本文报告了一项大规模架构重构案例研究,作者使用AI编码代理在规范优先协议下,成功拆除了一个717,725行TypeScript代码库中的核心生命周期不变量,涉及189个文件,且无人工代码审查和测试预言。通过14轮规范细化、17轮验证循环和31次审计,修正了201个缺陷,最终在三天内完成,成本为2,430美元,软件行为符合规范且无错误。该研究挑战了传统代码审查
另有 1 家信源报道
DarwinX 提出了一种通过自然选择进化智能体 harness(提示、工具、技能和控制流)的方法,在冻结基础模型的情况下,利用种群选择和验证器评估来提升性能。在多个基准测试中,该方法平均提升约 17 个百分点,例如 Terminal-Bench 2.1 从 75.5% 提升至 83.2%,WebArena-Infinity 从 43.5% 提升至 93.0
Google ADK Python 发布 v2.7.0 版本,主要修复正确性问题,包括模型能力声明、工具返回媒体、对话历史保留、Jinja2 指令模板等改进。该版本还优化了启动速度和热路径性能,并将 pyarrow 从 gcp extra 移至新的 bigquery-analytics extra,这是一个破坏性变更。
llama.cpp 发布 b10417 版本,主要修复了 LFM2 工具调用参数名前缀歧义问题,该修复由 Claude Opus 5 协助完成。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
OpenAI 推出了名为 Ultrafast 的新模式,使最新模型 GPT-5.6 Sol 的处理速度提升至标准处理的 14 倍,每秒可生成多达 750 个输出 token。该模式由 OpenAI 与芯片制造商 Cerebras 合作提供支持,目前仅向少数客户开放预览,未来将扩大访问范围。OpenAI 表示,Ultrafast 可应用于事件响应、客户服务、金
另有 1 家信源报道
IBM宣布与OpenAI建立合作伙伴关系,将OpenAI的模型和工具引入其全球咨询业务,以拓展企业AI市场。双方将联合营销AI产品,并为金融、政府、电信和零售等行业开发定制解决方案。IBM将在其咨询部门设立专门的OpenAI实践团队,培训数万名顾问,并将OpenAI的模型(如GPT-5.6、Codex和ChatGPT Work)集成到其AI平台IBM Con
谷歌发布了Gemini 3.7 Flash模型,距离上一代Gemini 3.6 Flash仅三周。该模型在编码和AI代理方面性能显著提升,在FrontierCode和DeepSWE基准上分别达到43.6%和65.3%,超越Claude Sonnet 5和GPT-5.6 Terra。API定价为每百万输入token 0.75美元,输出token 3.75美元,
Hugging Face 社区在 2026 年 7 月 15 日至 8 月 2 日举办了 ICML 2026 开放复现挑战,参与者使用 AI 智能体复现了 2200 篇论文。结果显示,51% 的论文至少有一个声明被独立验证,23% 的论文有声明被证伪或质疑。挑战还确认了多起论文错误,包括证明缺陷、理论不匹配和评估偏差。该活动表明,AI 智能体可以大规模辅助科
DeepSeek正式发布并开源了DeepSeek Harness(DSH),这是一款为自进化与DIY设计的Agent框架,采用Cordis插件架构,一切皆可插拔,内置超100个插件。实测显示DSH在长程任务能力上表现优于Codex,但UI细节仍有差距。DSH被视为Agent时代的安卓,旨在通过开放生态推动AI自进化。
Vercel 正式发布了 v0 API 的通用版本,提供对其 AI 驱动的应用构建代理的程序化访问。开发者可以通过 API 发送提示,让 v0 生成和修改应用文件,在 Vercel Sandbox 中运行应用,并获得可嵌入的预览 URL。该 API 支持同步、异步和流式请求,并支持从 GitHub 仓库、ZIP 归档或文件集创建应用,还可连接 MCP 服务器
微软宣布将消费者版 Copilot 应用与面向企业的 Microsoft 365 Copilot 应用合并,并淘汰多项不成功的 AI 功能,包括 Group Chats、AI 播客、Copilot Labs 实验功能和 Deep Research,同时移除动画角色 Mico。此举旨在简化产品体验,承认此前策略过于复杂,难以与 ChatGPT、Claude 和
AI电影平台Higgsfield发布了新片《Cully Hill Boys》,该片由真人编剧撰写剧本,并使用其Cinema Studio工具和Seedance 2.5模型生成。影片的亮点被认为来自人类艺术家的贡献,如导演风格和剧本结构。Higgsfield公开了制作提示词,以展示其AI电影制作能力,并作为其新功能的广告。