开放模型面临6个月生存危机:政策禁令风险加剧
本文警告开放权重模型面临严峻政策风险,美国白宫可能通过行政命令限制或禁止能力接近GPT-5.5、Claude Opus 4.8等前沿水平的开源模型,预计6个月内可能实施。文章指出Anthropic主导的反华模型运动实为监管捕获,其建议的禁令将摧毁美国新兴的开源模型生态。作者呼吁社区抵制此类政策,认为当前蒸馏辩论缺乏技术证据,且开放模型缺乏经济代言人。
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:39
本文警告开放权重模型面临严峻政策风险,美国白宫可能通过行政命令限制或禁止能力接近GPT-5.5、Claude Opus 4.8等前沿水平的开源模型,预计6个月内可能实施。文章指出Anthropic主导的反华模型运动实为监管捕获,其建议的禁令将摧毁美国新兴的开源模型生态。作者呼吁社区抵制此类政策,认为当前蒸馏辩论缺乏技术证据,且开放模型缺乏经济代言人。
Import AI 464期报道了Fable模型在KernelBench-Mega基准上编写GPU内核,实现18.71倍加速,创下最快megakernel记录,显示AI在自动化AI研发任务上的进步。同时,CAIS和Scale Labs的Remote Labor Index显示AI系统在在线自由职业任务上的成功率从2.5%升至16.1%,表明AI对经济就业的潜
伯克利人工智能研究实验室(BAIR)公布了2026届博士毕业生名单,他们的研究涵盖机器人、大语言模型、计算机视觉、AI安全等领域。毕业生们将前往学术界、工业界或创业,其中多人加入OpenAI、Mistral AI等公司。
NVIDIA 研究人员开发了 ENPIRE 框架,使物理机器人能够像 AI 智能体一样自主实验和学习,在 PushT 等任务上达到 99% 成功率。该框架包含环境、策略改进、评估和进化模块,但扩展时面临基础设施挑战。此外,文章引用 Matthew Tokson 的论文,指出人类常低估或高估技术影响,提醒对 AI 未来保持谨慎。
Z.ai 于 2026 年 6 月发布了开源模型 GLM-5.2,该模型在编码代理任务中表现出色,被社区视为开源代理的转折点。其性能在多个基准测试中与 OpenAI 和 Anthropic 的闭源模型相当,甚至超越,引发了广泛关注。作者认为 GLM-5.2 缩小了开源与闭源模型的能力差距,并可能对 Anthropic 等闭源实验室构成竞争压力。
Ethan Mollick 在文章中指出,AI 正从协作式聊天机器人转向自主智能体,并引用研究称 AI 已编写 80% 的代码。他宣布新书《Co-Existence》将于 10 月 20 日出版,讲述如何与有时优于人类的 AI 共存。他分享了自己写作时谨慎使用 AI 的经历,并尝试通过网站上的提示来影响 AI 推荐,但发现旧方法已失效。
Semantic Kernel 发布了 .NET 版本 1.77.0,主要更新包括默认启用 OpenAPI 插件的服务器 URL 验证,更新了 Agent Framework 迁移示例以兼容 1.0 版本,并修复了 SharpCompress 的安全漏洞。这些改动增强了安全性和兼容性。
Spring AI 发布 2.0.0-M7 里程碑版本,引入 ToolSpec 流式 API,并将 ToolCallAdvisor 设为默认工具调用管理选项,同时弃用 SSE 传输,默认采用 Streamable HTTP 协议。该版本还更新了 Gemini 模型和 Google 客户端库,移除了 CosmosDB 相关组件,并修复了多个 bug,如 Ope
Google DeepMind 宣布扩展其内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud 平台。其 SynthID 水印技术已应用于超过 1000 亿张图片和视频及 6 万小时音频,并新增 C2PA Content Credentials 验证功能。公司还推出了新的 AI 内容检测 API,并与 OpenAI
Berkeley AI Research Blog 发表文章,探讨自适应并行推理作为高效推理扩展的新范式。文章指出,现有并行推理方法(如自一致性、树搜索等)的并行结构由外部决定,而自适应方法让模型自主决定何时分解任务、并行线程数及协调方式。文章分析了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,并强调不同问
作者分享了理解开源大语言模型架构的工作流程,强调从官方技术报告入手,但指出当前论文细节不足,因此建议直接检查 Hugging Face 上的配置文件和 transformers 库中的参考实现。该流程主要适用于开源权重模型,不适用于闭源模型如 ChatGPT。作者认为手动分析架构是学习的最佳方式,尽管部分过程可以自动化。
本文由 Ahead of AI 发布,作者 Sebastian Raschka 探讨了编码代理(coding agents)的设计与组件,强调代理系统(如 Claude Code、Codex CLI)通过工具使用、内存和仓库上下文管理,使 LLM 在实际编码任务中表现更佳。文章区分了 LLM、推理模型、代理和代理框架(harness)的概念,并指出编码框架(
本文探讨了AI能力过剩但界面限制其应用的问题。作者指出,聊天机器人界面会增加认知负担,而专门的编程界面如Claude Code虽强大但不适合非程序员。文章介绍了OpenClaw和Anthropic的Claude Cowork与Dispatch,后者允许用户通过手机远程控制桌面AI代理,展示了更自然的交互方式。
DSPy 发布 3.1.0 正式版,将之前的 beta 版本转正。新版本引入了 dspy.Reasoning 以捕获推理模型的原生推理过程,新增 File 类型处理文件数据,并支持 Python 3.14。同时增强了安全防护,防止加载 pkl 文件,并修复了多个 bug,更新了文档和教程。
Google DeepMind宣布与英国AI安全研究所(AISI)扩大合作伙伴关系,签署新的谅解备忘录,将合作范围从模型测试扩展到基础安全研究。合作内容包括共享专有模型、数据和想法,联合发布报告,以及围绕AI推理过程监控、社会情感影响和经济系统评估等关键领域开展研究。此举旨在推动AI安全发展,并惠及更广泛的行业和社会。
Hugging Face 发布了 smolagents v1.22.0,包含多项改进和修复。主要更新包括支持自定义 Dockerfile、MCP 结构化输出、Modal 远程执行器,以及修复 GPT-5 和 Grok 模型不支持 stop 参数的问题。此外,还改进了文档翻译和 CI 流程。
OpenCompass 发布 v0.5.0 版本,新增了 10+ 科学基准数据集(如 MedXpertQA、ClimaQA、ProteinLMBench),支持级联评估器(Cascade Evaluator)和 Rjob Runner,并改进了 OpenAI SDK 流式支持。该版本还修复了多个 bug,增加了文档和评估示例,并欢迎了多位新贡献者。这些更新增
微软发布了 AutoGen Python 库的 v0.7.3 版本。该版本修复了多个问题,包括 RedisStore 对复杂对象的序列化、OpenAIAgent 函数工具模式,并扩展了 pydantic 模型对 anyOf/oneOf 类型的支持。此外,还添加了 gpt-5 的模型信息,并确保任务运行器工具始终严格。
微软发布了 AutoGen Python 库的 v0.7.2 版本,主要更新包括将 DockerCommandLineCodeExecutor 设为 MagenticOne 团队的默认执行器,为 CodeExecutorAgent 添加 approval func 选项,支持 OpenAI 模型客户端的 parallel tool call 配置,以及修复结
Lil'Log 发布文章《Why We Think》,回顾了测试时计算和思维链(CoT)在提升模型性能方面的最新进展。文章从人类双过程理论出发,将慢思考类比为测试时计算,并探讨了通过并行采样和顺序修正等解码策略来优化模型输出的方法。文章还提到了强化学习在提升 CoT 推理能力中的应用,并引用了 o1、o3 和 R1 等模型的技术报告。