2026年前沿模型如何基于结果进行训练
本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:39
本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。
AMD宣布收购AI推理芯片公司Taalas,计划将其技术纳入加速器路线图。Taalas采用模型硬化路线,将模型权重固化进硬件,以降低推理成本和提高速度,首款芯片HC1运行Llama 3.1 8B时生成速度达1.7万Token/s。该路线面临模型迭代风险,但Taalas通过可编程SRAM和掩膜修改应对。业内专家认为,AMD此举如同购买拖拉机,其价值取决于是否存
Manus 宣布恢复独立运营,此前被 Meta 收购后因数据合规要求进行拆分。作为分拆的一部分,部分用户数据将在 2026 年 8 月被删除,官方提供备份和恢复工具。Manus 表示将推出新功能,继续拓展通用 AI Agent 能力边界。
Accel 在不到两年内关闭了一只新的 5.5 亿美元印度基金,作为其 35 亿美元全球融资的一部分,该基金超额认购并在数周内完成。Accel 认为印度下一波创业浪潮将由 AI、消费互联网、金融科技和先进制造驱动,AI 是横向技术而非独立类别。公司将重点投资 AI 应用层和企业软件,而非基础模型,并计划从 2027 年开始部署新基金。
在2025年1月的JPM制药大会上,OpenAI支持的初创公司Chai Discovery(估值40亿美元)宣布了多项大型AI制药工具交易,包括与礼来、诺华和argenx的合作。联合创始人Matt McPartlon和产品负责人Neil Patil在播客中表示,AI模型质量的提升使制药公司信任这些工具,从而解锁了药物发现的新能力,将科学转变为工程。Chai通
谷歌CEO桑达尔·皮查伊宣布,Gemini应用月活跃用户数突破10亿,成为谷歌第14个达到此里程碑的产品。Gemini的增长速度与OpenAI的ChatGPT相当,后者在6月达到10亿用户。谷歌持续将Gemini整合到搜索、工作空间、安卓等产品中,并推出Gemini 3.5 Flash模型以提升编码和AI代理任务能力。此外,63%的用户使用语音功能,Gemi
另有 1 家信源报道
LangChain 发布了 langchain-core 1.5.4 版本,包含多项修复和兼容性更新。主要修复包括与 pydantic 2.14 的兼容性、StructuredPrompt 不再修改调用方 kwargs、保留 RootModel runnables 的扁平工具参数模式、关闭流式追踪器中内部创建的事件循环,以及处理 BaseTool 子类的注入
由xAI联合创始人Igor Babuschkin创立的AI初创公司River AI,在成立仅两个月后获得了由General Catalyst和AMP PBC领投的11亿美元融资,Nvidia、AMD Ventures、Y Combinator和Temasek参投。River AI旨在从头重建AI技术栈,包括训练、模型、产品层和硬件,以开发个人可训练的AI助手
Anthropic 宣布其未发布模型在黎曼猜想上取得重大进展,显著提高了该猜想成立的下界。该模型在无专业数学训练的员工引导下,通过 60 个子代理协作,测试了 650 个想法,花费 3100 万输出 token,最终由两名子代理提出关键数学思想,并经内部数学家验证和 Lean 证明助手形式化。这一成果引发数学界对 AI 在数学发现中作用的争议,部分数学家担忧
Nvidia发布了开源权重模型Nemotron 3.5 Lightning,该模型拥有316亿总参数但仅激活36亿参数,在智能指数上达到24分,与OpenAI的gpt-oss-120b持平,但推理速度接近每秒670个token,远超同类模型。该模型在代理基准测试中表现显著提升,采用宽松的OpenMDW-1.1许可证,并提供BF16和NVFP4权重,多家云服务
戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东跟投,蚂蚁首次投资触觉感知层。戴盟推出全球首个触觉锚定世界模型Daimon-TWM,参数规模达10B级,在物理认知评测中表现优于π0.5,并已服务OpenAI、Figure等全球客户。资本正从具身本体涌向触觉感知层,戴盟在8项关键指标上实现全球第一。
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提
NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单
Anthropic计划于9月或10月进行IPO,估值达9650亿美元,这将成为AI行业估值的基准。在初步投资者会议中,投资者对中国廉价AI模型的竞争、与特朗普政府的政治紧张关系以及数据中心建设的阻力表示担忧。Anthropic淡化中国竞争,强调其专注于顶级模型,并计划通过健康与生物学应用来应对负面情绪。此次IPO的定价和上市后表现将影响整个AI行业的估值。
Anthropic 宣布将对其 AI 模型(包括 Claude)生成的文本添加水印,以遵守欧盟《人工智能法案》的透明度规范。该水印基于 C2PA 标准,会在文本复制粘贴时保留,并适用于所有 Claude 产品。此举是 AI 行业应对监管和用户反弹的一部分,其他公司如 OpenAI、Google 等也已承诺遵守该规范。
谷歌创始人布林紧急接管Gemini团队,但据SemiAnalysis分析,Gemini 3.5 Pro已被悄悄取消,谷歌面临旗舰模型缺失的困境。同时,谷歌内部发生重大人事变动,包括哈萨比斯卸任DeepMind CEO、Jeff Dean等元老离职,以及算力分配问题(如向Anthropic提供TPU)引发战略争议。布林重新深度参与Gemini战略,但谷歌在AI
英伟达CEO黄仁勋宣布与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR等华尔街机构合作,建立独立融资平台,计划撬动超过5000亿美元第三方资本用于AI基础设施建设。黄仁勋提出AI工厂概念,将GPU算力包装为可投资的基础设施资产,并回应了循环融资的质疑。文章同时提及算力价格近期上涨,但也警示了类
Anthropic宣布将在新款Claude模型中嵌入隐形文本水印,并签署欧盟AI法案透明度准则,该机制适用于2026年8月2日后发布的所有模型,全球推行。水印作为文本一部分,复制粘贴和编辑后仍可能保留,同时为支持的文件类型添加C2PA元数据。此举引发网友争议,但Anthropic称不影响生成质量,并计划提供检测工具。
本文批评了马克·扎克伯格关于AI未来的宣言,认为其强调AI代理提升效率的愿景忽视了人际关系和爱好中个人投入的重要性。作者通过个人轶事和扎克伯格与女儿烘焙的例子,指出AI无法替代真正的关注和体验,并质疑AI生成内容的艺术价值。
马克·扎克伯格发布了一篇6500字的宣言,阐述Meta AI构建的“个人超级智能”愿景,强调AI将带来个性化教育、法律公正等积极影响。然而,文章因回避AI实际滥用问题(如学生用聊天机器人代写作业)且未承认公众对科技巨头的不信任,被批评为脱离现实,可能加剧公众对AI的担忧。