AI先驱Sutton称合成数据是“大错误”
AI先驱、图灵奖得主Richard Sutton在访谈中批评合成数据是“大错误”,认为世界无限复杂,合成数据无法解决大语言模型的扩展瓶颈。他提出“大世界假说”,主张智能体应从自身经验中持续学习,而非依赖人类构建的模拟或静态训练。Sutton还指出当前语言模型缺乏持续学习能力,并介绍了其新公司Oak Lab。
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AI先驱、图灵奖得主Richard Sutton在访谈中批评合成数据是“大错误”,认为世界无限复杂,合成数据无法解决大语言模型的扩展瓶颈。他提出“大世界假说”,主张智能体应从自身经验中持续学习,而非依赖人类构建的模拟或静态训练。Sutton还指出当前语言模型缺乏持续学习能力,并介绍了其新公司Oak Lab。
InfoQ 推出了新的在线认证项目“AI辅助工程”,面向资深工程师和架构师,旨在教授如何为生产代码中的 AI 编码代理构建验证框架。项目由 Thoughtworks 的 Zichuan Xiong 和 Premanand Chandrasekaran 主持,首期课程于 2026 年 9 月 18 日开始,为期五周,费用为 1470 美元。课程涵盖代理权限、审
Anthropic 正在内部使用一款代号为“Model 2”的未发布 AI 模型,其综合性能略强于公开的 Claude Mythos 5,但在某些领域较弱。该模型在内部能力指数上比 Mythos 5 高约 1.5 点,主要用于编码、数据生成和研究工程。目前公司没有对外发布该模型的计划,并评估其错位风险为低。
智谱CEO唐杰在X上发文,提出参数数量不再是衡量模型能力的唯一标准,需结合数据量、算力分配和运行条件。GLM-5.3通过长时程环境强化学习实现性能提升,其训练环境、评判器和验证器均为合成生成。同时,Ornith-1.5等新开源模型发布,强调端到端自我改进能力。
Data-DPO 是一种面向目标模型的监督微调数据选择方法,通过单步探测观察目标模型在不同样本上的训练反馈,将样本间的激活差异转化为成对数据偏好,并训练轻量级奖励模型来学习目标模型感知的数据偏好。在最终选择阶段,Data-DPO 结合目标模型偏好、外部质量评分和边际多样性来构建训练子集。在 Vision-Flan 和 LLaVA-CoT 数据集上的实验表明,
该论文提出了一种名为MASS的分层数据选择方法,用于大语言模型的后训练阶段。MASS首先使用密集自编码器学习低维主流形坐标进行粗粒度语义分组,然后利用TopK稀疏自编码器在每个组内进行质量感知的稀疏特征覆盖。在Vision-Flan和LLaVA-CoT上的实验表明,MASS在多个数据预算下优于现有基线,有时仅用少量数据即可达到或超过全量训练的性能。
该研究针对混合PDE参数学习中的算子误设问题,提出了一种无需参考模型的检验工具,能从单次拟合中区分算子错误与参数不可辨识。实验表明,误设估计器在域内误差低于噪声,但系数偏差大,且容量无关,多种架构收敛到相同的伪真值。该工具在正确设定下保持沉默,在误设下高概率拒绝,为可部署测试提供了分离两种失败的能力。
OpenMOSS团队发布了MOSS-VL-Instruct-0408,这是一个基于MOSS-VL-Base-0408进行监督微调的多模态视觉语言模型,支持图像理解、长视频理解和实时流式交互。该模型采用交叉注意力架构和绝对时间戳,在视频理解基准上表现优异,如VideoMME和MLVU,并在视频理解上超越Qwen3-VL。模型已开源,采用Apache-2.0许可
Apple机器学习研究团队通过超过2000次语言模型训练实验,研究了数据受限条件下混合预训练的扩展规律。研究发现,稀缺目标语料可重复使用15-20次,且混合训练比单一来源训练能容忍更高的重复率。团队提出了一个考虑重复感知的混合扩展定律,可优化计算有效的数据混合配置,为数据受限条件下的预训练提供实用建议。
Apple 研究团队提出 LINK 方法,通过在预训练数据中进行词汇替换,实现低资源语言的知识迁移,无需额外训练或平行数据。实验显示在八种语言上显著提升下游任务性能,训练速度最高提升 2 倍。
NVIDIA 技术博客介绍了如何使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,重点讨论了跨网络传输的模型状态以及高效传输和聚合的方法。文章通过 FedUMM 示例展示了在冻结的多模态骨干上联邦轻量级适配器,并利用外部化、张量流和磁盘支持聚合来处理大型模型更新。该工作流支持参数高效和全模型通信模式,解决了数据分布在不同机构时的训练挑战。
鹿明机器人在WRC现场发布了机器人技能进化引擎NexCore,旨在将数据接入、治理、训练、评测、技能管理、设备运行与数据回流串成完整链路,为机器人持续进化搭建基础设施。NexCore支持多源数据接入、模型后训练、技能封装与跨本体适配,并通过仿真与真机验证确保技能可靠性。鹿明CEO喻超认为,具身智能下半场的竞争核心是数据获取效率、模型泛化能力、通用硬件成本和产
OpenAI 宣布放缓部分 AI 开发速度,以加强安全措施,包括暂停部署模型的强化学习训练两周,并推迟大型前沿 RL 运行。此举被视为对 AI 安全自愿放缓理念的公开测试,但专家指出,在激烈竞争下,自愿放缓难以持续,需要行业-wide 的协调或政府监管。
Agentic ESOpt 提出使用进化策略(ES)对长时程 LLM 智能体进行全参数微调,仅需推理级 GPU 内存,避免了强化学习(RL)中反向传播的高成本与长时程信用分配难题。该方法在 WebArena-Lite 上将 Qwen-3.5-27B 的 No Skill 基线提升 6.69%,并在 28/36 个测试时自动启发式设计设置中优于匹配基线。
该论文通过受控实验和轨迹分析,研究了技能(Skills)增强LLM代理的机制。研究发现,技能主要通过程序锚定(procedural anchoring)稳定执行,而非注入缺失知识,程序锚定占技能案例的65.7%,而显式知识注入仅占4.5%。检索是独立瓶颈,当技能池从5增至100时,实际使用精度从29.6%降至3.3%。技能在脆弱假设、不兼容上下文或适应不足时
本文以GLM-5为例,探讨九章智算云如何通过强化学习系统实现训推一致。文章指出,随着预训练边际收益递减,模型能力Scaling正转向后训练强化学习,RL成为模型能力持续提升的关键。九章智算云通过将Generator、Environment和Trainer纳入统一工作流,实现动态调度和状态资源化,提升有效Token产出率,并与模型厂商形成算法与基础设施双向RL
deepdml 在 Hugging Face 上发布了 Whisper Tiny es,这是基于 OpenAI Whisper Tiny 微调的多语料西班牙语语音识别模型。该模型在 Common Voice 26.0 等数据集上训练,最佳检查点 WER 为 16.07%,CER 为 6.04%。模型采用 Apache 2.0 许可证,适用于自动语音识别任务。
搜狐创始人张朝阳与宾夕法尼亚大学物理教授刘若微在《张朝阳的物理课》中对谈,探讨软物质物理、阻塞相变及低功耗类脑智能材料。刘若微介绍了其团队利用局域学习规则训练机械网络实现指定功能的研究,该成果有望为低能耗计算提供新路径。
CARA 是一个受认知决策过程启发的推荐智能体框架,将推荐建模为结构化决策过程,包含候选过滤和情感/理性双视角决策建模,并引入边界感知 KTO 策略优化训练。在 Amazon Reviews 三个领域上的实验表明,CARA 在多数指标上优于基线,相对提升最高达 10.15%。
本研究在Fashion-MNIST数据集上对卷积神经网络进行20步PGD攻击的轨迹级分析,比较了干净训练和对抗训练模型的鲁棒性。研究发现,损失轨迹和梯度对齐模式在鲁棒性不同的对抗训练模型间相似,而失败步数分布能更清晰地区分鲁棒性水平。作者认为轨迹级指标描述优化几何特性,但不能独立衡量对抗鲁棒性,应作为补充诊断工具。