有限Newton-Schulz的平滑效应:Muon在非光滑非凸优化中的优势
本文研究了Muon优化器中有限Newton-Schulz迭代在非光滑非凸优化中的作用。作者通过在线到非凸转换分析,证明有限Newton-Schulz迭代将不连续的极分解映射平滑为Lipschitz映射,从而使得Muon能够收敛到驻点,而精确极分解更新可能无法收敛。该结果首次表明有限Newton-Schulz迭代是有益的而非近似误差,并扩展至一般谱映射。
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
本文研究了Muon优化器中有限Newton-Schulz迭代在非光滑非凸优化中的作用。作者通过在线到非凸转换分析,证明有限Newton-Schulz迭代将不连续的极分解映射平滑为Lipschitz映射,从而使得Muon能够收敛到驻点,而精确极分解更新可能无法收敛。该结果首次表明有限Newton-Schulz迭代是有益的而非近似误差,并扩展至一般谱映射。
EduRiskX 是一个神经符号框架,结合了时间 Transformer 预测器与 F-Logic 符号推理,用于在线教育中的早期学业风险预测。在 OULAD 数据集上,它实现了 0.900 的准确率和 0.894 的 F1 分数,平均早期检测周为 9.32,检测率为 94.30%。该框架通过 F-Logic 模块提供基于规则的解释,增强了可解释性,并优于
该研究提出一种无标签的弃权微调方法,利用模型自身的冻结置信度(token概率)来教导模型在低置信度时回答“我不确定”,无需正确性标签。在六个开源模型(1B-8B)的短事实问答测试中,该方法与标签监督的弃权调优性能相当,无统计显著差异。研究还发现,该信号无法识别“自信但错误”的事实,是其盲点。
该研究探讨了监督微调(SFT)对大型语言模型指令敏感性的影响。通过Qwen3(1.7B、4B、8B)及Mistral-7B、Gemma-2-9B模型在MS MARCO和ESCI-English上的实验,发现SFT并非统一降低指令敏感性:小模型(1.7B、4B)显著降低(54-71%),而8B模型个体变化不显著,但训练指令间的对比差异可靠。跨模型结果不一致,且
arXiv 论文提出 Mixture of Roles (MoRe) 方法,通过可学习码本和查询感知路由器,将多个角色组合成单一 steering vector,在单智能体单次推理中实现多视角专业化。实验显示 MoRe 平均比单智能体基线高 2.2%,性能与多智能体系统相当,但显著降低 token 成本。该方法通过三阶段 SFT 和 GRPO 训练,且保持骨
DeepSpeed 发布了 v0.19.6 补丁版本,包含多项修复和功能改进,如修复 Ulysses 序列并行中的检查点选择、ZeRO-3 冻结参数问题,并新增对 Apple Silicon (MPS) 的支持(包括 Metal FusedAdam 内核)。此外,还实现了可配置的梯度求和归约、原生主机内存固定后端,以及 AutoTP 的不均匀分片和通用检查点
本文提出 SimGuide 方法,将用户上下文结构化为类型化、领域特定的 Sims 块,并用程序化示例进行约束,以解决个性化 AI 代理将用户视为单一实体而导致的冲突问题。作者构建了 SimBench 基准(47 个任务),实验表明程序化约束的 Sims 在 GPT-4o 上比 RAG 方法提升 7.9 个偏好遵循点,并在 Claude Sonnet 4.5
本文提出了一种名为响应重整化(Response Renormalization)的框架,用于改善深度平衡模型(DEQ)的训练稳定性。该方法通过在后向传播中提升选定的近极点分母,同时保留未提升的响应通道,从而控制临界邻域内的伴随放大。实验表明,在23个多物理场系列中,使用该方法训练的模型在超过98%的静态和95%的瞬态比较中,测试误差与精确隐式微分训练的模型相
该研究提出,训练后Transformer的权重规模可由双参数Weibull分布概括,其增长由语料库的二元条件熵(一种训练前可计算的统计量)预测。研究发现权重规模增长与可预测性边际的幂次呈仿射关系,且该关系在不同学习率下成立,并能提前预测训练结果。该定律在模型和层级别均适用,但跨语料库预测存在局限,代码语料因冗余性而偏离。
商汤科技正式开源了8B参数的生图模型SenseNova U1.5 Lite,该模型支持4K直出、长指令遵循、原生图像编辑和复杂布局,在多个核心场景上比肩闭源GPT-Image-2。模型采用NEO-unify统一多模态架构,通过多教师在线策略蒸馏技术MOPD将专项能力融合回单一模型,强调稳定性、指令遵循和编辑精度,旨在进入真实创作流程。
OpenAI Codex负责人Tibo在播客访谈中表示,ChatGPT和Codex将融合为统一的个人AGI,下一代Agent将走向云端和更大规模计算资源,并强调OpenAI已实际应用递归式自我改进。他还回顾了在Google DeepMind的经历,认为OpenAI文化更注重快速交付和自下而上的创新。
Apodex AI 发布了 Apodex 1.1 模型系列,通过扩展可执行环境和训练智能体协调长周期任务,提升复杂现实任务的持续可验证进展。该模型在专业工作、金融、科研等领域达到领先水平,并开源了 FrontierAgent 工作台和 Apodex 1.1 Mini 模型权重。
jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLL
英伟达通知部分核心客户,自明年年初起,搭载其AI芯片的服务器价格将上涨超过15%,覆盖Vera Rubin和Grace Blackwell等旗舰产品,原因是存储芯片成本大幅上涨。涨价由代工厂商向微软、谷歌、甲骨文等客户传达,英伟达未回应。此举凸显存储芯片厂商三星、SK海力士、美光在AI基础设施需求爆发下的定价话语权,并给AI数据中心建设带来不确定性。
NVIDIA 发布了 Spectrum-X 以太网架构,专为大规模 AI 工厂设计,通过硬件加速的交换机和网卡协同设计,解决传统以太网在 AI 训练中的瓶颈。该架构采用自适应路由、硬件拥塞控制和平面负载均衡,在多租户场景下将训练步进时间稳定在 668 毫秒,而传统以太网在噪声流量下延迟至 1.18 秒。这显著提升了 AI 训练的性能和隔离性。
NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数
METR 的研究显示,AI 在网络安全领域显著加速了漏洞发现,在数学领域贡献有限,而在 AI 研究本身未见明显加速。SPADE 框架通过自博弈生成可执行环境,用于训练 LLM,在 30B 规模模型上提升了基准表现。
汤森路透投资约4000万美元,基于阿里巴巴的Qwen开源模型构建了自有法律AI模型“Thomson”,并利用公司内部数据和领域专家进行训练。测试显示,Thomson在访问公司专属内容时能超越GPT-5.4等竞品,但在推理和编码方面表现较弱。公司计划将Thomson用于文档审查等高频任务,并发布小版本模型供非商业使用,以降低成本并保持独立性。
燧原科技于8月24日启动科创板发行,股票代码688801,拟募资60亿元用于第五、六代AI芯片研发及产业化等项目。公司自研四代架构、五款云端AI芯片,2023-2025年营收复合增长率达81.32%,2026年上半年营收11.2亿元,预计2026年或2027年实现盈利。此次上市有望加速国产算力产业链发展。
一篇论文提出了一种计算高效的两步超参数迁移框架,用于预测大规模混合专家(MoE)模型的最优学习率。该方法首先通过宽度缩放迁移学习率,然后外推至万亿级token训练范围,并在155B总参数(17B激活参数)的模型上成功预训练了10万亿token。实验表明,通过小规模代理模型即可高保真地预测大规模训练的最优配置,显著降低消融成本。