返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月28日周五 · 6 条
正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

有限Newton-Schulz的平滑效应:Muon在非光滑非凸优化中的优势

本文研究了Muon优化器中有限Newton-Schulz迭代在非光滑非凸优化中的作用。作者通过在线到非凸转换分析,证明有限Newton-Schulz迭代将不连续的极分解映射平滑为Lipschitz映射,从而使得Muon能够收敛到驻点,而精确极分解更新可能无法收敛。该结果首次表明有限Newton-Schulz迭代是有益的而非近似误差,并扩展至一般谱映射。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

EduRiskX:结合F-Logic推理的神经符号框架用于早期学业风险预测

EduRiskX 是一个神经符号框架,结合了时间 Transformer 预测器与 F-Logic 符号推理,用于在线教育中的早期学业风险预测。在 OULAD 数据集上,它实现了 0.900 的准确率和 0.894 的 F1 分数,平均早期检测周为 9.32,检测率为 94.30%。该框架通过 F-Logic 模块提供基于规则的解释,增强了可解释性,并优于

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

模型能否免费捕捉自身幻觉?无标签置信信号在弃权任务中媲美标签数据集

该研究提出一种无标签的弃权微调方法,利用模型自身的冻结置信度(token概率)来教导模型在低置信度时回答“我不确定”,无需正确性标签。在六个开源模型(1B-8B)的短事实问答测试中,该方法与标签监督的弃权调优性能相当,无统计显著差异。研究还发现,该信号无法识别“自信但错误”的事实,是其盲点。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

监督微调何时降低指令敏感性?

该研究探讨了监督微调(SFT)对大型语言模型指令敏感性的影响。通过Qwen3(1.7B、4B、8B)及Mistral-7B、Gemma-2-9B模型在MS MARCO和ESCI-English上的实验,发现SFT并非统一降低指令敏感性:小模型(1.7B、4B)显著降低(54-71%),而8B模型个体变化不显著,但训练指令间的对比差异可靠。跨模型结果不一致,且

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

MoRe:单智能体多角色混合实现多视角协同

arXiv 论文提出 Mixture of Roles (MoRe) 方法,通过可学习码本和查询感知路由器,将多个角色组合成单一 steering vector,在单智能体单次推理中实现多视角专业化。实验显示 MoRe 平均比单智能体基线高 2.2%,性能与多智能体系统相当,但显著降低 token 成本。该方法通过三阶段 SFT 和 GRPO 训练,且保持骨

正文结构化主题已通过公开置信门槛
DeepSpeed Releases一手来源产品发布

DeepSpeed v0.19.6 补丁发布:修复与 Apple Silicon 支持

DeepSpeed 发布了 v0.19.6 补丁版本,包含多项修复和功能改进,如修复 Ulysses 序列并行中的检查点选择、ZeRO-3 冻结参数问题,并新增对 Apple Silicon (MPS) 的支持(包括 Metal FusedAdam 内核)。此外,还实现了可配置的梯度求和归约、原生主机内存固定后端,以及 AutoTP 的不均匀分片和通用检查点

8月27日周四 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

SimGuide:程序化多上下文表示实现个性化代理规划

本文提出 SimGuide 方法,将用户上下文结构化为类型化、领域特定的 Sims 块,并用程序化示例进行约束,以解决个性化 AI 代理将用户视为单一实体而导致的冲突问题。作者构建了 SimBench 基准(47 个任务),实验表明程序化约束的 Sims 在 GPT-4o 上比 RAG 方法提升 7.9 个偏好遵循点,并在 Claude Sonnet 4.5

8月26日周三 · 2 条
正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

临界深度平衡模型的响应重整化

本文提出了一种名为响应重整化(Response Renormalization)的框架,用于改善深度平衡模型(DEQ)的训练稳定性。该方法通过在后向传播中提升选定的近极点分母,同时保留未提升的响应通道,从而控制临界邻域内的伴随放大。实验表明,在23个多物理场系列中,使用该方法训练的模型在超过98%的静态和95%的瞬态比较中,测试误差与精确隐式微分训练的模型相

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

数据可预测性决定Transformer权重规模增长规律

该研究提出,训练后Transformer的权重规模可由双参数Weibull分布概括,其增长由语料库的二元条件熵(一种训练前可计算的统计量)预测。研究发现权重规模增长与可预测性边际的幂次呈仿射关系,且该关系在不同学习率下成立,并能提前预测训练结果。该定律在模型和层级别均适用,但跨语料库预测存在局限,代码语料因冗余性而偏离。

8月25日周二 · 5 条
正文结构化主题已通过公开置信门槛
量子位模型发布

商汤开源8B生图模型SenseNova U1.5 Lite,比肩GPT-Image-2

商汤科技正式开源了8B参数的生图模型SenseNova U1.5 Lite,该模型支持4K直出、长指令遵循、原生图像编辑和复杂布局,在多个核心场景上比肩闭源GPT-Image-2。模型采用NEO-unify统一多模态架构,通过多教师在线策略蒸馏技术MOPD将专项能力融合回单一模型,强调稳定性、指令遵循和编辑精度,旨在进入真实创作流程。

正文结构化主题已通过公开置信门槛
量子位观点

OpenAI Codex负责人Tibo访谈:Agent将走向云端,ChatGPT与Codex融合

OpenAI Codex负责人Tibo在播客访谈中表示,ChatGPT和Codex将融合为统一的个人AGI,下一代Agent将走向云端和更大规模计算资源,并强调OpenAI已实际应用递归式自我改进。他还回顾了在Google DeepMind的经历,认为OpenAI文化更注重快速交付和自下而上的创新。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源模型发布

Apodex 1.1 发布:扩展智能体智能以应对复杂工作

Apodex AI 发布了 Apodex 1.1 模型系列,通过扩展可执行环境和训练智能体协调长周期任务,提升复杂现实任务的持续可验证进展。该模型在专业工作、金融、科研等领域达到领先水平,并开源了 FrontierAgent 工作台和 Apodex 1.1 Mini 模型权重。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B-heretic-dflash:非官方 5 层 DFlash 投机解码草稿模型

jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLL

正文结构化主题已通过公开置信门槛
智东西商业

英伟达AI服务器明年涨价超15%,存储成本压力传导

英伟达通知部分核心客户,自明年年初起,搭载其AI芯片的服务器价格将上涨超过15%,覆盖Vera Rubin和Grace Blackwell等旗舰产品,原因是存储芯片成本大幅上涨。涨价由代工厂商向微软、谷歌、甲骨文等客户传达,英伟达未回应。此举凸显存储芯片厂商三星、SK海力士、美光在AI基础设施需求爆发下的定价话语权,并给AI数据中心建设带来不确定性。

8月24日周一 · 6 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA Spectrum-X 以太网:重写大规模 AI 网络规则

NVIDIA 发布了 Spectrum-X 以太网架构,专为大规模 AI 工厂设计,通过硬件加速的交换机和网卡协同设计,解决传统以太网在 AI 训练中的瓶颈。该架构采用自适应路由、硬件拥塞控制和平面负载均衡,在多租户场景下将训练步进时间稳定在 668 毫秒,而传统以太网在噪声流量下延迟至 1.18 秒。这显著提升了 AI 训练的性能和隔离性。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能

NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
THE DECODER商业

汤森路透斥资4000万美元自建法律AI模型,基于阿里Qwen

汤森路透投资约4000万美元,基于阿里巴巴的Qwen开源模型构建了自有法律AI模型“Thomson”,并利用公司内部数据和领域专家进行训练。测试显示,Thomson在访问公司专属内容时能超越GPT-5.4等竞品,但在推理和编码方面表现较弱。公司计划将Thomson用于文档审查等高频任务,并发布小版本模型供非商业使用,以降低成本并保持独立性。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

燧原科技启动科创板发行,募资60亿推进AI芯片产业化

燧原科技于8月24日启动科创板发行,股票代码688801,拟募资60亿元用于第五、六代AI芯片研发及产业化等项目。公司自研四代架构、五款云端AI芯片,2023-2025年营收复合增长率达81.32%,2026年上半年营收11.2亿元,预计2026年或2027年实现盈利。此次上市有望加速国产算力产业链发展。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

逐步扩展:大规模混合专家模型的计算高效超参数迁移

一篇论文提出了一种计算高效的两步超参数迁移框架,用于预测大规模混合专家(MoE)模型的最优学习率。该方法首先通过宽度缩放迁移学习率,然后外推至万亿级token训练范围,并在155B总参数(17B激活参数)的模型上成功预训练了10万亿token。实验表明,通过小规模代理模型即可高保真地预测大规模训练的最优配置,显著降低消融成本。