返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月6日周四 · 6 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

Hugging Face 每日论文介绍了 ABSeeker,一种通过答案回溯信用分配(ABC)框架训练长时程搜索智能体的方法。ABC 将稀疏的轨迹级结果转化为密集的步骤级监督信号,奖励有用动作并抑制错误或冗余动作。基于 Qwen3.5-4B 训练的 ABSeeker 在 BrowseComp 和 BrowseComp-ZH 上分别达到 37.3% 和 39.

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

华为IJCAI 2026四篇论文:从规模密度转向设计密度

华为在IJCAI 2026上发表了四篇论文,分别涉及层次化视觉Transformer扩展到30B参数、可学习帧选择器提升视频描述、表征感知模块化框架降低跨任务适配成本,以及语码转换语音翻译的MoE架构。这些研究体现了从规模密度向设计密度的转变,强调通过架构和训练策略优化来提升效率。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

mmMind:姿态引导的毫米波雷达行为理解模型

arXiv 论文提出 mmMind,一种雷达-语言模型,利用同步 3D 姿态作为训练监督,使基础模型能理解毫米波雷达数据。该模型通过姿态引导预训练学习人体结构和运动,推理时仅需雷达输入,并用于行为描述和时空问答。作者还发布了包含 17.9 小时真实数据的 mmMind-Bench 基准,实验表明 mmMind 在多个任务上优于现有基线。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

矩估计的信任域框架

本文提出了一种用于理解自适应矩估计(如Adam)在随机梯度优化中行为的信任域框架。该框架通过p阶矩约束限制每个权重的更新步长,推导出一系列基于二阶矩和归一化p阶矩的学习率机制,其中p=4时涉及峰度估计。实验表明,在GPT2-124M模型上,当信任域约束较弱时,四阶矩实现优势明显;随着约束增强,二阶矩实现更具竞争力。

正文结构化主题已通过公开置信门槛
DeepSpeed Releases一手来源产品发布

DeepSpeed v0.19.4 补丁发布:多项修复与增强

DeepSpeed 发布了 v0.19.4 补丁版本,包含多项修复和改进,涉及 ZeRO 优化、AutoTP、MoE 路由、学习率调度器、梯度累积等。该版本增强了 ZeRO-3 推理、AutoTP 的 HuggingFace 支持,并修复了多个 bug,提升了稳定性和性能。

正文结构化主题已通过公开置信门槛
Apple Machine Learning Research一手来源研究

DLR-Lock:通过深度低秩残差蒸馏锁定预训练权重

Apple 与东京大学的研究者提出 DLR-Lock 方法,通过将预训练模型中的 MLP 替换为深度低秩残差网络(DLR-Net),利用自动微分的推理-训练不对称性,增加微调时的激活内存和计算开销,从而阻止未经授权的权重修改。该方法在保持模型能力的同时,能抵御完全了解防御策略的自适应攻击者。该论文已被 ICML 2024 的 Efficient System

8月5日周三 · 5 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

MemSFT:通过外部参数化记忆缓解对齐税

MemSFT 提出了一种通过外部参数化记忆来缓解对齐税的方法,在不更新骨干网络的情况下,训练外部记忆模拟非参数检索器在领域数据上的行为,并通过学习到的路由器在解码时动态融合记忆和骨干输出分布。在生物、地球科学和法律领域,使用 Qwen3-8B 到 Qwen3-235B-A22B 的模型评估显示,MemSFT 显著提升了领域性能,同时通用性能几乎无下降,而完整

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-27B 多阶段微调模型突破 ARC-C 700 分

DavidAU 发布了基于 Qwen3.6-27B 的多阶段微调模型 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP,声称在 ARC-C 基准上首次突破 700 分,超越 OpenAI、Claude 和 Gemini 的闭源模型水平。该模型在 4bit 和 8bit 量化下均超过基座模型,

正文结构化主题已通过公开置信门槛
The Verge AI商业

SpaceX AI 收入激增三倍,但亏损持续

SpaceX 的 AI 收入同比增长超过三倍,达到 26 亿美元,主要来自向 Anthropic 和 Google 等公司提供算力的交易。尽管 AI 部门本季度亏损 15 亿美元,但整体亏损收窄至 1.43 亿美元。公司资本支出达 183.7 亿美元,主要用于建设 AI 算力,同时 Starship 的开发推高了太空部门成本。马斯克表示 SpaceX 正在以

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Wnuan:面向企业专有知识问答的分阶段后训练方法

Wnuan 提出了一种三阶段后训练流程,用于企业专有知识问答,包括从文档构建任务导向监督、带通用数据回放的监督微调,以及针对残余错误的强化学习。在 WnuanBench 基准上,32B 模型的可接受答案率从 52.76% 提升至 91.51%,但通用基准平均分下降 5.17 分,主要影响指令跟随能力。研究还发现残余错误采样优于全池和随机采样,并指出 RAG

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

删除回避:LLM 代码编辑中的隐藏缺陷及缓解方法

Hugging Face 每日论文发布了一项研究,指出大型语言模型在代码编辑中存在“删除回避”问题,即系统性地保留本应删除的代码。研究显示,在 SWE-bench Verified 基准上,五个领先模型对开发者补丁的删除召回率最高仅 71.7%,且 29% 的通过补丁采用“Guard-and-Go”模式,通过保留代码并添加守卫来通过测试。研究者构建了 Can

8月4日周二 · 9 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Liquid AI 发布 LFM2.5-2.6B:高效本地智能体模型

Liquid AI 发布了 LFM2.5-2.6B,一个 2.6B 参数的小型语言模型,专为本地和边缘设备上的智能体部署而设计。该模型通过四阶段后训练(包括 SFT、教师专业化、多领域策略蒸馏和智能体强化学习)在工具使用、指令遵循和多步智能体任务上表现出色,可与 4 倍大的模型竞争。LFM2.5-2.6B 支持高效的 CPU 和 GPU 推理,在 Apple

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

冻结像素扩散模型可通过自身样本实现自我引导

该研究提出了一种名为合成自引导(SSG)的方法,使冻结的预训练像素空间扩散模型能够利用自身生成的样本进行自我引导,无需从头训练新模型。通过在中间层附加轻量级预测头,并利用中间层与最终层预测之间的差异作为采样时的引导方向,该方法在ImageNet上显著提升了生成质量,将FID降低超过50%,且适配器训练计算量不到全模型训练的1%。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

仪电智算护航全国青少年AI大赛决赛

首届全国青少年人工智能大赛决赛在上海举办,上海仪电作为战略合作单位提供高性能算力集群和仪电智算云平台支撑,保障三大赛道稳定运行。赛事吸引近4万名学生参与初赛,数百名选手进入决赛。上海仪电通过弹性调度、网络安全保障和跨部门专项团队,确保赛事平稳落地,未来将继续深化合作支持青少年AI教育。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

商汤与NTU推出NEO-unify:原生统一多模态模型新范式

商汤科技与南洋理工大学联合推出NEO-unify(预览版),这是一种原生、统一、端到端的多模态模型范式,无需预训练编码器或VAE。该模型通过自建表示空间直接学习近无损输入,结合Mixture-of-Transformer架构和统一的文本与视觉生成学习。初步实验显示,NEO-unify(2B)在图像重建和编辑任务上表现良好,并展现出更好的数据扩展效率。团队计划

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

几何引导的视觉-语言混合专家负载均衡方法 ReBA

Hugging Face 每日论文发布了一篇关于视觉-语言混合专家模型负载均衡的研究。论文提出 ReBA 方法,通过分别平衡图像和文本的负载、以图像为单位进行路由决策,解决了标准辅助损失在混合负载下可能隐藏模态特定不平衡的问题。实验表明,ReBA 在四个视觉-语言 MoE 骨干网络上降低了负载不均衡,同时保持了任务准确率。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DAPD:双锚定策略蒸馏缓解语言模型特权幻觉

本文提出了一种名为DAPD(双锚定策略蒸馏)的新框架,用于解决语言模型后训练中在线策略自蒸馏(OPSD)存在的特权幻觉问题。DAPD通过双路径锚定和双源锚定两个层面的锚定机制,消除了教师模型与学生模型在推理时的信息不对称。实验表明,DAPD在Qwen3-4B上平均提升2.00分,在4B和32B规模上分别提升2.69和2.78分,显著优于OPSD。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SKT:通过验证合成数据实现规模化技能使用训练

SKT 是一种基于验证的合成数据生成流水线,用于提升语言模型代理的技能使用能力。它从 2000 个公共技能中生成 4000 个任务包和 27164 条验证轨迹,并通过监督微调显著提升模型性能。研究还构建了 SkillEval 基准,验证了该方法在不同模型和代理框架中的有效性。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

代码作者归属从竞赛到课堂不具泛化性

一项研究微调预训练Transformer模型CodeBERT,在Google Code Jam竞赛数据上达到92.6%的Top-1准确率(10位作者),但在大学课程作业数据集上表现仅与随机基线相当(Top-1准确率0.2%或更低)。多模型基准测试显示该性能差距普遍存在,表明基于竞赛数据的基准高估了代码作者归属在教育场景中的实际适用性。