返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月4日周五 · 12 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

BCIT:自主 LLM 后训练中的条件经验迁移方法

Hugging Face 每日论文页面介绍了一篇关于自主 LLM 后训练中条件经验迁移的论文。论文提出边界校准干预迁移(BCIT)方法,通过检查上下文适用性并运行有界试验来选择性地重用过去的训练证据,减少有害更新并提高最终模型质量。在 Qwen3-4B 模型上的金融推理、文本到 SQL 和函数调用等任务中,BCIT 相比基线方法在相同计算预算下取得了更高的最

正文结构化主题已通过公开置信门槛
THE DECODER商业

Deepseek计划在内蒙古部署16万颗华为芯片,打造最大集群

Deepseek计划在内蒙古建设一个大型数据中心,部署至少16万颗华为下一代Ascend-950DT芯片,这将是已知最大的华为芯片集群,但仅用于推理,训练仍依赖英伟达硬件。由于生产限制和内存短缺,华为可能无法在一年内交付全部订单,而中国内存制造商CXMT首次小批量生产HBM3E,但技术仍落后三星等厂商三至五年。此举是中国政府推动芯片产业自主化的一部分。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Terminal-Universe:将智能体轨迹转化为可扩展终端环境

Terminal-Universe 框架通过从智能体轨迹中重建可执行的工作空间,合成多样化训练任务,并利用监督微调提升智能体性能。该方法将每条轨迹转化为可复用环境,并沿广度和深度两个维度扩展任务,最终生成 37.3k 个任务环境,使 Qwen3.5-27B 在 Terminal-Bench 2.1 上单轮性能提升 11.9 分,在 EvoCode-Bench

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

Vortex:从 S3 到 GPU 的一次拷贝数据加载革新

SpiralDB 的 Onur Satici 在演讲中介绍了其开源的列式文件格式 Vortex,该格式旨在优化从 S3 到 GPU 的数据加载流程,通过消除中间磁盘存储和 CPU 解压瓶颈,实现高达 13 Gbps 的流式传输。Vortex 支持在 GPU 上直接解压和列裁剪,从而加速机器学习训练的数据迭代。

正文结构化主题已通过公开置信门槛
MIT Technology Review AI商业

乌克兰无人机数据催生AI训练数据新市场

乌克兰战场上的无人机数据正成为国防和商业领域的新资源,乌克兰国防部已向100多家公司和英国政府开放了数千万数据点。这些数据用于训练AI模型,其价值在于战争环境提供了实验室无法复制的极端条件。然而,这一新兴市场缺乏治理规则,可能引发数据溯源、安全和经济剥削等问题。

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

AI生成菜单为何千篇一律且令人不适?

TechCrunch报道称,AI生成的餐厅菜单因训练数据狭窄且追求“讨喜”美学,导致食物图像呈现诡异完美、同质化的外观,引发顾客不适。专家指出,这源于模型对快餐连锁菜单风格的模仿和反复编辑导致的“收敛”现象,虽非模型崩溃,但会降低输出质量。研究显示,AI食物图像引发“恐怖谷”效应,加剧了公众反感,并引发对AI内容真实性及证据可信度的担忧。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

无知几何:LLM如何调节贝叶斯先验

该研究揭示了大型语言模型(LLM)在不确定时如何依赖训练语料的词频先验:其输出嵌入矩阵中存在一个单一方向,编码了语料库的unigram分布,称为“无知方向”。该方向在Llama、Qwen、Gemma和Pythia等模型家族中普遍存在,且通过线性最小二乘拟合即可恢复。研究发现,将最终预测状态投影到该方向可分解为tempered Bayesian更新,其中先验加

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

TopKSigLIP:可微子采样解决乳腺X线摄影VLM的“大海捞针”问题

本文提出TopKSigLIP,一种用于乳腺X线摄影的视觉-语言模型,通过TopK-Patch模块学习采样高分辨率补丁以解决高分辨率与稀疏病灶问题,并采用Sup-sigmoid损失替代对比损失以应对报告同质性。该模型在零样本评估中优于现有开源乳腺和通用医学VLM,在密度评估、BI-RADS分类、发现亚型和癌症预测等任务上表现更佳,且TopK-Patch模块的病

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

立场论文:无标签不等于无人类监督的视觉学习

这篇立场论文认为,视觉学习中无标签并不等于无人类监督,因为数据整理方案和训练目标中嵌入了大量人类先验。作者指出,当前“无监督”术语过于笼统,掩盖了不同方法间的差异,并观察到自2021年以来CV顶会中标题含“无监督”的论文数量下降。他们呼吁社区明确披露数据选择和训练目标中的先验,以改进学术交流、确保公平比较并保留方法论多样性。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

基于Z-Image的人物LoKR/LoRA测试模型发布

Hugging Face 用户 ifmylove2011 发布了基于阿里通义 Z-Image Base/Turbo 模型训练的人物 LoKR/LoRA 系列,用于测试人物生成效果。该系列区分基于 base 和 turbo 训练的版本,并提供了使用建议和注意事项,如触发词、采样参数等。作者强调该模型仅用于测试,禁止不当用途。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

LLaDA-Image:全开放训练配方的强图像生成模型

LLaDA-Image 是一个将 6B 扩散 Transformer 与冻结的视觉语言模块相结合的统一框架,通过仅图像预训练和 Muon 优化器生成逼真图像并支持精确编辑。该模型被蒸馏为 LLaDA-Image-Turbo,可在 2-4 步内快速推理,在 Qwen-Image-Bench 的英文和中文赛道均创下开源模型最佳成绩。研究团队已发布模型权重、训练代

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Meta 付费获取用户数据:共享提示可享 95% 折扣

Meta 为其新的 Muse Spark 模型推出“贡献者”定价模式,用户若同意共享提示和模型输出以帮助训练未来模型,可享受约 95% 的折扣。此举旨在获取训练数据,此前 Meta 内部追踪员工电脑使用的计划因批评而暂停。专家认为,这种模式可能促使企业更谨慎地处理数据,并加剧前沿实验室之间的价格竞争。

9月3日周四 · 8 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

打破黑盒:SpatialSV 用 3D 几何监督提升大模型空间智能

中山大学团队提出 SpatialSV 方法,通过在多模态大模型隐藏层引入显式 3D 几何监督(深度图、射线图、点云图),提升空间智能,并利用开源 3D 模型自动生成监督信号,减少 50% 人工文本标注。实验表明该方法能可视化模型内部表征,诊断空间推理缺陷,并在半监督条件下接近全量标注性能,为具身智能训练提供低成本路径。

正文结构化主题已通过公开置信门槛
Latent Space产品发布

Muse Spark 1.3 对标前沿模型,斯坦福推智能体工程课程

Meta 发布 Muse Spark 1.3,据称性能接近 OpenAI 和 Anthropic 的前沿模型,并承诺开放权重,训练成本可降低 90% 以上。斯坦福大学推出两门 AI 智能体工程课程,强调从提示工程转向系统化智能体构建。业界讨论 Astra 循环变压器架构的实质,以及智能体评估和技能检索的新方法。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DisCo:将 GitHub 仓库蒸馏为 AI 技能,显著提升研究代理性能

Hugging Face 每日论文页面介绍了 DisCo,一个将 GitHub 仓库中的操作知识提炼为可复用技能的研究代理。通过任务无关和任务导向两种蒸馏方式,DisCo 从 1000 个广泛使用的 ML 仓库中提炼出 5000 多个验证技能,形成 AREX-Skill 库。在固定 GPT-5.5 骨干和预算下,配备技能的代理在 MLE-bench、Pape

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

证据充分性边界训练:面向多跳问答的选择性回答方法

该研究提出证据充分性边界训练框架,用于多跳问答中的选择性回答。框架构建四级证据链,训练模型在证据不足时输出 ,证据充分时给出答案。基于Qwen2.5-3B-Instruct的实验显示,该方法在边界定位和外部不可回答集上的无支撑回答率均优于基线,同时保持竞争性的QA F1分数。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

SpeakPay:LoRA微调Whisper实现尼泊尔语金融语音识别

SpeakPay项目针对尼泊尔语金融语音识别领域,构建了首个公开的NepFinSpeech-403数据集,并通过LoRA微调Whisper large-v2模型,将词错误率从129.95%降至42.58%,交易成功率从1.67%提升至33.33%。研究还发现100-300条领域特定语音即可获得大部分适应收益,并部署了公开的语音优先网页应用。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SolarWM:开放数据与可扩展训练,实现长时程视频世界模型

Hugging Face 论文页面介绍了 SolarWM,一个用于构建交互式视频世界模型的完全开放框架。该框架通过可重构的多源数据引擎,将来自 14 个数据集的 143 万个片段统一为帧对齐的格式,并支持 Wan2.2、LTX-2.5 和 MiniMax-H3 等多种骨干网络,训练出 5B 到 33B 的模型。其统一的三阶段训练方法使得模型在仅用 5 秒序列

正文结构化主题已通过公开置信门槛
THE DECODER政策

美司法部支持AI训练版权合理使用,与版权局立场相左

美国司法部在《纽约时报》诉OpenAI和微软的版权案中支持AI公司,认为训练AI模型使用受版权保护的材料属于合理使用。司法部区分了训练复制与模型输出,并引用琼·狄迪恩的类比,强调AI训练具有创造性和公共价值。该立场与版权局的报告相悖,后者拒绝将AI训练视为普遍合理使用。

正文结构化主题已通过公开置信门槛
智东西产品发布

谷歌披露第八代TPU细节:推理芯片配288GB HBM,训练能效翻倍

在Hot Chips 2026大会上,谷歌披露了第八代TPU技术细节,包括面向推理的TPU 8i和面向训练的TPU 8t。TPU 8i配备288GB HBM和384MB SRAM,采用Boardfly拓扑降低延迟;TPU 8t通过Virgo网络和光交换支持超大规模训练,能效达前代2倍。谷歌还利用AI优化芯片设计,并强调软件兼容性。