返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 5 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Hugging Face 上基于 GPT-2 微调的 small-agentic-model-1.5B 模型卡片

Hugging Face 上出现一个名为 joaosollatori/small-agentic-model-1.5B 的模型卡片,该模型基于 gpt2 微调,采用 MIT 许可证,使用 Transformers 5.0.0 与 PyTorch 2.10.0 训练。卡片由 Trainer 自动生成,训练数据集未说明,评估集损失为 3.1493,模型描述、预期

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Krea2-Turbo 4步蒸馏LoRA发布:速度提升1.6倍

开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA NVLink 6 为 AI 工厂提供多层弹性

NVIDIA 在技术博客中介绍 NVLink 6 面向大规模 AI 工厂的多层弹性架构,覆盖物理层、链路层、系统冗余和应用软件层。物理层通过轻量级 FEC、物理层重传(PLR)和 UPHY 恢复实现无损传输,链路层采用基于信用的流控(CBFC)消除丢包,系统层消除单点故障,软件层提供 Dynamo Shadow Engine Recovery 和检查点恢复。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

用 SageMaker 无服务器定制构建 AI 产品打标系统

AWS 博客介绍如何用 Amazon SageMaker 无服务器模型定制构建 AI 产品打标系统。方案先对 Qwen3-8B 做监督微调(SFT),再用带可验证奖励的强化学习(RLVR)和 GRPO 优化,训练由 SageMaker 无服务器定制管理容量,最终模型部署到 SageMaker 异步推理做批量目录富化。文章对比了无服务器与 SageMaker

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 为 SageMaker AI 训练作业推出实例偏好列表

AWS 为 Amazon SageMaker AI 训练和 Processing 作业推出实例偏好列表功能,用户可在创建作业时按优先级指定最多五种可接受的实例类型。SageMaker 会按顺序自动评估并选择首个有可用容量的实例类型启动作业,无需手动重试脚本或轮询。该功能还支持与 Flexible Training Plans 预留容量集成,优先使用预留容量,

9月15日周二 · 15 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源模型发布

ZGCM-1:面向数学与智能体搜索的全开源高效 7B 基础模型

研究团队发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,从零训练,结合内部推理与外部工具使用,支持 256K 上下文。该模型采用架构与系统协同设计(交错门控滑窗与全注意力、稳定的 FP8 Muon 优化器)、渐进式课程与 MDP 中期训练,并借助智能体集群自主管理集群运维、数据整理与评估。在数学推理和智能体搜索任务上,其表现可与 Qwen3-235B

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Atria Dawn:智能体超级智能的黎明

研究团队发布 Atria Dawn Preview,一个通过可验证经验管线(Verifiable Experience Pipeline)训练的基础智能体语言模型,将工具交互与可执行环境及外部验证结果相连接。该模型在覆盖科研、工程和数字工作的 16 项基准测试中与前沿智能体相当,并在其中 5 项取得最高分。论文还以该模型研发过程为案例,分析 56 名参与者的

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

ShadowPEFT 正式加入 Hugging Face PEFT 库

Hugging Face 的 PEFT 库正式将 ShadowPEFT 纳入为一等方法。ShadowPEFT 与 LoRA 的适配器几何结构根本不同,但共用 get peft model 入口和适配器保存/加载路径。它引入一个带持久隐藏状态的有状态影子模型,在每层进行影子注入、基础编码和影子更新,实现跨层协调,并让任务特定组件成为可独立推理的模型。

正文结构化主题已通过公开置信门槛
量子位研究

Meta新研究:字节级蒸馏突破Token天花板

Meta FAIR与华盛顿大学发表论文,提出将知识蒸馏的学习单位从Token换成Byte,让字节级学生模型直接学习教师的字节级概率分布。团队提出Marginalize-It和End-Of-Token两种转换方法,以Llama 3-8B为教师进行实验。按缩放定律预测,End-Of-Token蒸馏的下游平均准确率上限达52.4%,比传统Token蒸馏的48.4%

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

PINN 的导数保真度失效模式:函数值训练的基准证据

该论文将「导数保真度」形式化为物理信息神经网络(PINN)的一种失效模式,并用一维基准函数进行验证。作者仅用函数值训练多层感知机拟合 sin(x) 与 exp(x),再单独评估自动微分得到的二阶导数,结果显示函数值拟合在视觉上准确的同时,二阶导数误差可能显著偏大,尤其在高曲率边界区域附近。研究据此提出一套诊断流程,用于区分函数值精度与物理残差可靠性。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

基于扰动的 VQA 图像区域标注方法 CSGR

该论文提出了一种名为 CSGR(Counterfactual Search for Grounding Regions)的自动标注流程,通过分割模型提出候选区域、用修复模型扰动这些区域,并测量其对模型答案分布的影响,从而识别出对答案起关键作用的「模型因果视觉证据」区域。CSGR 在多个评判模型间聚合证据以减少偏差,生成细粒度像素级标注。实验将该标注接入注意力

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

混合专家语言模型可成为强大高效的检索器

该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

多语言语音识别中的Token Merging:跨模型规模与微调的系统研究

该论文系统评估了 token merging 技术在多语言语音识别模型 Whisper 上的效果,覆盖十六种语言和三种模型规模。研究发现,合并 token 能提升计算效率,在大多数低资源语言和模型规模下几乎不损失转录准确率,且在 DoRA 微调后依然有效。结果表明 token merging 是一种让多语言语音识别部署更快、更便宜的高实用方法。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

XHToken 发布 Spark-X2.5-4B 与 1.7B 通用语言模型

XHToken 发布 Spark-X2.5-4B 与 Spark-X2.5-1.7B 两款紧凑型通用语言模型,采用混合注意力架构(1 层全注意力加 3 层滑动窗口注意力),原生支持最高 1M token 上下文与 200 多种语言。模型在华为昇腾集群上基于约 20 万亿 token 预训练,并通过大规模强化学习与 MOPD 后训练提升推理、编码与智能体能力。

正文结构化主题已通过公开置信门槛
量子位开源

7名博士生3个月从零训练7B大模型并全流程开源

北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开源模型权重、训练代码、数据配方、中间checkpoint和日志。团队组建数百个Agent分头处理数据、跑实验、看日志和做评测,实践「AI4AI」研发范式,并对11类任务的Agent自主性做了L1-L5评级。ZGCM-1在多项通用评测中与Qwen3-8B等相近,部分数学推理和搜索任务可与更

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

cRia-LM-75M:75.7M 参数递归 Transformer 基座模型发布

Hugging Face 上发布了 cRia-LM-75M,一个 75.7M 参数的基座语言模型,采用 Relaxed Recursive Transformer(RRT)架构,用 11 层共享循环块执行两次遍历,第二次遍历使用 rank-172 LoRA 参数。训练分三阶段:Stage 1 在 10B token 上预训练 2K 上下文,Stage 2 用

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

AgentionAI 发布 Signal 3.8 27B:Qwen3.8 高效微调 GGUF

AgentionAI 发布 Signal 3.8 27B,这是对 Qwen3.8-27B 的微调版本,以 GGUF 格式提供,采用自蒸馏训练,不引入外部数据。官方评测显示其答案 token 减少 25%、思考 token 减少 41%,同时 GSM8K 准确率持平或提升,并借助内置 MTP 草稿头提升投机解码接受率,端到端生成时间最多缩短约 19%。

正文结构化主题已通过公开置信门槛
MIT Technology Review AI观点

AI 行业转向末日论:头部实验室呼吁放缓 LLM 开发

Anthropic CEO Dario Amodei 发表文章呼吁放缓大语言模型开发速度,OpenAI CEO Sam Altman、Google DeepMind 主席 Demis Hassabis 和 SpaceXAI CEO Elon Musk 均表示支持。文章指出,这些头部 AI 实验室的公开表态转向“末日论”,但立场模糊,且可能出于商业考量。文章还

正文结构化主题已通过公开置信门槛
THE DECODER商业

OpenAI被曝雇数百合同工阅读ChatGPT用户对话

据404 Media调查,OpenAI雇佣数百名合同工阅读真实的ChatGPT用户对话,用于改进模型回复。这些审核员按1到7分给回复打分,并负责减少模型过度谄媚和拟人化行为。审核内容虽经匿名化处理,但仍可能包含敏感个人数据,且部分用户曾明确要求ChatGPT保密。OpenAI仅在FAQ中低调提及人工审核,用户可关闭默认开启的“Improve the mode

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

用 NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练

NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform