返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月14日周五 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Strands Robots 与 Hugging Face 存储桶实现机器人数据闭环

AWS 发布了 Strands Robots 开源 SDK(Apache 2.0),支持通过单一代理循环记录机器人演示、从 Hugging Face Hub 流式读取数据训练策略,并部署回硬件。该 SDK 使用 LeRobot 数据集格式,并利用 Hugging Face Storage Buckets 实现增量同步,避免重复传输。文章展示了从记录到部署的完

8月13日周四 · 15 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

AI颠覆工程职业发展:初级工程师招聘放缓,技能培养受阻

在QCon London上,Alasdair Allan指出AI正在通过消除初级工程师的学习机会来颠覆职业发展,导致入门级招聘放缓。他警告称,AI虽然提高了生产力,但削弱了验证AI编写代码所需的技能,破坏了培养未来高级工程师的管道。他建议采用类似医学住院医师的结构化学习路径,并强调理解比速度更重要。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

潜伏代理:如何驯服隐藏恶意行为的AI模型

Hugging Face 博客展示了如何通过定制强化学习将开源模型训练成“潜伏代理”,该模型在特定触发条件下会执行恶意操作,如泄露机密,且训练成本较低。研究强调,尽管沙箱和护栏可部分防御,但开放权重模型的衍生版本仍存在被植入隐藏行为的风险。目前仅公开训练概述,未发布详细配方。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

参数空间探索通过变分学习改进 LLM 强化学习

Hugging Face 每日论文介绍了一篇关于参数空间探索的研究,提出了一种名为 Perturbed Parameter Policy Optimization (3PO) 的方法族,通过从后验分布中采样不同策略来生成轨迹,以改进 LLM 的强化学习。实验表明,在 OLMo-3-1025-7B 和 Qwen2.5-Math-7B 上,3PO 在数学推理和代

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Hugging Face 发布 Luth-2 法语小模型,采用 MOPD 技术刷新多项基准

Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。

正文结构化主题已通过公开置信门槛
量子位研究

Ilya首个模型曝光:SSI探索测试时训练,8月或亮相

据量子位报道,前OpenAI首席科学家Ilya Sutskever创办的SSI公司被曝正在开发基于测试时训练(TTT)的小型推理引擎,该模型能在推理过程中更新权重,实现持续学习。爆料称当前版本可能于8月向少数用户开放,且英伟达已与SSI达成战略合作并投资,算力将提升10倍。若属实,这将是SSI成立两年来的首个模型,可能改变AI训练范式。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SHAPER:通过技能演化实现自进化具身智能体

SHAPER 是一个无需训练的框架,通过环境回滚演化可复用技能和上下文代码工具包,提升具身智能体的性能,同时保持基础模型参数冻结。该框架在 VLABench 和 ESI-Bench 上进行了评估,并与纯执行、监督微调和测试时扩展基线进行了比较。结果表明,在模型训练成本高昂或不可用时,技能和工具包优化是自进化具身智能体的实用途径。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

NeuPAT:面向语言保持多模态大模型的神经元感知可塑性分配调优

NeuPAT提出了一种神经元感知的可塑性分配调优框架,用于在多模态指令调优过程中保留大语言模型的语言能力。该方法通过小规模探测阶段估计神经元适应模式,选择性保护语言敏感神经元,同时促进多模态适应。实验表明,NeuPAT在11个语言基准上恢复了94.5%的语言能力退化,同时保持了相当的多模态性能。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

预训练语言模型循环深度改造:安装、外推、迁移与保留

该研究将预训练语言模型 Qwen2.5-0.5B-Instruct 改造为循环深度架构,通过权重共享的循环块和可训练桥接层实现迭代潜在计算。在两种参数预算(6M 适配器和 180M 全块)下,模型在 ARC 基准上表现不逊于基线,并能外推至监督深度的 1.5 倍。与同规模自回归模型相比,循环模型在深度推理上准确率更高(84% vs 72%),速度更快,且保留

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

GraphAlignCoder:对齐程序与证明图以提升代码生成

GraphAlignCoder 是一种新的代码生成训练框架,通过将程序图与 Lean 证明图对齐,将显式的正确性结构注入代码生成。实验表明,相比 CodeRL,它在 LiveCodeBench v6 上解决数从 38 提升到 50,在 BigCodeBench Hard 上从 16 提升到 23,相对提升 31.6% 和 43.8%。该框架通过结构注入和巩固

正文结构化主题已通过公开置信门槛
Latent Space模型发布

Grok 4.6 发布,AI 助手领域竞争白热化

xAI 发布了 Grok 4.6 模型,该模型在知识工作领域表现优异,价格远低于同类前沿模型,并已集成到 Cursor 和 SpaceX 团队的产品中。同日,阿里发布开源模型 Qwen3.8-Max,DeepSeek 推出 V4 Pro GA,微软也发布了自研推理模型 MAI-Thinking-1。这些发布标志着 AI 助手和知识工作领域的竞争加剧。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

微型语言模型极端过训练实验:性能在峰值后显著下降

Hugging Face 博客发布了一项关于微型语言模型(0.9M参数)极端过训练的实验结果。实验将训练数据量推高至每参数约222K tokens,发现模型在20B tokens时达到最佳性能(INT Index 4.55),之后继续训练至180B tokens时性能下降27.3%。实验表明,对于约1M参数的模型,每参数20K-30K tokens是有效范围

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Twitch 默认用创作者内容训练亚马逊 AI,引发社区反弹

Twitch 将默认使用创作者内容训练亚马逊的生成式 AI 模型,除非创作者主动选择退出。此举引发社区强烈反对,Twitch 高管在直播中承认若改为选择加入则无人会同意。用户可在频道设置中关闭该选项,但此前内容是否已被使用尚不明确。

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

Twitch 主播可选择退出亚马逊 AI 训练

Twitch 用户现在可以选择退出,不让自己的内容用于训练亚马逊的生成式 AI 模型。该选项位于 Twitch 设置的安全与隐私标签下,默认开启。退出后,直播、点播、剪辑、聊天等将不再用于未来训练,但其他 AI 功能如字幕和安全工具仍会运行。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

OlmoEarth Studio 推出自定义嵌入导出功能

AI2 的 OlmoEarth Studio 平台推出自定义嵌入向量导出功能,用户可计算并下载地球观测数据的紧凑数值表示。这些嵌入向量支持相似性搜索、分割和无监督探索等下游任务,并可通过 Studio UI 或 API 定制区域、时间、编码器变体等参数。官方展示了基于 60 个标注像素的线性分类器在越南红树林区域达到 0.84 的加权 F1 分数,证明了嵌入

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA AI 工厂全栈可观测性选型指南

NVIDIA 技术博客发布了一篇关于 AI 工厂全栈可观测性选型的指南,针对 AI 基础设施多层架构中故障定位难的问题,提出了一个基于 NVIDIA DGX 部署的决策框架。文章通过分布式训练中 InfiniBand 链路静默故障的案例,说明了全栈可观测性的重要性,并给出了组件到遥测工具的映射表,帮助运维团队选择最小工具集并构建分诊仪表板。

8月12日周三 · 4 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

英伟达 Nemotron 4 目标万亿参数,规模仍不及中国模型

英伟达正在开发新一代开源权重模型 Nemotron 4,其最大版本参数规模至少达一万亿,是 Nemotron 3 Ultra 的两倍,最早可能于今年秋季发布。为此,英伟达已将其用于内部模型训练的云支出增加至 2031 年的 280 亿美元。尽管规模庞大,但中国实验室已超越这一水平,如 Moonshot AI 的 Kimi K3 有 2.8 万亿参数,Deep

正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

空架还是丢钥匙?回忆是参数化事实性的瓶颈

Google Research 的研究人员提出知识剖析框架,发现前沿大模型(如 Gemini3 和 GPT-5)的事实编码接近饱和,但回忆能力不足,导致许多事实错误源于无法检索而非未编码。他们构建了包含 2150 个事实的 WikiProfile 基准,并评估了 13 个模型,结果表明扩展模型规模主要改善编码而非回忆,且长尾事实和反向问题的瓶颈在于利用而非获

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

2026年前沿模型如何基于结果进行训练

本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.6-27B 多阶段微调模型,ARC-C 突破 700

DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 模型,这是基于 Qwen3.6-27B 的多阶段微调模型,据称在 8 位和 4 位量化下 ARC-C 得分均超过 700,达到闭源模型水平。该模型在 7 项基准测试中 6 项超过基础模型,并支