返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月14日周一 · 16 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

AWS 生成式 AI 定制化光谱:从提示工程到自定义模型

AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DataFlex-RL:RLVR 数据策略评估平台

该论文提出 DataFlex-RL,一个用于在统一 GRPO 配方下比较 RLVR 数据策略(rollout 选择、重加权、领域混合)的评估平台。实验使用 Qwen2.5-7B-Base 和 Llama-3.1-8B-Base,在 12 个数学、逻辑与科学基准上测试 13 种配置、12 个匹配种子,发现均匀采样比未训练检查点平均准确率提升 7.76 个百分点

正文结构化主题已通过公开置信门槛
THE DECODER研究

克雷数学研究所称纳维-斯托克斯千禧年难题“显然已被解决”

克雷数学研究所(CMI)就千禧年大奖难题之一的纳维-斯托克斯问题发表声明,称该问题“显然已被解决”,解决方案目前正在审查中。数学家 Tristan Buckmaster 指控 OpenAI 在有关其研究的传闻泄露后,将资源转向该问题,将其草稿用于训练数据,并拒绝其合著者、就职于 Anthropic 的 Levent Alpöge 署名。CMI 表示审查过程刻

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GigaChat 发布 3B 双向嵌入模型 Giga-Embeddings-instruct-3B-0826

Hugging Face 上发布了 GigaChat 系列的新文本嵌入模型 Giga-Embeddings-instruct-3B-0826,基于 Qwen3 架构(36 层、hidden 2048、约 3B 参数),将自注意力改为双向 encoder 风格,并用 InfoNCE 对比损失训练。模型采用 mean pooling + L2 归一化,支持俄语和

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

Hanselman:AI接管常规工作后,软件行业应借鉴护理导师制培养开发者

微软GitHub副总裁Scott Hanselman在播客中提出,随着AI代理承担初级开发者原本的训练任务,软件行业应借鉴护理行业的导师制,设立专职培训新工程师的导师,并以培训效果而非代码产出作为考核标准。他指出AI擅长生成功能但架构设计能力差,工程师需作为审查者和协调者保持人类判断。他还警告企业过度追求短期优化会忽视人力资本和导师制投资,导致初级工程师培养

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Feyospace-v1:七人团队如何训练前沿网络安全模型

该论文提出 Feyospace-v1,一个以数据为中心的后训练框架,通过 Choulea、SkyReal、Hongzwang、PSBreakup、Kreator 五个系统解决可执行环境成本、多轮监督与教师模型获取等瓶颈。团队构建可重置的代码、漏洞、CTF、内核、固件等环境,经执行验证与证据审计后保留 164,269 条轨迹用于长上下文监督微调。三个检查点在

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

violetxi 发布 92M Block-MTP 国际象棋文本生成模型

Hugging Face 用户 violetxi 发布了一个 92M 参数的 Block-MTP 模型检查点(step 235000),基于 transformers 库,支持文本生成,标签涉及国际象棋、block-mtp 和截断 BPTT。该模型采用三路循环打分机制,每次生成三个 token 的块,不支持 KV 缓存和束搜索,上下文为 1024 个逻辑 t

正文结构化主题已通过公开置信门槛
THE DECODER政策

Altman 呼吁放缓 AI 发展但承诺快速进步仍将继续

OpenAI CEO Sam Altman 呼吁为先进 AI 建立全国统一的安全框架,并主张行业不应等待立法者,同时表示 OpenAI 现在会在可能带来重大能力跃升的训练前设定明确的安全协议。他强调“放缓”不等于“停止”,AI 进步仍将保持快速。周末 Anthropic CEO Dario Amodei、前 DeepMind CEO Demis Hassab

正文结构化主题已通过公开置信门槛
量子位产品发布

元空智能发布端侧模型Boxer及Agent产品,拿下惠普预装

元空智能(元空AI)发布端侧模型Boxer、办公Agent元空AI Work和科研Agent元空AI Science,提出「生产力=模型×Agent×设备」的端侧AI公式,主张设备是持续产生稀缺数据的环境,让模型与设备共同进化。其Boxer-35B-A3B-v0-0819在自建WorkArena评测中得73.1分,并在40 TOPS、不到8GB内存占用下保留

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

InitGen:智能助手交互发起候选生成框架

OPPO 小布助手团队提出 InitGen 框架,用于智能助手在用户表达意图前生成候选交互查询。该方法联合生成候选集合并通过加权偏好优化对齐用户反馈,权重来自用户活跃度和下游排序分数,同时采用滚动窗口更新策略。在线 A/B 测试中,点击率从 0.95% 提升至 1.61%(相对提升 69.1%),查询曝光量增加 17.9%,完整候选集生成耗时 180 毫秒,

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

代码LLM离线后训练:性能、效率与崩溃

该研究探讨代码大语言模型能否完全离线进行强化学习后训练,而不依赖在线采样。作者在Qwen Coder、DeepSeek Coder和CodeLLaMa等0.5B至7B参数模型上,使用CodeNet数据集进行实验,发现仅需数小时训练即可显著提升零样本代码生成性能。研究还发现离线RL对学习率和训练轮数高度敏感,长时间训练会导致模型崩溃,其主因是logit方差而非

正文结构化主题已通过公开置信门槛
量子位研究

CosmosMind发布MetaRSI-v1:统一RSI的元递归架构

CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家高校发布MetaRSI-v1,称其为全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,可改进自我改进过程本身。在无外部教师模型参与下,30亿激活参数小模型在四项基准平均自我提升10.9分,GPT-5.6、Claude Opus 5等六款前沿模型平均提升7.3

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

打破视觉-动作捷径:面向可泛化机器人基础模型的潜在接口训练

该论文提出 Latent Interface Training(LIT),一种与框架无关的两阶段训练策略,用于提升机器人基础模型在视觉分布偏移下的动作泛化能力。第一阶段在不使用图像的情况下,基于语言、机器人状态和末端执行器 SE(3) 位姿训练动作先验;第二阶段引入受位姿监督的潜在接口,作为预训练动作专家唯一的视觉条件通路。在 Pi0.5、MolmoAct2

正文结构化主题已通过公开置信门槛
量子位商业

智谱提前剧透GLM-6.0:完全自训练方法公开

智谱在港交所公告配售新H股并发行201.4亿元人民币零息可转债,合计预计净募约393亿港元,上市不到九个月累计净募约755亿港元。约60%资金将投入下一代GLM基础模型和“完全自训练”体系研发,该体系被定义为递归式自我改进闭环,涵盖数据自产、环境自造、基础设施自我优化三个维度。公告还预告GLM-6.0将提升有效规模、原生多模态统一建模和长程任务强化学习能力,

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源观点

从ChatGPT到开源模型:我的AI探索之路

一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限

正文结构化主题已通过公开置信门槛
智东西商业

智谱完成335亿元融资,押注RSI自训练体系

智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛

9月13日周日 · 4 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

AllSpark 发布开源搜索智能体 Iris-mini 与 Iris-pro

中国实验室 AllSpark 发布开源搜索智能体 Iris-mini(350 亿参数)和 Iris-pro(3970 亿参数),基于 Qwen 系列模型,支持 256K 上下文,并公开完整训练配方。训练数据从网页链接结构反向构造多步问题,经两阶段过滤和强化学习(SFT-RL climbing)优化。团队称两者在各自规模的开源搜索智能体中表现最强,并指出运行时

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

kikusuka/breezy-78m-pretrain 模型卡

Hugging Face 上出现了一个名为 kikusuka/breezy-78m-pretrain 的模型,由 Trainer 自动生成模型卡。该模型是基于 generator 数据集微调的 78M 参数版本,但模型描述、预期用途和评估结果均未填写。训练使用 AdamW 优化器、余弦学习率调度和原生混合精度,共 50000 步。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

斜跃智能完成数亿元天使+轮融资,推进Duplex Reasoning具身基础模型

斜跃智能完成数亿元天使+轮融资,投资方包括线性资本、钧山资本、弘颐资本、隐山资本等。公司由理想前AI首席科学家陈伟与前产品线总裁张骁联合创立,以家庭为第一落地场景,推进Duplex Reasoning范式驱动的具身基础模型。资金将用于具身基础模型训练、算力与数据基础设施建设、核心团队扩充及家庭机器人本体研发和场景验证。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.8-27B 多阶段微调 GGUF 模型

开发者 DavidAU 在 Hugging Face 发布 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF,这是基于 Qwen3.8 27B 的多阶段微调与合并模型,提供常规与 MTP 的 Neo/NEO MAX GGUF 量化版本。模型宣称在 arc