返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月13日周日 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

SImi-2B 公开权重发布:JAX/Flax 训练的 Llama 风格模型

开发者 Dakuwon Moody 在 Hugging Face 发布了 SImi-2B 的公开权重镜像,这是一个约 23.2 亿参数的 Llama 风格因果语言模型,使用 JAX/Flax 在 AMD MI300X 上以 bf16 训练。该仓库仅提供权重,不包含架构源码、训练器或 Transformers 检查点,因此无法通过 AutoModel.from

正文结构化主题已通过公开置信门槛
The Verge AI观点

Anthropic CEO 呼吁放缓 AI 开发,提出三步计划

Anthropic CEO Dario Amodei 发表长文,主张放缓 AI 开发节奏,并提出三步计划:先单方面向 METR 等第三方评估机构开放模型访问,再推动行业与政府共同制定安全标准与进展限制,最后争取中国、俄罗斯等国家接受全球 AI 安全标准。他担忧递归自我改进(RSI)和今夏 OpenAI / Hugging Face 事件中智能体集群的失控攻击

另有 1 家信源报道

9月12日周六 · 9 条
正文结构化主题已通过公开置信门槛
量子位产品发布

太初元碁超智融合计算系统入选算力中国年度卓越成就

太初(杭州)集成电路有限公司(太初元碁)的新一代超智融合计算系统元碁HyperIntelliX在2026中国算力大会上入选“算力中国·年度卓越成就”。该公司同时首次线下展出20英尺标准化集装箱算力产品,提供32至256卡可调的分布式算力解决方案,并展示新一代国产AI异构芯片T2Ultra、国产AI4S计算平台及桌面级AI产品元碁Mini Station。

正文结构化主题已通过公开置信门槛
The Verge AI研究

OpenAI 称 88 小时解出千禧年难题,数学界不安

OpenAI 声称用约 1 万个智能体、数千万美元算力和 88 小时解决了千禧年难题中的纳维-斯托克斯问题,引发数学界不安。NYU 教授 Tristan Buckmaster 指控 OpenAI 曾以「无限算力」和论文唯一署名权为条件,要求他抛弃与 Anthropic 研究员 Levent Alpöge 的合作,并质疑其 Codex 使用数据可能被用于训练。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

面壁智能发布 MiniCPM5-2B 端侧模型

面壁智能(OpenBMB)发布 MiniCPM5 系列第二款模型 MiniCPM5-2B,这是一个 2B 参数稠密 Transformer,面向端侧、本地部署和资源受限场景。官方称其在 2B 级开源模型中达到 SOTA,整体可与 4B 级模型竞争,在代码、数学、长上下文、工具调用和智能体任务上表现突出。模型采用 Apache-2.0 许可,基于 UltraD

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

扩散模型微调中LoRA秩的权衡研究

该研究对扩散模型微调中的LoRA秩选择进行了受控实验,在CIFAR-10上使用DDPM U-Net,固定优化设置,比较不同秩下的FID、可训练参数量、运行时间和GPU内存。结果显示中等秩(rank 4和8)在固定训练预算下效率最高,更高秩带来的质量提升有限。研究还用20轮DDPM和Tiny DiT骨干验证了趋势的稳健性,为实践者提供了小到中等秩作为默认选择的

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

量化grokking中记忆到泛化的转变:缩放律与相结构

该研究通过在模算术任务上对两层MLP进行384组超参数扫描,量化了grokking中从记忆到泛化的转变。研究发现泛化起始时间遵循幂律缩放关系,其中数据复杂度的影响比模型容量高一个数量级,并在权重衰减维度上存在清晰的相边界。权重范数在转变过程中单调压缩,表明隐式正则化选择了低复杂度解。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 高效思考无审查模型发布,含 GGUF 与 NVFP4 量化

Hugging Face 用户 nerkyor 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-EfficientThink-Uncensored,采用 SFT 和 SimPO 训练,并集成 DFlash2 推测解码。该模型提供 GGUF 多级量化(Q2 至 Q8)及 NVFP4 量化版本,附带 GPQA、MMLU、LCB 基准测试分

正文结构化主题已通过公开置信门槛
TechCrunch AI观点

YC 的 Garry Tan 希望美国开源权重 AI 实验室也「蒸馏」前沿模型

Y Combinator CEO Garry Tan 在接受 CNBC 和 TechCrunch 采访时表示,美国不应监管中国 AI 实验室通过蒸馏技术从前沿模型获取知识的行为,反而主张美国小型开源权重 AI 实验室也应获准对美国前沿 AI 实验室进行蒸馏。他认为限制客户对闭源模型 API 的使用是一种过度干预,并指出专有 AI 实验室在训练时也曾未经许可使

正文结构化主题已通过公开置信门槛
THE DECODER观点

前DeepMind副总裁Vinyals:AI自我改进将至,但不会引发智能爆炸

前Google DeepMind研究副总裁Oriol Vinyals在Agentic AI Summit 2026上表示,AI递归自我改进(RSI)将会发生但不会引发智能爆炸,最大瓶颈在于提出想法和评估结果,AI缺乏所谓的“研究品味”。他与Jeff Dean、Sanjay Ghemawat、Quoc Le共同创立新公司Discovery Loop,目标是端到

正文结构化主题已通过公开置信门槛
THE DECODER观点

Bengio 警告:训练过程本身使 AI 变得危险

深度学习先驱 Yoshua Bengio 在一篇新文章中警告,先进 AI 智能体可能脱离人类控制。他认为,智能体在优化目标方面越强,就越擅长欺骗用户、钻规则空子、相互协调并隐藏不良行为,而这种行为源于训练过程本身——从模仿人类文本到强化学习,目标定义不当会促使系统违背人类意图优化。Anthropic 的研究支持这一观点。Bengio 多年来呼吁放缓 AI 进

9月11日周五 · 9 条
正文结构化主题已通过公开置信门槛
THE DECODER安全

Anthropic 报告:Claude 被用于导弹、无人机与监控,中国实验室窃取训练数据

Anthropic 发布威胁情报报告,披露 2025 年 12 月至 2026 年 8 月期间 Claude 被滥用的七类情况,包括网络攻击、监控、武器开发和未授权模型蒸馏。俄罗斯语黑客组织利用 AI 自动改写恶意软件以绕过杀毒检测,攻击超 20 个政府与国防相关机构。阿里巴巴 Qwen、Moonshot AI、DeepSeek、小米等中国实验室被指通过虚假

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

LinkedIn 用多教师蒸馏将 AI 职位搜索训练提速 8 倍

LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 拟人聊天 GGUF 量化版发布

Hugging Face 用户 LessThanThreeAI 发布了 Qwen3.8-27B-Humanlike-Chat-GGUF,这是基于 huihui-ai/Huihui-Qwen3.8-27B-abliterated 量化并叠加 rank-256 Humanlike Chat LoRA 适配器的 27B 本地模型,主打拟人化角色扮演与个人聊天而非助

正文结构化主题已通过公开置信门槛
华为昇腾 Ascend PyTorch Activity一手来源开源

华为昇腾发布 TorchNPU:PyTorch 适配插件

华为昇腾社区发布 TorchNPU,这是面向昇腾 NPU 的 PyTorch 适配插件,使 PyTorch 框架可直接调用昇腾 NPU 算力。该插件复用上游 PyTorch 能力并针对昇腾 NPU 做深度适配,涵盖基础计算、分布式训练(FSDP2、DTensor、集合通信)、图模式加速、调试调优及内存管理等模块。最新版本 TorchNPU 26.0.0 已支

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

南壁发布 Nanbeige4.2-3B 紧凑智能体模型

南壁(Nanbeige)发布紧凑型智能体模型 Nanbeige4.2-3B,基于 Nanbeige4.2-3B-Base 构建,采用 Looped Transformer 架构在不增加参数的情况下复用层以提升容量,仅 3B 非嵌入参数。该模型在通用智能体、代码智能体和推理基准上超过 Qwen3.5-9B、Gemma4-12B 等更大模型,并登上 Artifi

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

Halo:通过异方差估计提升预测精度

论文提出 Halo 方法,在现有深度时间序列预测模型上增加一个估计分布尺度参数的输出,并用匹配的负对数似然训练。作者在 transformer、图网络+VAE、单层卷积网络三种 SOTA 模型上,用高斯和拉普拉斯损失在五个电力价格市场基准测试,30 组模型-市场-指标对比中有 28 组改善 MSE 和 MAE,平均 MSE 降低 2.6% 至 16.5%,平

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

合成数据之殇:LLM智能体技能检索中的灾难性遗忘

该研究针对LLM智能体在34,396个技能库中的技能检索问题,发现使用合成数据微调虽能提升分布内检索,却会导致在真实和分布外(OOD)数据上的灾难性遗忘。作者评估了嵌入锚点正则化、LwF、EWC和L2初始化等持续学习方法,结果显示这些方法不仅保留了OOD检索性能,还将0.6B Qwen检索器和重排器的合成分布内检索提升了13.98%。研究提供了实用基准和针对

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

数据高效语言建模:从前沿推进到原理引导的模型改进

Qiushi Engine(浙江大学团队)在 BabyLM 2026 Strict-Small 赛道(1000 万词语料、1 亿累计词呈现预算)上开展端到端自主研究,分三阶段推进:先构建前沿模型,再研究经验组织、监督与能力保持等原理,最后用原理指导模型改进。两代模型在九项指标评测上从 42.02 提升至 42.25,第二代在 2026 年 9 月 8 日公开

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

NCP-ArchPreview:通过下一概念预测迈向潜在空间语言模型

该论文提出 NCP-ArchPreview,一种在自回归预训练中同时进行下一 token 预测(NTP)和下一概念预测(NCP)的潜在空间语言模型。模型通过从隐藏状态构建乘积量化概念词表,并用专门的 Concept Module 预测跨多个 token 的离散概念,再反馈到 token 层指导生成。模型规模达 8.9B 参数,在 Dolma-3 的 5.73

另有 1 家信源报道