返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月25日周五 · 4 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布6

IFM 发布 K2-Horizon-7B 开源稠密模型,支持 512K 上下文

IFM 在 Hugging Face 发布 K2-Horizon-7B,这是 K2-Horizon 系列的中等规模稠密解码器模型,拥有 512K 原生上下文窗口。模型在数学、编程、长上下文与推理等基准上对标 Gemma 4-12B、Qwen3.5-9B、Granite 4.2-8B 等参考模型,并公开训练数据、训练配方、训练代码与评测资源,同时提供中间检查点

正文结构化主题已通过公开置信门槛
智东西商业2

DeepSeek被曝冲刺5000亿元估值,年化营收达67亿元

据The Information报道,DeepSeek年化营收运行率已达10亿美元(约67.13亿元人民币),较数月前不足5亿美元翻倍以上,由创始人梁文锋在投资者会议披露。DeepSeek正敲定新一轮500亿元人民币融资,目标估值5000亿元人民币,并同步筹备科创板IPO。其收入几乎全部来自API调用,涨价后客户未流失,但公司仍将超70%算力投入新模型训练,

正文结构化主题已通过公开置信门槛
智东西模型发布3

科大讯飞发布全国产算力语音识别大模型Spark-ASR-2.0

科大讯飞于9月24日推出语音识别大模型Spark-ASR-2.0,基于全国产算力训练的语音基座模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。该模型融合非自回归与LLM增强的自回归识别能力,通过投机解码实现先快速识别再重点纠错,推理成本较上代仅增10%,已上线讯飞输入法并通过讯飞开放平台

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

UkisAI 发布 Swift-Qwen3.8-27B 高效推理模型

UkisAI 发布了 Swift-Qwen3.8-27B,这是基于 Qwen3.8-27B 微调而来的推理高效衍生模型。该方法通过识别并惩罚导致过度思考的推理标记 token,使思考 token 数量减少 58.3%,性能损失低于 1%,在多个任务上实现约 1.95 倍加速。模型还引入了来自 BottleCap AI 的 ThinkingCap-Qwen3.

9月24日周四 · 14 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程2

NVIDIA 博客:用 Transformer Engine 高效训练生物基础模型 MoE

NVIDIA 发布技术博客,介绍如何利用 Transformer Engine(TE)和 BioNeMo MoE recipe 高效训练生物基础模型。文章指出 MoE 架构虽能更高效扩展模型容量,但面临专家计算碎片化、路由通信开销和内存压力等瓶颈。TE 通过 GroupedLinear、MXFP8 低精度训练和融合 GroupedMLP 内核(整合量化、Sw

正文结构化主题已通过公开置信门槛
量子位研究1

任少卿署名新论文:MM-Future让自动驾驶多未来联合规划

蔚来智能驾驶基础模型预研团队在任少卿指导下发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出多模式世界—动作联合模型,可一次生成多组配对场景—动作假设并让场景与动作双向演化。在NAVSIM-v1上取得94.0 PDMS、NAVSIM-v2上取得91

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布4

inclusionAI 开源 Ling-mini-2.0:16B MoE 模型仅激活 1.4B

inclusionAI 开源了 Ling 2.0 系列首个模型 Ling-mini-2.0,这是一个基于 MoE 架构的大语言模型,总参数 16B、每 token 仅激活 1.4B(非嵌入 789M),在 20T+ tokens 上训练。该模型采用 1/32 激活比、MTP、QK-Norm 等设计,宣称以 1.4B 激活参数达到 7-8B 稠密模型性能,在

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究2

漂移契约:面向深度鲁棒局部学习的谱更新

该论文研究将 Muon 风格的谱更新几何(动量正交化加谱步长缩放)应用于逐层局部学习,此前这一交叉领域未被研究。在 CIFAR-10 MLP 基准上,单一固定步长设置在宽度 128 至 2048、深度 12 至 48 的网格中均为最优,而局部 Adam 需沿两个轴重新调参且在深度 48 时崩溃(31.3%)。作者进一步提出「漂移契约」,将步长表述为每层、输入

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究1

阶段监督潜在推理实现单次JavaScript反混淆

该论文提出一种阶段感知的潜在推理框架,用于JavaScript反混淆。方法将确定性反混淆工具产生的中间输出转化为监督信号,基于Coconut(连续思维链)范式训练模型,使其在训练时学习多阶段重写过程,但在推理时仅接收混淆代码并一次性生成清理后的程序。在JsDeObsBench上的初步结果显示,基于Coconut的模型将语法有效性提升至50%(直接微调为15%

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究2

Ovis-Embedding:推进通用全模态嵌入前沿

该论文提出 Ovis-Embedding,一个基于 Qwen-Omni 预训练理解模型构建的全模态嵌入模型家族,通过共享多模态骨干网络将文本、图像、视频和音频编码到统一表示空间。研究采用低秩对比预训练、同源采样、focal loss 和嵌入蒸馏等训练优化策略,并在推理时用低秩特征分解实现紧凑嵌入。在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 R

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究2

现有预条件器能否提升生物医学表格基础学习?TabPFN优化实证研究

该研究对TabPFN v2.5在59个生物医学数据集上的微调进行了实证研究,比较了五种基于AdamW的预条件优化策略。结果显示,原始AdamW优化器在预测性能和统计排名上始终最佳,而现有的曲率感知预条件器未能带来可靠改进。作者认为通用预条件方法可能无法充分捕捉生物医学表格学习的优化特性,需开发面向医疗的专用预条件器。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究1

ItColBERT:意大利语专用后期交互检索器

研究团队发布了 ItColBERT,一个 135M 参数的意大利语专用后期交互检索器,基于 PyLate 并遵循 ColBERT-Zero 训练配方,在单张 RTX 3090 上约 14.5 GPU 小时完成训练。在四个意大利语检索基准上,它优于除 mLateOn 外的所有通用后期交互基线,且参数更少。主要发现是方法学上的:在 MLDR-it 上,对未改动检

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究1

病理引导跨模态对比学习实现CT无创肾癌分级

达特茅斯学院等机构的研究者提出 RCC-Align,一种跨模态对比学习框架,在训练阶段利用配对的病理全切片图像与 CT 数据,将组织形态学中的分级判别信息迁移到 CT 表征中。在 TCGA 和 CPTAC 队列上评估,RCC-Align 对低级别与高级别透明细胞肾细胞癌分类的 AUC 为 0.601,优于仅用 CT 的 DINOv2-Finetuned 基线

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布3

F5-TTS 掸语干净词表模型发布

Hugging Face 上出现了一个名为 innkl24/f5-shan-tts-model 的模型,基于 F5TTS v1 Base 构建,采用 cc-by-nc-4.0 许可,面向掸语(Shan/Tai-Yai)。该模型使用仅含掸语的干净词表(75 个字符),并已扩展 embedding,便于后续微调。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源开源1

NVIDIA 开源 NVCRE:在 AI 负载上线前验证 GPU 集群就绪

NVIDIA 发布开源 Kubernetes 控制器 NVCRE(Cluster Readiness Engine),用于在 AI 生产负载上线前验证 GPU 集群就绪状态。它通过运行真实的分布式工作负载(如 NCCL 通信测试、DCGM 诊断、NeMo 预训练)并按拓扑感知分组测量结果,将失败精确定位到具体节点和类别。该工具填补了 Kubernetes 缺

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源开源1

NVIDIA 开源 NodeWright:不中断工作负载的 Kubernetes 节点管理工具

NVIDIA 发布开源项目 NodeWright,用于在 Kubernetes 集群中声明式地配置和更新节点主机操作系统,同时不中断正在运行的工作负载。NodeWright 此前以 Skyhook 之名在 NVIDIA 内部生产环境运行,现正式开源并更名。它通过 operator、自定义资源和包三个组件,结合 PodDisruptionBudgets、节点选

正文结构化主题已通过公开置信门槛
智东西产品发布2

平头哥发布真武V900并开源SAIL软件栈

平头哥在2026杭州云栖大会发布新一代训推一体AI芯片真武V900,性能达上一代真武M890的3倍,计划2027年第一季度量产。次日,平头哥公布开源AI软件栈T-Head SAIL最新进展,宣布扩大框架适配、加速库、工具链、通信库等领域的开源力度,SAIL已适配260余个主流框架,平均适配时间小于7天。真武AI芯片已服务20多个行业、650多家客户,SAIL

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
智东西研究1

梁文锋署名,DeepSeek公开Agent训练沙盒平台DSec技术细节

DeepSeek创始人梁文锋署名的最新论文公开了Agent训练沙盒平台DSec(DeepSeek Elastic Compute)的技术细节,该平台自DeepSeek V4技术报告首次出现,支撑了从V3.2到V4.1的RL训练与评测。DSec单日服务约300万个沙盒,峰值并发超38万个,通过四种后端、分层镜像按需加载和rollout与GPU训练分离等设计解决

另有 1 家信源报道

9月23日周三 · 2 条
正文结构化主题已通过公开置信门槛
THE DECODER观点

Anthropic 工程师解释:Claude 模型更聪明,写作却变差

Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释,为何模型在数学、代码和推理上越来越强,写作质量却停滞甚至变差。他指出,新模型被优化用于数学和代码,并被训练成面向其他 AI 模型生成技术解释,从而形成人类读者觉得过于密集的“Claudeish”文风。Kernion 表示 Opus 4.6 是最后一个写作表现好的模型,

正文结构化主题已通过公开置信门槛
THE DECODER商业1

Basecamp Research融资1.4亿美元,用进化数据训练生物AI模型

伦敦AI初创公司Basecamp Research完成1.4亿美元融资,投资方包括英伟达、Anthropic的Anthology Fund、NATO创新基金等,由S32领投。该公司利用来自雨林、海洋和温泉的遗传物质训练名为EDEN的生物AI模型,用于设计抗生素和细胞疗法工具。其CTO Phil Lorenz在采访中表示生物学问题远比语言复杂,公共基因组数据库