返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月23日周三 · 16 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

TopologicalQwen:拓扑知识蒸馏的1.7B模型

Convergent Intelligence LLC 研究部门发布 TopologicalQwen,一个从 Qwen3-30B-A3B-Thinking-2507 蒸馏得到的 1.7B 参数模型。该方法称为拓扑知识蒸馏(TKD),将教师输出分布视为有界变差函数,分解为平滑、跳跃和漂移三个通道进行知识迁移,并采用 DualMind 格式训练模型进行推理、自我

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

TAMELM-AFMoER 1B 发布:引入黑洞绳机制

研究者 reaperdoesntknow 在 Hugging Face 发布 TAMELM-AFMoER (1B) 模型,在原有 421M 版本基础上引入 Blackhole Rope(BHR)机制,通过类引力吸引子稳定多时间尺度路由并放大推理信号。模型采用 16 专家稀疏路由、CPU 单机 FP32 训练,仅用约 100 万 token 即达到 loss

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布2

Convergent Intelligence 发布符号-神经混合模型 Symbiotic-Beta

Convergent Intelligence LLC 在 Hugging Face 发布实验性模型 Symbiotic-Beta(SymLM),基于 Qwen2.5-0.5B 冻结主干,融合符号认知模块(DTE-HDM、M.A.S.R.M、QwenExoCortex 等),在 MetaMathQA 的 2.5 万条样本上微调,面向数学推理与神经符号研究。模

正文结构化主题已通过公开置信门槛
量子位研究1

DeepSeek公开Agent训练系统DSec,梁文锋署名

DeepSeek发布由梁文锋署名的论文,公开其Agent训练基础设施DSec(DeepSeek Elastic Compute)。该系统每秒可创建5000+个沙盒、日产能达300万个、峰值并发38万个,单集群约160节点、3万核CPU、250TB内存。DSec通过FnCall、Container、MicroVM、Full VM四种后端统一调度,并用EROFS

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究1

基础模型在 Lung-RADS 筛查中的性能与一致性评估

研究评估了医学基础模型 MedGemma(基于 Gemini 的医学通用基础模型)及其针对肺癌检测诊断微调版本,在 NLST 数据集上与 12 位放射科医生进行 Lung-RADS v2022 评估的对比。放射科医生平均 AUC 为 0.90(范围 0.80–0.94),原生基础模型 AUC 仅 0.70,微调后提升至 0.83,处于放射科医生表现的较低区间

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究1

大语言模型的概率结构

这篇 arXiv 论文从概率论视角统一阐述大语言模型,将 LLM 描述为 token 序列空间上的概率测度,通过自回归条件分布指定,训练被形式化为最大似然估计并用随机梯度方法求解,文本生成则视为该随机过程的序贯模拟。论文还分析了 KL 散度不对称性在文本生成中的作用,并将其与幻觉现象以及统计合理性与真实性的区分联系起来。作为同一视角的补充,论文讨论了基于 s

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究1

纯Rust端到端训练语言模型:经验报告

作者独自用纯 Rust 在租用 GPU 上以 164 美元成本端到端预训练了一个约 0.4B 参数、以孟加拉语为主的语言模型,并记录了 Candle 与 Burn 两个 Rust ML 框架作为训练后端时的缺陷分类:Candle 有 5 个缺陷(包括融合核静默不产生梯度),Burn 有 3 个缺陷(包括反向传播吞吐仅约理论值 3%、核融合路径在数十亿参数规模

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源模型发布1

Moonworks Lunara:建模艺术智能的文本到图像模型

Moonworks 提出 Moonworks Lunara 文本到图像模型,将「艺术智能」定义为先建立语义、艺术与构图约束、再在约束内实现视觉世界的两阶段计算,并采用新型 Diffusion Mixture Transformer 架构与 CAT 训练算法。团队用 GPT-5.6 Sol 作为评估器,在 1000 条提示、8000 张生成图像上对比包括 FL

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究1

检索片段训练实现高效 QMSum 查询聚焦会议摘要

该论文针对 QMSum 查询聚焦会议摘要任务,指出该基准缺少统一评分器导致结果难以比较,因此在一个实现下重新评分或生成 15 个系统并发布逐查询预测。核心发现是训练与推理输入对齐很关键:一个 406M Fusion-in-Decoder 专用模型从长输入切换到 2000 词检索片段后损失 6.30 ROUGE-1,但在该片段机制上微调后可恢复,测试得分 36

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

基于Krea-2的人物LoRA模型girlslike-krea2发布

作者 ifmylove2011 在 Hugging Face 发布了名为 girlslike-krea2 的 LoRA/LoKR 模型,基于 krea/Krea-2-Raw 与 Krea-2-Turbo 训练,用于生成特定人物形象。模型采用全秩 LoKR 训练方案,建议使用强度 0.8 1.5,中近景相似度尚可但远景效果不佳,且需输入人物本名作为触发词。作者

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源商业1

NVIDIA 新加坡 AI Day 展示东南亚 AI 进展

NVIDIA 在新加坡举办 AI Day,联合东南亚合作伙伴展示多项 AI 进展。新加坡 HTX 使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI;NCS、ST Engineering 等企业采用 Nemotron 模型和 NeMo 工具开发智能体 AI 方案。马来西亚、越南、泰国、文莱等国的机构也

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

LeCun ECCV 2026 演讲:预测像素是伪命题,押注 JEPA 世界模型

图灵奖得主 Yann LeCun 在 ECCV 2026 发表 Keynote 演讲,主张仅靠语言和 token 训练无法让 AI 达到人类水平智能,也无法跨越物理世界门槛。他批评当前视频生成路线「预测像素」是伪命题,力推 JEPA 联合嵌入预测架构,在抽象表征空间预测未来并规划动作。LeCun 还透露约一个月前创立了 Advanced Machine In

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

slashreboot 发布 Athena-Class Model A 实验模型

slashreboot 在 Hugging Face 发布实验性研究模型 Athena-Class Model A,基于 Gemma 4 31B Instruct 进行 LoRA 微调并合并量化为 Q8 0。该模型主打持久身份、长上下文一致性与无需系统提示的自主智能体行为,在 AIME 2026 上取得 93.33%(Consensus@4)、GPQA Di

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Snorkel AI 估值翻三倍至 35 亿美元,AI 训练数据需求旺盛

Snorkel AI 完成 3.5 亿美元 E 轮融资,估值达 35 亿美元,较 17 个月前 D 轮时的 13 亿美元估值增长近两倍。该公司从数据标注自动化软件转向提供完整数据集和强化学习环境的 data-as-a-service,当前年化收入运行率达 3.75 亿美元,同比增长 18 倍。AI 实验室对高端训练数据的需求推动了 Snorkel 及 Mer

正文结构化主题已通过公开置信门槛
智东西模型发布

小米开源MiMo-V2.6系列全模态模型,押注大规模RL扩展

小米大模型团队发布并开源新一代原生全模态模型Xiaomi MiMo-V2.6系列,包含MiMo-V2.6-Pro与MiMo-V2.6-Flash,并预告将开放速度提升20倍的MiMo-V2.6-Pro-UltraSpeed。该系列押注大规模强化学习扩展,进行了开源模型迄今最大规模的单次RL训练,并同步开源RL训练环境、框架及技术报告。MiMo-V2.6-Pr

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源开源1

NVIDIA 开源 Topograph:面向 AI 工厂的拓扑感知工作负载调度

NVIDIA 发布开源工具包 Topograph,用于发现集群网络拓扑并将其标准化为 Kubernetes 节点标签、Slurm 配置、Slinky ConfigMap 等调度器可识别的格式。它通过 API Server、Node Observer、Node Data Broker、Provider 和 Engine 五个组件保持拓扑视图实时更新,并与 DR

9月22日周二 · 4 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

Synthyra 发布 ESM++ Large 蛋白质语言模型

Synthyra 在 Hugging Face 上发布了 ESMplusplus large 模型,将 biohub/ESMC-600M 检查点与 FastPLMs 运行时打包,用于蛋白质语言建模。该模型支持氨基酸序列输入,提供序列/残基嵌入、下游分类预测、PEFT LoRA 微调以及测试时训练(TTT)等功能,并兼容多种注意力后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

Synthyra 发布 ESM2-35M 蛋白质语言模型

Synthyra 在 Hugging Face 上发布了 ESM2-35M 模型,将 facebook/esm2 t12 35M UR50D 检查点与 FastPLMs 运行时打包,用于蛋白质语言建模。该模型支持序列与残基分类、数据集嵌入、PEFT/LoRA 微调以及测试时训练(TTT),并可通过 trust remote code 在 Transforme

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

TBC 联手 AWS 推「神经元衍生」视频模型,号称快 5 倍省 80%

旧金山初创公司 The Biological Computing Co.(TBC)宣布与 AWS 合作,推出号称首个「神经元衍生」的文本到视频模型,声称比基础开源模型快 5 倍、推理成本低 80%。其做法并非用生物神经元计算,而是先在 4096 电极芯片上培养皮层神经细胞、测量信号扩散与衰减规律,再将其转化为不到基础模型 0.1% 大小的软件适配器,插入现有

正文结构化主题已通过公开置信门槛
Interconnects AI观点

与 Epoch AI 的 JS Denain 辩论 RSI、中美差距与不均衡性

Interconnects AI 播客主持人 Nathan Lambert 与 Epoch AI 洞察团队负责人 Jean-Stanislas Denain 对谈,讨论递归自我改进(RSI)、中美模型差距、蒸馏是否解释差距、开源与闭源模型安全性等议题。双方均表示对 AI 发展轨迹存在很大不确定性,Denain 认为 OpenAI 和 Anthropic 公开