返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月3日周四 · 2 条
正文结构化主题已通过公开置信门槛
TechCrunch AI政策

美国政府支持OpenAI:版权材料训练AI属合理使用

美国特朗普政府在《纽约时报》起诉OpenAI的版权诉讼中提交了一份20页的法庭简报,支持OpenAI未经许可使用受版权保护材料训练大语言模型的行为。简报强调美国需要保持AI领域的全球领导地位,并认为对合理使用原则的误解会阻碍创新。该简报虽非裁决,但可能对案件产生重要影响。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
The Verge AI政策

特朗普政府支持OpenAI在纽约时报版权诉讼中的立场

特朗普政府在美国纽约时报诉OpenAI版权案中提交利益声明,支持OpenAI的合理使用论点,认为允许AI模型在受版权保护的作品上进行训练将促进科学进步和美国的繁荣。该案可能为其他媒体与AI公司之间的版权纠纷设定先例。

另有 1 家信源报道

9月2日周三 · 12 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Nemotron 3.5古兰经双头ASR模型v5

该模型基于NVIDIA Nemotron 3.5流式ASR(0.6B)微调,用于全古兰经诵读识别,支持Uthmani脚本及泰吉威德符号,并增加音素头用于错误检测。最佳检查点(step 78000)在留出集上达到CER 2.76%、WER 4.43%、变音符号F1 98.27%。训练数据包含179,376个片段(约868小时),模型参数全部可训练。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

燧原科技科创板申购启动,腾讯小米等参与战略配售

燧原科技于9月2日开启科创板新股申购,发行价142.18元/股,腾讯、小米、兆易创新等参与战略配售。公司聚焦云端AI芯片,营收快速增长,预计募集资金61.19亿元用于新一代AI芯片研发。此次IPO将助力其产品规模化销售,满足AI算力需求。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

字节 Seed 大调整:数据与 RL 集中,产品按任务拆分

字节跳动旗下 Seed 基础模型团队进行重大组织调整,新设 Pretrain Data、Horizon RL、Product Posttrain-Work 和 Product Posttrain-Chat 四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳负责,均向吴永辉汇报。此次调整旨在合并相似工作、减少重叠,将分散的数据和强化学习能力集中,并按用户任务(

正文结构化主题已通过公开置信门槛
量子位研究

蚂蚁OmniTable获VLDB最佳论文:35PB语料宽表管理提速5.6倍

蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文。该系统已在生产环境管理超过35 PB、3050亿条以上的大模型训练数据,通过逻辑统一、物理分离的设计,将真实SFT数据准备任务端到端周期从约14天缩短至2.5天,提速5.6倍,手工步骤减少73.3%。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式坍缩

南方科技大学与腾讯优图实验室联合提出 ReNFT 方法,用于修复扩散模型在奖励后训练中出现的模式坍缩问题。该方法通过内部概率质量重新校准,在不依赖外部信号或修改文本编码器的情况下,恢复生成器内部的多样性。实验表明,ReNFT 在 PickScore 和 GenEval 上保留了 NFT 奖励的 98.9% 和 99.0%,同时将 DreamSim-Div 分

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

HyperWorld:超图结构状态序列化提升文本世界模型学习

HyperWorld 研究通过对比四种信息等价的文本状态序列化方式(原始观察、独立句子、成对三元组、超边单元),发现超边序列化能显著提升小语言模型(0.5B-1.5B)在文本世界中的效果预测和分布外鲁棒性,并在规划任务中取得最高成功率。该研究为学习符号世界模型提供了高阶结构作为廉价归纳偏置的证据。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

基于指令微调小语言模型的渐进式老年人金融诈骗增量风险评估

Kansas State University的研究人员提出了一种基于累积对话轮次的老年人金融诈骗风险评估框架,通过逐步聚合对话内容并重新评估风险,实现实时监控。他们构建了包含投资、慈善和技术支持诈骗场景的多轮对话数据集,并微调了Phi-4、LLaMA-3.2、DeepSeek-R1和Qwen3等小型语言模型。实验表明,Phi-4和LLaMA-3.2在参数规

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

微软发布StudentSim:个性化学生模拟器训练框架

微软提出 StudentSim 框架,通过两阶段训练(池化训练加个性化微调)从稀疏数据生成个性化学生模拟器,使其既能模仿学生反应,又能响应导师指导。在象棋、英语写作和数学三个领域的 60 名学生基准 StudentSimEval 上,StudentSim 在行为保真度和指导响应性上均优于 GPT-5.4 和 Maia2。作为概念验证,使用 StudentSi

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

AfterQuery估值32亿美元,成Y Combinator最快独角兽

AI训练数据初创公司AfterQuery据报道完成一轮融资,估值达32亿美元,距其4月宣布的3亿美元估值仅五个月,增长超10倍。Y Combinator合伙人称这是该加速器历史上从创立到独角兽最快的一次。该公司为AI模型和智能体提供专业工作模式训练,客户包括Nvidia等。

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源产品发布

NVIDIA与CrowdStrike联合推出SafeMind代理式网络安全系统

NVIDIA CEO黄仁勋在CrowdStrike Fal.Con 2026大会上宣布与CrowdStrike合作推出SafeMind,一个基于NVIDIA Nemotron模型构建的代理式网络安全系统。SafeMind通过攻防对抗的持续共进化循环,利用CrowdStrike的数据进行后训练,旨在提升防御效率并降低成本。此外,CrowdStrike还发布了F

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA与CrowdStrike合作构建自适应智能网络安全系统

NVIDIA与CrowdStrike合作,在隔离环境中评估了一个基于NVIDIA Nemotron模型的智能攻防系统。该系统通过红蓝智能体自动执行攻击、生成检测规则并反复测试,以提升网络安全防御能力。CrowdStrike报告称,其Blue Solano防御模型在内部评估中比领先的专有前沿模型准确率高13%,成本低97%。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

Atos 携手 AWS 为 400 名工程师提供 agentic AI 实践培训

Atos 与 AWS 合作,通过 AWS AI League 活动为 400 名工程师提供 agentic AI 实践培训,涵盖多智能体系统构建、路径规划、护栏、记忆和微调模型。活动采用竞赛形式,使用 Amazon Bedrock、AWS Lambda 等原生服务,旨在提升实际交付能力。该活动帮助工程师从理论转向实践,并为企业开展类似培训提供了参考。

9月1日周二 · 6 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

DeepSeek V4 Pro与Harness深度拆解:后训练成主战场,缓存优化控成本

雷峰网发布万字长文,拆解DeepSeek V4 Pro与Harness框架。文章通过实测发现,V4 Pro在Terminal Bench等agentic任务上大幅提升,但相比Flash性价比不高,且其1M上下文是通过YaRN外推实现,但实测未衰减。DeepSeek通过缓存优化和定价策略控制成本,并开源Harness框架,强调后训练成为旗舰模型升级主战场。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

实测Qwen 3.8-Max vs GPT-5.6:完成度更高但耗时3.5小时且额度耗尽

雷峰网作者通过Qwen Code和ChatGPT Codex分别调用Qwen 3.8-Max与GPT-5.6,要求它们从零搭建并迭代一个3D大模型演进宇宙网站。实测显示,Qwen 3.8-Max在页面完成度和视觉细节上优于GPT-5.6,但耗时更长(3小时29分钟)且因额度耗尽中断,而GPT-5.6在37分钟内完成但完成度较低。文章认为Qwen 3.8-Ma

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

壁仞科技中期业绩营收激增近20倍,亏损收窄加速

国产GPU企业壁仞科技发布2026年中期业绩,上半年营收12.36亿元,同比增长约1997.6%,亏损大幅收窄76.4%至3.77亿元。公司完成互联网大客户导入,并发布新一代NPO光互连超节点方案,支持FP8/FP4精度,自研BLink 2.0协议。壁仞科技正牵头制定异构混训国家标准,并完成DeepSeek-V4等旗舰大模型适配。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

BaryCache:基于重心外推的扩散 Transformer 内存高效加速方法

本文提出了一种名为 BaryCache 的训练免费加速方法,用于扩散 Transformer(DiT)的采样过程。该方法利用重心外推器进行逐步特征预测,通过稳定的权重构造和在线解耦技术,在减少内存占用和保持生成质量的同时,实现了高达 3.30 倍的端到端加速。实验在图像和视频生成任务上验证了其有效性。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Fastino 发布医疗专用 Nemotron 3.5 Lightning 模型

Fastino Labs 与 NVIDIA 合作发布了 Fastino-Nemotron-3.5-Lightning-Healthcare,这是一个基于 NVIDIA Nemotron 3.5 Lightning 的 30B 参数、3B 激活的混合专家模型,专为医疗和生物医学应用设计。该模型在多个医疗基准上相比基础模型有显著提升,例如 HealthBench

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源商业

AWS获评Forrester Wave AI基础设施解决方案领导者

AWS在Forrester Wave 2025年第四季度AI基础设施解决方案评估中被认定为领导者,在13家供应商中战略类别得分最高。该评估认可了AWS提供灵活、成本高效的AI基础设施,支持从训练到推理的完整工作负载生命周期。AWS提供专有AI芯片(如Inferentia和Trainium)以及NVIDIA GPU实例,强调客户选择和成本效率,避免供应商锁定。