ms-swift v4.5.3 发布:新增多模型支持与性能优化
魔搭 ms-swift 发布 v4.5.3 版本,新增对 Qwen3.8-Flash-Next、DeepSeek-V4-Pro-0813、Ling-3.0 系列等模型的支持,并引入多项新特性,如 Megatron-SWIFT Muon 优化器支持不同学习率、OPD 蒸馏支持多模态、性能优化等。同时修复了训练、RL、Megatron 及多个模型相关的 bug。
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
魔搭 ms-swift 发布 v4.5.3 版本,新增对 Qwen3.8-Flash-Next、DeepSeek-V4-Pro-0813、Ling-3.0 系列等模型的支持,并引入多项新特性,如 Megatron-SWIFT Muon 优化器支持不同学习率、OPD 蒸馏支持多模态、性能优化等。同时修复了训练、RL、Megatron 及多个模型相关的 bug。
基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布Agent-Native模型NeoHorse-1,包含4B和9B两个版本,基于Qwen3.5后训练,利用Routing Harness系统OpenSquilla产生的执行轨迹作为训练语料,通过路由信号、Agent执行监督和在策略蒸馏等方法提升模型能力。评测显示NeoHorse 4B在11项基准中未加
Hugging Face 每日论文页面介绍了一篇题为《Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation》的论文。该论文提出教师门控在线蒸馏(TGOPD)方法,通过验证器评分的探针在提示级别验证教师可靠性,并将提示路由到密集蒸馏或基于验证器的强化学
华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司发布了首个Agent-Native模型NeoHorse,包含4B和9B两个版本。该模型利用其Routing Harness系统积累的多模型执行轨迹数据进行后训练,在Agent相关评测中4B模型表现达到或略超9B基础模型。公司旨在通过将执行经验转化为模型能力,构建从模型路由到训练改进的闭环,并探
DavidAU 发布了 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF,这是一个基于 Qwen3.8 27B 的多阶段微调模型,采用 COLD FUSION 和 Fable Fusion 711 训练方法,显著减少思考 token 数量
OpenAI首席科学家Jakub Pachocki表示,继续快速训练更智能模型的关键理由是需要构建防御系统以应对其他AI带来的危险。他强调需要强大且对齐的AI来保护基础设施、实时防御 rogue agents 并发明新的防护措施,这将是OpenAI部署工作的重点。同时他也警告,不能以防御需求为借口鲁莽推进,必须认真对待风险。
燧原科技于9月7日公布科创板发行结果,募资61.19亿元,发行价142.18元/股,中签率0.0246%。公司专注云端AI芯片,已迭代四代架构、五款芯片,2026年上半年营收11.20亿元,同比增长279%,预计2026年或2027年盈利。此次上市将增强国产AI芯片竞争力,满足国内算力需求。
国内AI人才经历三波大迁徙:从百度等大厂流向AI六小虎和字节等,再到百川智能、零一万物等战略收缩后人才流向腾讯等。深层原因包括股价、战略导向和组织架构。当前趋势是人才流动加速,AI Infra和数据人才受追捧,预训练需求下滑。
本文提出了一种构建、训练和评估搜索智能体的端到端方法,并发布了Iris-mini和Iris-pro系统。该系统通过自动构造多跳任务、过滤训练数据、结合监督微调和强化学习进行迭代优化,在BrowseComp、DeepSearchQA等基准上取得了开源搜索智能体的最佳性能。研究还强调了上下文管理对搜索性能的重要影响,并提供了可测量的对比评估。
另有 1 家信源报道
arXiv 论文提出 DM-Align,一种基于分布匹配的统一单阶段优化框架,用于视频生成模型的蒸馏与人类偏好对齐。该方法通过样本引导的分布匹配梯度,同时优化蒸馏质量和偏好对齐,避免了 RL 在蒸馏前的高计算成本和蒸馏后的模型崩溃。实验表明,DM-Align 在多个基础视频模型上优于独立变体和两阶段流水线。
本文提出了一种量子辅助的显存高效训练框架 Q-MET,用于基于 Wi-Fi 的人体活动识别(HAR)。该框架通过混合量子-经典神经网络间接生成模型参数,将可训练参数减少 90%-95%,同时保持或超过传统分类精度。结合结构化剪枝,模型稀疏度达 75%-85%,精度损失小于 2%。这是首个同时解决 HAR 系统训练和推理阶段显存低效问题的量子辅助方法。
《西雅图时报》和《新闻日报》起诉OpenAI和微软,指控其未经许可使用新闻报道训练AI模型,并在用户查询时复制报道内容。原告要求销毁包含其作品的训练数据和AI模型。此前已有《纽约时报》等多家媒体提起类似诉讼。
另有 1 家信源报道
Anthropic 的 15 亿美元版权和解协议获批后,部分作者发现出版商和文学代理商在未经授权的情况下对其应得赔偿提出索赔。作者们投诉出版商对已失去版权的作品索要赔偿,或要求超出其应得份额的 100% 赔偿。尽管出版商和代理商声称这是记录错误,但作者群体认为问题可能具有系统性和广泛性。
《西雅图时报》和《新闻日报》起诉 OpenAI 和微软,指控其未经授权使用新闻内容训练 AI,可能对新闻业造成不可挽回的损害。诉讼称生成式 AI 是“吞噬自己尾巴的蛇”,会摧毁内容生产机构。此前《纽约时报》等已提起类似诉讼,而微软和 OpenAI 曾资助《西雅图时报》的项目。微软表示对诉讼感到意外,但愿意探讨解决方案。
另有 1 家信源报道
GPT-6 Astra发布带火了循环Transformer技术,阿里团队早在11个月前就发表了MeSH和SpiralFormer两篇论文,分别解决循环内部信息管理和计算粒度问题。MeSH通过动态读写路由器管理记忆槽,减少计算冗余;SpiralFormer通过多分辨率序列处理,让每轮循环关注不同尺度的信息。两篇论文分别被ICLR 2026和EMNLP 2026
光象科技联合清华大学李升波教授课题组发布了第一代物理原生世界模型Phi-WM 1.0 ActEffect,该模型在训练阶段通过受控世界模型预测动作后果并优化策略,训练完成后即从部署链路中退出,以降低推理时延和算力成本。在LIBERO、LIBERO-PLUS和RoboCasa-GR1基准上分别取得98.8%、80.3%和67.5%的平均成功率,并在真实工业场景
Hugging Face 论文页面介绍了一种名为“Compile by Training”的方法,通过将自然语言规范编译为可复用的本地神经函数,利用教师模型生成示例并微调小型适配器,避免了远程模型依赖。在 FuzzyBench-Hard 子集上,该方法达到 83.6% 的语义准确率,但编译时间约为一分钟,高于快速编译器。论文还展示了多站点网站助手、3D 头像
AWS 博客介绍了如何利用 NVIDIA Cosmos 3 在 SageMaker HyperPod 上构建物理 AI 模型工厂。Cosmos 3 采用混合 Transformer 架构,统一处理视频、图像、动作和声音,支持前向动力学、逆动力学和动作策略三种模式。该设计使数据生成、后训练和评估可在同一 GPU 集群上运行,提高资源利用率。文章提供了端到端示例
AWS 发布了 HyperPod InstantStart,这是一个开源控制平面,用于通过 AI 代理驱动 SageMaker HyperPod 操作。它提供 Web UI、REST API 和 MCP 工具三种接口,统一后端 API,支持集群创建、节点恢复、训练和推理等操作。该设计将操作规则编码到控制平面 API 中,确保代理驱动的基础设施可靠。
微软在针对《纽约时报》等出版商和作者提起的版权诉讼中提交新法律文件,称其 Copilot 聊天机器人极少复制新闻或书籍的实质性内容。微软分析 820 万条聊天记录后发现,仅不到 1% 的记录包含至少 16 个与新闻内容相同的词,且只有极少数响应与书籍内容匹配。微软据此主张,使用受版权保护的材料训练 AI 模型属于合理使用,因为系统具有变革性目的。