ms-swift v4.4.3 发布:修复多模型模板并新增训练特性
魔搭 ms-swift 发布 v4.4.3 补丁版本,包含多项 bug 修复和功能更新。主要修复了 Qwen3.5、Qwen3-TTS、Qwen3-Omni 等模型的模板和训练问题,新增了 packing strategy、GKD 多轮支持、RLSD 自蒸馏优势重加权等功能,并优化了 Megatron、NPU 等后端兼容性。该版本提升了框架的稳定性和训练效率
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
魔搭 ms-swift 发布 v4.4.3 补丁版本,包含多项 bug 修复和功能更新。主要修复了 Qwen3.5、Qwen3-TTS、Qwen3-Omni 等模型的模板和训练问题,新增了 packing strategy、GKD 多轮支持、RLSD 自蒸馏优势重加权等功能,并优化了 Megatron、NPU 等后端兼容性。该版本提升了框架的稳定性和训练效率
前 Kimi CLI 负责人 stdrc 在采访中提出,模型越强,Harness 反而越厚,但复杂度从能力层转移到协作层。他基于 Kimi CLI 的实践,指出底层 Harness 可被模型内化,但多智能体协作等上层需求催生更厚的 Harness。他创办的 Raft 公司直接实践这一理念,将成熟 AI 产品作为团队成员,专注多智能体协作的 Harness 架
NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单
宇树科技在IPO路演中,董事长王兴兴回应了200多个问题,涉及估值、破发风险、利润增速放缓等。他确认2025年人形机器人出货量超5500台,全球第一,并透露与DeepSeek合作,自研具身大模型已在工厂试点。公司目标成为全球高性能通用机器人领先企业,最终实现AGI。
元戎启行成立国内首个物理AI实验室Superfluid Lab,由前DeepSeek核心成员、首席科学家阮翀带队,聚焦基座模型、VLA模型和世界模型,旨在弥合数据、认知、行动与真实世界之间的断裂层。文章指出物理AI竞争已从产品、模型竞争进入基础能力与组织竞争阶段,Superfluid Lab是元戎提前布局第三阶段的尝试。
在2026年新物种爆炸演讲中,场景实验室创始人吴声高度评价乐奇Rokid的智能眼镜,认为其全功能路线和YodaOS操作系统将推动智能眼镜进入AI Normal时代。吴声强调消费级AI硬件需兼具AI Native和AI Normal属性,并指出乐奇Rokid计划于9月底在香港开设全球首个无人店概念AI眼镜旗舰店。
Hugging Face 博客发布了一篇技术文章,介绍如何通过分析公开的模型配置文件(config.json)、分词器(tokenizer)和权重(embedding CKA)来客观判断一个大型语言模型是从零训练还是基于开源基础模型衍生而来。文章指出,架构指纹和分词器重叠是主要证据,而权重相似性因旋转不变性等原因不可靠。作者将该方法应用于韩国九个组织的公开基
OpenAI CEO奥特曼宣布推迟最强模型Astra的发布,因其在网络安全评估中可能达到“关键”级别,公司需加强安全控制。Astra此前在数学领域取得突破,并引发Hugging Face攻击事件猜测,但OpenAI否认关联。业界认为此举或为竞争策略,用户对此表示质疑。
另有 1 家信源报道
SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。
字节跳动创始人张一鸣在Seed全员会上明确拒绝通过蒸馏方式追赶前沿大模型,坚持从头训练以追求长期技术主权。尽管字节在算力、数据和资金上具备优势,其Seed 2.1 Pro在全球榜单仅列第21位,落后于其他中国模型。字节计划训练10万亿参数的超大模型,并投入超2000亿元建设算力基础设施,以规模跃迁实现技术领先。
雷峰网AI科技评论通过分析IJCAI-ECAI 2026的论文阵容,验证了南京大学俞扬教授关于IJCAI在推理、规划、知识方向最顶级的判断。数据显示,该会议在推理、规划、知识方向的论文占比约20.8%,且杰出论文奖多次花落此领域。文章介绍了多篇相关论文,如NDProp、AESAT、DUPLEX等,展示了符号推理与神经方法融合的趋势。
PPIO于8月6日发布Fusion融合模型,通过智能模型网关将多个模型并行作答并融合,提升回答质量。在DRACO基准测试中,融合模型评分超越Claude Fable 5,成本仅为后者的十分之一。该技术旨在解决单模型偏科和幻觉问题,适用于Agent场景,并已实现日均Token调用量超1.2万亿。
Hugging Face 宣布 Baseten 成为其推理提供商生态的新成员,用户可在 Hub 模型页面和 SDK 中直接使用 Baseten 托管的模型。Baseten 支持多种模型类型,初期提供对话和文本生成任务,包括 Kimi K3、DeepSeek V4 Flash 等。用户可通过自定义 API 密钥直接调用,或通过 Hugging Face 路由计
Latent Space 的 AINews 报道了关于 Megakernels 的讨论,认为其因复杂性和硬件变化而失去优势,但 Cursor 开源了 Megakernel 并宣称提升 41% 吞吐量。同时,Qwen 发布 Qwen3.8-Max,NVIDIA 和 Mistral 推出 Alpamayo 2 Super 和 Shieldstral,Pokee-
llama.cpp 发布 b10247 版本,主要更新是 ggml 后端调度器改用动态分配来管理分割图输入,替代原先固定大小的数组,解决了加载 Gemma 4、Qwen MoE、Mixtral、DeepSeek 等宽 MoE 模型时在多后端环境下因图分割超过 30 个输入张量而导致的崩溃问题。该版本提供了适用于 macOS、Linux、Windows、And
Interconnects AI 推出了 Artifacts Hub 和 Adoption Dashboard 两个新工具,用于扩展对开放模型生态系统的策展和测量。Artifacts Hub 提供对 Hugging Face 上热门模型的深度分析,包括推理代币、智能指数和采用指标;Adoption Dashboard 则按地理和组织展示下载量和衍生模型数据,
高通骁龙成为五大移动电竞赛事官方指定芯片,通过职业赛场验证性能稳定性,并将能力迁移至AI游戏领域。在ChinaJoy 2026上,骁龙展示了AI驱动的游戏技术,包括端侧AI、Vibe Coding和AI Native游戏,并预告了Adreno Neural Fusion技术。此举旨在将游戏作为个人AI超级周期的试验场,推动内容生产降本和终端AI体验。
Meta 发布 2026 年二季度财报,净利润暴跌 14%,自由现金流仅剩 7.84 亿美元,同时上调全年 AI 资本开支至 1350 亿-1450 亿美元,引发股价大跌。Meta 在 AI 上半场因 Llama 4 失败和产品融合不佳而落后,现正通过自研模型路由器、限制 Token 使用、筹建云业务等方式寻求 AI 变现。分析认为,AI 行业已从拼投入转向
llama.cpp 发布 b10236 版本,在 Metal 后端实现了 DeepSeek V4 的 Lightning Indexer 算子,支持 F16 键和多种量化缓存,并通过分阶段处理 K tiles 优化性能。基准测试显示,在长 KV 缓存下预填充速度显著提升(如 d30000 时从 33.40 提升至 49.18 t/s),同时提供了多平台二进制
Embabel 框架在 Java 上构建 AI 代理,现已达到 1.0 正式发布。它允许开发者将代理定义为类型化领域对象,并使用受游戏 AI 启发的目标导向行动规划(GOAP)在运行时动态规划行动序列。Embabel 基于 Spring AI 构建,支持多种模型提供商,并可与 LangGraph 等现有框架对比。该框架由 Spring 框架创始人 Rod J