小米直播6天烧2000多万训练MiMo-V2.6,拿下开源第一并全量开源
小米将MiMo-V2.6-Pro和Flash的大模型强化学习训练全程直播,6天花费约350万美元(约2344万元人民币),Pro以1.02万亿参数、420亿激活在Artificial Analysis Intelligence Index上获46分,位列开源第一。小米同时开源模型权重、技术报告、7000多个RL任务环境和端到端RL训练框架,并披露了异步RL架
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 06:37
小米将MiMo-V2.6-Pro和Flash的大模型强化学习训练全程直播,6天花费约350万美元(约2344万元人民币),Pro以1.02万亿参数、420亿激活在Artificial Analysis Intelligence Index上获46分,位列开源第一。小米同时开源模型权重、技术报告、7000多个RL任务环境和端到端RL训练框架,并披露了异步RL架
MIT Technology Review 刊发 Timnit Gebru 的评论文章,批评今年夏季 AI 炒作浪潮。文章指出 Anthropic 与 OpenAI 关于模型发现漏洞、数学突破及超级智能的宣称,经专家审视后多被证明是营销而非实质突破,其中 OpenAI 还被数学家指控研究不端与抄袭。作者认为这类叙事将责任归于「失控模型」而非公司本身,帮助公司
该论文提出 RoboDawn,一种通过离散平移、旋转和夹爪命令将视觉语言模型(VLM)接入机器人控制的接口,使 VLM 能以闭环方式观察、推理并执行动作。作者引入上下文学习(ICL)方案,用少量演示让 VLM 掌握接口使用与任务策略。在 RoboTwin 2.0 C2R 和 RoboDojo 基准上,零样本即超越多个专用训练策略,单样本演示后成功率分别从 5
阿里 PAI 团队在 Hugging Face 发布 MiniMax-H3-Fun-Controlnet-Union,这是一个基于 VideoX-Fun 流程训练的 ControlNet-Union 模型,可为 MiniMax-H3 视频生成器提供 Canny、Depth、HED、MLSD、Pose 五种控制条件以及视频修复能力。该模型仅包含约 6.8GB
研究团队提出 WorldCrafter,一种视频世界模型,通过可相机查询的隐式 3D 感知记忆来提升长时程与跨视角一致性。其核心思路是让请求视角决定多视角证据如何压缩进视频生成器有限的 token 预算,记忆编码器与姿态条件读出模块与生成器联合训练,无需显式深度对应。结合近期时序上下文与少步蒸馏,模型可从单张图像或文本提示进行流式场景探索,在静态与动态场景中
在9月22日云栖大会上,阿里巴巴公布千问大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5计划扩展至5-10T参数;Qwen3.8-Max通过递归自我改进(RSI)在人类零参与下自主迭代超1个月、完成33轮迭代,Artificial Analysis得分从40升至45。阿里同时发布Qwen3.8-Flash、Qwen3.8-
Google Research 提出 RRSI(正则化递归自我改进)方法,用于自动优化 LLM 智能体的 harness(提示词、控制流、工具、记忆与上下文管理)。该方法通过时间退火预算约束候选编辑、并用 critic 与 pruner 筛选提案,以缓解递归进化对训练任务的过拟合。在涵盖编码、智能体工作区与工程设计等八项基准上,RRSI 在进化所用划分上最高
该论文提出面向软件工程智能体的类别感知迭代专家训练框架,通过 Refresh-Repair-Expand 迭代开发各类别专家,并用标签路由的多教师在线策略蒸馏(MOPD)将其整合为单一可部署模型。最终策略在 Pro-618 上达到 58.04%、在 SWE-bench Multilingual 上达到 59.00%,分别较基座模型提升 5.39 和 2.78
Hugging Face 上发布了 m-a-p/SheetSage2 模型,可将音乐录音转写为可编辑的乐谱(ABC 格式)和带时间标注的 MIDI。该模型基于 MERT-v2-FullSong 构建,支持旋律、和弦、节拍、调性和结构提取,并可导出嵌入与 token 预测。用户可将转写结果传入 YuE2 用于翻唱生成,模型采用 cc-by-nc-4.0 许可。
NVIDIA 技术博客发文梳理 AI Agent 评估方法的演进:从早期静态任务与单次函数调用评分(如 BFCL),转向需要完整执行环境、跨多步追踪状态的全任务评估。文章提出步骤级(过程评分)与端到端(结果评分)两层评分体系,并给出任务成功率、一致性、工具调用精度、参数准确率、每成功任务步数与成本等指标,强调不同基准在任务复杂度、状态性和验证方法上的差异会导
Hugging Face 上发布了一个名为 DogContext/GLM-5.3-Flash-Uncensored-Q2-ds4 的模型,它是 GLM-5.3-Flash 的去审查(abliterated)版本,经 imatrix 校准量化为约 2-bit GGUF,可在单台 128GB Apple Silicon Mac 上常驻运行。该模型保留原生 MTP
Hugging Face Blog 介绍了一篇新论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,研究如何让模型只拒绝某个话题中与部署政策不兼容的子集,而非整个话题。作者以政治说服为测试场景,指出标准自生成训练流程存在覆盖缺口、误拒副
Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45
Hugging Face 上出现一个名为 CIRCL/vulnerability-severity-classification-roberta-base 的模型,基于 roberta-base 微调,用于漏洞严重程度分类。该模型在评估集上取得 0.8137 准确率和 0.7424 的 F1 Macro,其中 Medium 类别表现最好(F1 0.8516)
研究团队提出 CodeMidas,一个以源代码为唯一任务特定输入的智能体流水线,将现有代码库中已实现的功能转化为可执行的强化学习环境。该方法通过智能体探索功能、构建基于原始代码执行的测试,并经过执行检查与多次解答采样来验证和筛选任务。最终数据集包含来自 3185 个开源代码库、覆盖 23 种编程语言和 15 个技术领域的 5545 个训练任务。用 GRPO
该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3
研究者提出 RecreationWorld,一个面向混合计算机使用智能体(CUA)的五平台框架,覆盖 Ubuntu、macOS、Windows、Android 和 Web,通过让智能体复现运行中的参考应用来提供可验证的执行奖励。基于高质量开源应用扩展轨迹生成后,模型在五个分布外编码与混合计算机使用基准上均有提升,并更频繁地验证渲染输出。团队同时发布 Recr
该论文提出 Code2Skill,一个全自动流水线,可从源代码中提取可验证的程序性技能,构建出包含 1,006,822 条记录的 CodeSkillBank。在覆盖九种模型设置和八个基准的 72 项评估中,使用检索到的技能后模型平均提升 11.7%,并在 57 个案例中优于基线。研究还显示,从 AI 生成代码合成的技能通过率达 93.50%,略高于人类编写代
IFM 在 Hugging Face 发布 K2-Horizon-0.9B,这是 K2-Horizon 系列中的紧凑型 dense 解码器模型,参数量 0.9B,支持 128K 上下文窗口(通过 YaRN RoPE 缩放)。模型采用多教师蒸馏训练,覆盖数学、代码、STEM 和指令跟随,并在数学、编程、科学和工具使用基准上与 Qwen3.5-0.8B、Open
joyfox 发布了基于 Qwen3.8-27B 的未审查变体模型,通过 abliteration 技术降低拒绝率,同时保留原生架构、视觉栈和 MTP 权重。该模型在 800 个良性提示上实现 0% 拒绝率,能力得分与官方版持平,并提供多种 GGUF 量化版本。