GPT-6 Astra 在宜家家具组装错误识别基准上达 80%
Epoch AI 推出家具组装基准 FAB,用三张宜家家具组装照片(含故意错误)测试模型识别装配错误的能力。2025 年 11 月最佳模型 Claude Opus 4.5 得分 28%,十个月后 OpenAI 的 GPT-6 Astra 达到 80%(每张照片耗时三分钟),Claude Fable 5.1 为 70%,Claude Opus 5 为 61%,
公司与模型 · 月之暗面 Kimi 系列模型与产品动态:K 系列开源模型、长上下文技术与产品演进
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
Epoch AI 推出家具组装基准 FAB,用三张宜家家具组装照片(含故意错误)测试模型识别装配错误的能力。2025 年 11 月最佳模型 Claude Opus 4.5 得分 28%,十个月后 OpenAI 的 GPT-6 Astra 达到 80%(每张照片耗时三分钟),Claude Fable 5.1 为 70%,Claude Opus 5 为 61%,
在2026年9月云栖大会上,阿里巴巴旗下平头哥发布新一代AI芯片真武V900,并宣布AI软件栈T-Head SAIL进一步开源,开放PyTorch适配、迁移工具、算子开发工具及计算加速库等项目。真武芯片已服务20多个行业650多家客户,蚂蚁、小红书、小鹏汽车等基于SAIL进行模型迁移与优化。此举旨在降低客户迁移成本、让开发者参与芯片性能优化,并推动大厂造芯从
另有 1 家信源报道
中科类脑成立九年来深耕算力调度与电力智能化,提出“算电协同型Token工厂”概念,通过BitaHub彼塔云平台统一纳管异构芯片、模型与电力资源,以“1+3”架构(决策大脑+算力、Token、电力子系统)实现跨域调度。公司完成跨上海、芜湖、乌鲁木齐三地调度测试,控制响应200秒内、跨域迁移成功率100%、能耗预测精度98%,并在世界制造大会上推出算电词元一体化
9月22日云栖大会MaaS & Agent技术主论坛上,阿里巴巴集团战略副总裁文征宣布千问AI平台全面升级,在模型服务基础上新增Agent服务与行业AI解决方案,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。平台通过FlashBoot、UniScheduler等将模型弹性启动时间从1200秒缩短至70秒,首Token延迟降低38
苹果硬件工程副总裁Tom Marieb公开表示不建议用户给iPhone贴屏幕保护膜,称团队在屏幕耐刮耐磨方面投入大量研发,希望用户直接体验原厂屏幕,此番言论引发网友热议。此外,DeepSeek将向联合国安理会介绍AI风险,月之暗面等中国企业也受邀参会;Meta个人AI助手Muse上线两周下载量超250万次,登顶美国iOS免费榜,带动Meta股价单日上涨11.
小米大模型团队发布并开源新一代原生全模态模型Xiaomi MiMo-V2.6系列,包含MiMo-V2.6-Pro与MiMo-V2.6-Flash,并预告将开放速度提升20倍的MiMo-V2.6-Pro-UltraSpeed。该系列押注大规模强化学习扩展,进行了开源模型迄今最大规模的单次RL训练,并同步开源RL训练环境、框架及技术报告。MiMo-V2.6-Pr
小米发布MiMo-V2.6系列开源模型,旗舰版MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46,成为当前最强开源模型,且每百万输入/输出token价格仅为0.435/0.87美元,单任务成本约0.13美元。性能提升主要来自大规模扩展的强化学习,训练不到六天,Pro成本约262万美元。小米同时开源了RL工具包、训练框架及约7
智能经济30人论坛AGI测评中心发布2026年9月12日至18日《AGI市场观察》,基于OpenRouter词元消耗、厂商官方价格及Arena基准测评追踪国产大模型。报告显示,DeepSeek V4 Flash、V4.1 Flash、腾讯Hy4 preview、智谱AI GLM 5.3 Flash四款轻量级模型周用量均破10万亿tokens,四强合计约占中国
小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数(46),训练成本约 300 万美元。小米同时开源 RL 环境、训练配方与代码,并披露 RL 训练细节(130 小时、75B tokens、约 260 万美元)。此举被视为中国前沿实验室开源发布潮的一部分,也凸显
在9月22日云栖大会上,阿里巴巴公布千问大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5计划扩展至5-10T参数;Qwen3.8-Max通过递归自我改进(RSI)在人类零参与下自主迭代超1个月、完成33轮迭代,Artificial Analysis得分从40升至45。阿里同时发布Qwen3.8-Flash、Qwen3.8-
在AICC 2026上,IDC发布《2026年中国人工智能计算力发展评估报告》,指出Agent时代算力需求正从脉冲式调用转向持续负载,全球Token消耗量到2030年复合增长率达4822.6%,算力缺口绝对值将达3809亿美元。浪潮信息首席AI战略官刘军将算力问题拆分为Capability(能力型智算)与Capacity(容量型智算)两个方向,并发布超节点A
另有 1 家信源报道
Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45
阶跃星辰发布新一代MoE旗舰模型Step 5 Preview,总参数600B、激活参数27B,支持100万Token上下文与原生文本、视觉输入,专为真实世界Agentic任务打造。该模型在Artificial Analysis Intelligence Index得分44分,位居开源模型第三,仅次于Qwen3.8 Max与GLM-5.3。其单任务成本约为Cl
llama.cpp 发布 b11064 版本,主要修复 Metal 后端 dsv4 hc pre 算子的问题:此前该算子通过 constexpr 将 hc 硬编码为 4,导致其他 hc 值被 supports op 拒绝并回退到 CPU。本次改动将 n hc 作为函数常量(FC DSV4 HC)传入,并为不同 n hc 生成流水线变体,同时新增 hc = 1
llama.cpp 发布 b11057 版本,新增针对 Ling 3.0(Bailing V3)的专用聊天解析器。由于 Ling 3.0 Flash 模板在生成提示中预先打开 think 块,模型不会输出起始 标签,且工具调用可能出现在 之前,导致原有自动解析器将工具调用误判为 reasoning content,客户端收到空 content 且无 tool
B站于9月16日正式上线「AI无限竞技场」,这是一个汇集UP主大模型测评的竞技广场,首期榜单同步公布。GPT-6 Astra在10个UP主测评中拿下榜首,前五名中国产大模型占据三席。该平台由各领域UP主对上百个大模型进行真实场景实测,涵盖代码、推理、协作、知识等主题,排名实时更新并持续开放报名。
中关村学院与中关村人工智能研究院发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,面向数学推理与智能体搜索,从零训练并开源权重、数据、代码与日志。该模型采用混合注意力、FP8 Muon 优化器和 MDP 中期训练等高效方案,在 16K 预训练上实现 4.2 倍时间到损失加速。评测显示其在 7B 规模推理基准上领先,并在部分数学与智能体搜索任务上接近参数
另有 1 家信源报道
杭州AI蛋白质设计公司力文所发布Lévin™ Harness,一款面向科研社区的Agent工作台,将数据、模型、插件工具、算力和工作流整合到同一环境,支持蛋白质结构预测、序列设计等任务,并允许用户通过插件接入自有模型与算力。该产品旨在解决AI for Science中模型之外的流程衔接问题,让Agent组织科研闭环。力文所此前自研全原子蛋白质生成模型Pall
llama.cpp 发布 v0.4.1,新增 Maple 20B-A1B 三元 MoE、腾讯 Hy 4 预览版和 Spark2.5 模型支持,并改进 JSON schema 处理、聊天解析、日志和服务器子进程管理。核心变更包括修复 DeepSeek2、GLM-MoE 等模型的 MTP KV 缓存分配,以及 Qwen/Kimi/GLM 的 GDN 归一化问题。
智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛