Artificial Analysis 更新智能指数,回应 GPT-6 Astra 评分质疑
Artificial Analysis 发布了其智能指数 4.2 版本,以回应此前对 GPT-6 Astra 评分准确性的质疑。更新后,GPT-6 Astra 的得分较前代提升 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1。新指数引入了两个新基准,并增加了私有测试数据的权重,以防止模型作弊。
公司与模型 · 智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
Artificial Analysis 发布了其智能指数 4.2 版本,以回应此前对 GPT-6 Astra 评分准确性的质疑。更新后,GPT-6 Astra 的得分较前代提升 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1。新指数引入了两个新基准,并增加了私有测试数据的权重,以防止模型作弊。
SGLang 发布 v0.5.19 版本,包含 786 个 PR,来自 214 位贡献者。新增支持 Qwen3.8、Ling-3.0、Granite 4.2 等多个模型,并引入 beam search、DeepEP v2、LayerNorm 序列并行等多项性能优化。这些改进提升了推理吞吐量、降低了延迟,并扩展了硬件兼容性。
英伟达计划以约129亿美元收购开源AI模型平台Hugging Face,承诺保持其开放和硬件中立。此举使英伟达掌控开源AI模型的主要分发中心,并新增计算销售渠道。英伟达CEO黄仁勋于2026年9月3日宣布该交易,预计2027年上半年完成,尚需监管批准。Hugging Face拥有超1800万开发者、300万个模型,英伟达希望通过该平台扩大其AI芯片生态影响力
雷峰网发布万字长文,拆解DeepSeek V4 Pro与Harness框架。文章通过实测发现,V4 Pro在Terminal Bench等agentic任务上大幅提升,但相比Flash性价比不高,且其1M上下文是通过YaRN外推实现,但实测未衰减。DeepSeek通过缓存优化和定价策略控制成本,并开源Harness框架,强调后训练成为旗舰模型升级主战场。
筷子科技发布视频商业AI能力统一价值单位“KP”及企业“KP钱包”,旨在统一管理模型调用、内容生产、分发等环节的预算与能力。KP建立在Token之上,覆盖模型、算力、Agent、工具等资源,企业可通过KP钱包分配预算并管理多业务环节。目前Kuaizi已积累超1.2亿条商业视频,服务13500多家付费企业,并展示了多个客户效率提升案例。
苹果CEO库克卸任,转任执行董事长,约翰·特努斯接任,库克在内部信中表达对继任者的信心。东方甄选前CEO孙东旭宣布新公司美丽明天员工年假30天,引发热议。科大讯飞公关副总裁韩煜尘被解除职务,疑似涉及私德问题。字节上调豆包股价格至17.02元/股,主要面向大模型部门。快手旗下北京可灵获国家人工智能基金14亿元注资。华为上半年营收4678亿元,研发投入1214亿
Hugging Face 上出现了一个名为 'good and small models' 的模型集合,由用户 flyingfishinwater 发布,旨在为移动设备提供轻量级 AI 模型。该集合包含 Qwen3-4B-Instruct-2507、Qwen3-4B-Thinking-2507 和 GLM Edge 4B Chat 等模型的 GGUF 量化版
OpenClaw 曾因开源 AI 智能体而爆红,三个月内 GitHub Star 超 25 万,但几个月后热度消退,被 Claude Code、Codex 等 Harness 取代。其创始人 Peter Steinberger 已加入 OpenAI 开发下一代 Agent,并投资 Linux 桌面基金会。OpenClaw 虽热度下降但仍在更新,国内厂商推出
《时代》周刊公布2026年度全球AI 100名单,智元机器人董事长兼CEO邓泰华入选创新者类别。邓泰华在华为工作逾20年,曾掌舵无线与计算业务,后与稚晖君共同创立智元,初期隐于幕后,2025年起走向台前。时代周刊称智元去年出货5100台人形机器人,并推出VLA模型GO-2,邓泰华的目标是推动机器人在制造业等领域的实际应用。
PydanticAI 发布了 v2.35.3 版本,主要包含多项 bug 修复:将 Heroku GLM 模型路由到 zai model profile,限制 safe download cookies 的作用域,修复 DeferredToolRequests.remaining 跨类别结果 ID 解析问题,识别持久执行错误中被拒绝的运行时工具集,并调整 d
Hugging Face 发布 Transformers 库 v5.16.1,重点支持 GLM-5.3-Flash 模型。该模型是 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数,性能超越 GLM-5.2,价格仅为十分之一,在编码和智能体基准上接近 Claude Opus 4.8。此外,该版本还包含若干小修复,如恢复张量并行
苹果发布新款Mac mini和Mac Studio,Mac mini首发2nm M6芯片,AI性能大幅提升,Mac Studio搭载M5 Max/Ultra芯片,支持本地运行大模型。同时,苹果与阿里巴巴联合训练面向中国市场的AI大模型,推进Apple智能落地。此外,苹果计划在9月发布折叠屏iPhone等新品。
中诚华隆在北京发布HL200推理芯片及超节点智算集群方案,实现从单芯片到万卡集群的体系化突破。HL200支持FP4/FP8超低精度推理,能效比达5.12 TFLOPS/W,兼容主流技术栈,并在DeepSeek V4等模型测试中性能领先。公司同时与多家企业达成战略合作,推动国产推理算力生态建设。
一个名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发互联网对其背后开发者的广泛猜测。该模型被描述为专为编码、持续代理工作和生产负载设计的推理模型,Stripe CEO Patrick Collison 对其表示赞赏。目前其开发者身份匿名,外界猜测涉及中国公司 Z.ai 的 GLM 模型或微软未发布的 MAI 模型,但尚无定论
Drew Breunig 在文章中讨论了 Fable 模型发布后对 AI 编程工作流的影响。他指出,在 Fable 之前,优化编码工具或上下文策略似乎不值得,因为新模型会以相同或更低价格解决大部分问题。但 Fable 的高成本促使团队重新思考如何分配工作,因为 Opus、5.6、K3 和 GLM 等模型已足够应对大部分编码需求。
LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token
开源AI基础设施公司Prime Intellect发布研究,提出多智能体Harness系统,让更便宜的开源模型承担监控和实现任务,从而降低AI自主科研成本。实验中,18个前沿模型参与nanoGPT优化器速通,开源模型Kimi K3搭配Prime Agent Harness达到2930步,超过GPT-5.6 Sol的3042步,逼近Opus 5的2920步。研
FreeToken 是一个面向边缘设备的 MoE 推理服务系统,将个人电脑视为统一的弹性推理平台,动态地将计算和模型状态映射到异构本地硬件上。该系统支持超过 20 个 MoE 模型,能在 8GB 笔记本电脑 GPU 上运行 35B 模型,在游戏台式机上运行 284B 模型,在单工作站 GPU 上运行 753B 的 GLM-5.2 模型。FreeToken 通
IJCAI 2026 在德国不来梅召开,聚焦 Agent、多智能体、机器人和强化学习。中国厂商如阿里、字节、百度、腾讯、华为等正将大模型融入复杂系统,补齐 Agent 能力缺口,竞争从模型能力转向系统能力。
国内大厂正从AI办公转向企业核心业务场景,蚂蚁数科推出Agentar生态版,帮助商家将服务AI化并接入智能体体系,实现从工具到业务交付的跨越。海外Palantir和OpenAI也在布局AI商业应用,麦肯锡预测到2030年AI代理将参与3万亿至5万亿美元消费交易。蚂蚁数科Agentar已在金融等领域落地超300个智能体,并获IDC市场报告认可。