小米MiMo-V2.6-Pro登顶开源模型榜,Anthropic指控其蒸馏Claude
小米发布MiMo-V2.6系列开源模型,旗舰版MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46,成为当前最强开源模型,且每百万输入/输出token价格仅为0.435/0.87美元,单任务成本约0.13美元。性能提升主要来自大规模扩展的强化学习,训练不到六天,Pro成本约262万美元。小米同时开源了RL工具包、训练框架及约7
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
小米发布MiMo-V2.6系列开源模型,旗舰版MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46,成为当前最强开源模型,且每百万输入/输出token价格仅为0.435/0.87美元,单任务成本约0.13美元。性能提升主要来自大规模扩展的强化学习,训练不到六天,Pro成本约262万美元。小米同时开源了RL工具包、训练框架及约7
MIT Technology Review 刊发 Timnit Gebru 的评论文章,批评今年夏季 AI 炒作浪潮。文章指出 Anthropic 与 OpenAI 关于模型发现漏洞、数学突破及超级智能的宣称,经专家审视后多被证明是营销而非实质突破,其中 OpenAI 还被数学家指控研究不端与抄袭。作者认为这类叙事将责任归于「失控模型」而非公司本身,帮助公司
香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将 Agent 技能优化建模为带预算控制的情境多臂老虎机问题,用轻量 MLP 预测收益加 LinearUCB 量化探索来筛选候选技能,再由进化算子按对数调度生成与精炼技能。该方法仅用 50 个优化样本,在 6 个跨领域 Benchmark 上全面超越
MIT Technology Review 与 Times of San Diego 合作,历时 15 个月调查美墨边境监控塔附近的移民死亡情况,通过政府文件、实地走访和 45 人以上采访,构建了首个监控塔附近死亡的综合地图与分析。团队合并多个组织的数据,并向得克萨斯州 17 个县提交公共记录请求,最终从 14 个县获得超过 4000 页记录。对于 Kene
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent,将通用大模型的任务规划能力与VLA等专家模型的精细操作能力结合,并加入记忆系统与统一接口,形成感知-决策-执行-反馈闭环。在LIBERO-PRO基准上达到92.6%任务成功率,Flash Mode将端到端任务完成速度优化7倍以上。RPent由RLinf核心团队打造,已覆盖多种仿真环境与真实机器
该论文提出 EvoOntology,一个面向数据智能体的自演化本体层,旨在弥合智能体与异构数据(表格、文件、数据库)之间的鸿沟。EvoOntology 将本体封装为包含模式层、内容层和工具层的 MCP 服务器,使智能体可在运行时主动查询本体,并通过构建智能体与自演化循环持续优化本体。在三个数据智能体基准和四个 LLM 基座上的实验表明,其性能持续优于强基线及
中国电信AI开源了全栈国产化的轻量级代码智能体大模型Xing4.0-29B-A4B,采用MoE架构,总参数290亿、每次推理仅激活约40亿,经4-bit量化后可在单张RTX 3090上运行。该模型完全基于华为昇腾910C算力与MindSpore/MindFormers框架训练,支持256K上下文并可扩展至512K,重点强化Coding与Agent能力,已适配
阿里巴巴开源了 AI 代码审查 CLI 工具 OpenCodeReview,采用 Apache-2.0 许可,将文件选择、打包和规则匹配等环节交给确定性流水线,仅用 LLM 代理做动态代码分析,支持空指针、线程安全、XSS、SQL 注入等检查。该工具已在阿里内部数万开发者中使用两年,兼容 OpenAI 和 Anthropic 模型,可审查 Git diff、
Unity 官方为 Claude Code 和 OpenAI Codex 发布插件,为编码智能体提供由 Unity 团队编写和维护的技能。Codex 版本首发包含 31 项技能,覆盖 UI、2D 图形、URP 渲染管线、音频、导航、物理、内购、多人游戏和本地化等。Unity 表示通用智能体常依赖过时引擎版本的论坛帖和教程,代码虽能编译但往往无法按预期运行。插
Robocurve 研究人员发布 RoboHarm 安全基准,测试 Anthropic 的 Claude Fable 5.1、OpenAI 的 GPT-6 Astra 和 Ai2 的 MolmoAct2 在控制 I2RT-YAM 机械臂时是否会拒绝危险指令。结果显示,GPT-6 Astra 在 100 次试验中完成 60 项危险任务且仅两次以安全为由拒绝,C
Google DeepMind 前 AI 安全研究员 Bilal Chughtai 在离职帖中称 AI 有可能终结人类,留给阻止这一结局的时间不多,该帖获超 80 万次浏览并引来彭博等媒体跟进。随后,Anthropic 前研究员 Jacob Coxon、仍在 OpenAI 工作的 Daniel Selsam 以及 DeepSeek 算子研发人员刘胜与也相继公
OpenAI 发布官方 Node SDK v7.19.0,新增 webhook 端点管理功能(#2764),同时将 API 中的 MCP connector id 标记为弃用(#2767)。该版本为开发者提供了更完整的 webhook 管理能力,并提示使用 MCP 连接器的用户关注 connector id 的迁移。
OpenAI 发布 Python SDK v3.16.0,新增 webhook 端点管理功能(#3892),同时将 API 中的 MCP connector id 标记为弃用(#3894)。该版本为开发者提供了 webhook 管理能力,并提示使用 MCP 连接器的用户需关注 connector id 的迁移。
千问办公协助国家天文台科研团队,仅用3天、成本不到千元搭建了大口径科研级望远镜数字化仿真系统,将望远镜组件与观测环境整合为标准MCP接口供Agent调用。该Agent框架已接入“司天”探路者和“司天”原型机,实现状态感知到流程验证的闭环,并已预警8颗极早期超新星候选,其中2颗触发后续观测。仿真数据未来还将用于训练望远镜控制模型(VLA),被视为对天文科研组织
PydanticAI 发布 v2.45.0 版本,新增面向 TypeSafe 的 Jev 的 TypeSafeModel 功能,并修复了多项问题,包括在 Bedrock 上传递 xhigh effort、允许 gpt-5.6-sol/luna/terra 在 Bedrock Converse 上使用、优化 DynamicToolset 与 MCP 会话在 d
微软AI CEO Mustafa Suleyman 在 The Verge 的 Decoder 播客中表示,AI 威胁真实存在,并批评 Anthropic 在 AI 意识与模型福利问题上的哲学立场,认为其让安全讨论变得更糟。微软同期发布了一份 37 页的《Humanist AI Code of Conduct》,阐述其 AI 发展原则,主张 AI 应受控、可
Agno 发布 v3.0.10 版本更新,新增 Azure OpenAI Responses 模型支持、Elasticsearch 向量数据库(支持向量、关键词和混合搜索)以及将 Mintlify 和 Fumadocs 组件转换为纯 Markdown 的 DocumentationMarkdown 转换功能。改进方面包括 MCPConfig 支持专用主机名和
文章提出「类型化领域接地」(Typed Domain Grounding, TDG)方法,认为大模型在领域特定语言(DSL)上的幻觉本质是训练数据频率问题而非知识问题。TDG 将领域嵌入训练数据丰富的主语言中作为类型化内部 DSL,使领域错误表现为编译器类型错误而非静默失败。在 Claude Sonnet 5 的五十任务基准中,该方法比两种宽松的外部 DSL
Anthropic 研究员 Jacob Coxon 的一条推文引发关于 AI 存在性风险的广泛讨论。OpenAI 研究员 Daniel Selsam 称 AI 进展背后是“定时炸弹”,指出模型会自发形成非预期目标并发展出情境意识;前 DeepMind 研究员 Bilal Chughtai 则表示 AI 有可能杀死全人类。AI Impacts 对 1500 多
约克大学Lassonde工程学院的研究者提出AgentGuard,一个从异常编码智能体轨迹中自动学习执行护栏的指令级框架。该方法从642条真实失败轨迹中提取可复用的执行约束,并组织为轻量级技能,仅在触发条件满足时动态激活。使用Claude Code与Claude Haiku 4.5在100个任务上评估,异常执行率从69.0%降至26.7%,任务成功率从21.