返回全部动态

AI科研评价新标准:深度原理联合发布发现回合评估体系

原标题:一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一

量子位研究质量 67

AI 摘要

中国AI4S企业深度原理联合微软研究院、斯坦福大学等机构发布论文《Measuring AI Scientists: From Exams to Discovery》,首次提出“发现回合”评估体系,用于系统评价AI在真实科研中的表现。该体系强调全程记录科研决策,并重新定义失败数据的价值。深度原理的MIRA平台已在多个基准测试中取得第一,展示了该评估框架的实践应用。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一 全球大厂开始押注的AI科研,终于有了统一标准 允中 发自 凹非寺 量子位 | 公众号 QbitAI 今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。 同样是今年,OpenAI、Anthropic、英伟达等科技巨头相继官宣入局AI4S这一方向。 这批“跨界”大厂玩家的目标高度一致:不只做科研辅助工具,而是打造能自主跑完“假设→设计实验→执行验证→迭代优化”完整科研循环的“AI科学家”。 不只这些科技巨头,有许多公司已经更早入场。成立于2024年的中国企业深度原理,是全球最早押注AI自主科研方向的公司之一。 这一赛道背后是一片广阔的“金矿”。一旦AI能够实现自主闭环科研,AI就能从“卖软件”升级为新材料、新药物等万亿实体产业的生产力基座。 国家战略层面也重视这个赛道。AI驱动科学发现已被纳入我国新一轮科技强国战略。 行业越热,一个问题就越绕不开:怎么评价这些“AI科学家”们到底做得好不好? 旧的衡量标尺,已经不够用了 长期以来,行业通用的衡量AI科研水平的标尺是HLE这类闭卷知识


发布时间:2026-08-24 21:21
抓取时间:2026-08-24 22:01
来源机构:量子位
阅读原文qbitai.com