AI科研评价新标准:深度原理联合发布发现回合评估体系
中国AI4S企业深度原理联合微软研究院、斯坦福大学等机构发布论文《Measuring AI Scientists: From Exams to Discovery》,首次提出“发现回合”评估体系,用于系统评价AI在真实科研中的表现。该体系强调全程记录科研决策,并重新定义失败数据的价值。深度原理的MIRA平台已在多个基准测试中取得第一,展示了该评估框架的实践应
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
中国AI4S企业深度原理联合微软研究院、斯坦福大学等机构发布论文《Measuring AI Scientists: From Exams to Discovery》,首次提出“发现回合”评估体系,用于系统评价AI在真实科研中的表现。该体系强调全程记录科研决策,并重新定义失败数据的价值。深度原理的MIRA平台已在多个基准测试中取得第一,展示了该评估框架的实践应
Langfuse 发布 v4.17.0 版本,主要更新包括新的评估用户体验、从 trace 表和事件表创建标注队列、显示任意元数据、迁移 UI 默认显示、支持 Anthropic Messages 作为 Langfuse Assistant 的模型提供商,以及多项修复和优化。该版本还改进了 MCP 清理、评估器模型过滤和监控调度器,并移除了 Assistan
METR 的研究显示,AI 在网络安全领域显著加速了漏洞发现,在数学领域贡献有限,而在 AI 研究本身未见明显加速。SPADE 框架通过自博弈生成可执行环境,用于训练 LLM,在 30B 规模模型上提升了基准表现。
Agno 发布 v3.0.0 重大版本更新,引入工具结果和媒体数据卸载、CodeMode、FinanceTools 等新功能,并重构数据库结构,新增 runs 表以提升性能。该版本还增强了 AgentOS 的持久化后台执行和 Studio 3.0 的治理目录,同时更新了多个模型提供商的默认模型。所有 2.x 用户需在升级前执行数据库迁移。
Agno 发布了 v3.0.0a5 版本,包含多项修复和功能改进。主要修复了团队领导委派规则、调度循环、嵌套名册成员 ID 等问题,并新增了 Studio 调度守卫的可选 self dispatch 开关。此外,还修复了请求验证失败时返回 422 错误、评估运行 ID 唯一性等问题。
Roblox 的工程加速团队经理 Andrew Swerdlow 在演讲中介绍了其“Prompt to Prod”计划,旨在通过 AI 代理实现从提示到生产的全自动化软件开发,同时解决代码信任问题。他强调,当前 AI 生成代码的能力已很强,但缺乏信任机制,导致技术债务和安全隐患。Roblox 通过构建对齐、安全防护和访问控制等基础设施,试图在提升自主性的同时
Mastra 发布 2026 年 8 月 21 日更新,引入调用方驱动的实验 API,支持外部编排器(如 Temporal)管理实验循环,同时保持 Mastra 作为记录系统。新增优雅关闭和 HTTP 排空控制,改进会话中“活动期间”消息传递,并增强工作流恢复的并发安全性。还新增多轮 LLM 评判评分器,用于评估多轮对话。
英伟达正洽谈投资AI搜索公司Perplexity,估值超过300亿美元,较一年前上一轮融资高出50%以上。Perplexity的年化收入从2.5亿美元增至7.5亿美元,部分得益于其AI代理产品“Perplexity Computer”。该投资将巩固英伟达作为AI行业主要财务支持者的地位,其投资资金往往通过购买芯片回流。
五一视界于2025年12月上市后,在2026年8月发布“物理AI宏伟蓝图2030”,计划从自动驾驶仿真业务扩展至具身智能和空天探索。公司推出AperData和AperOne两款产品,分别解决机器人数据采集与仿真训练问题,并已与多家机器人公司合作。其核心能力是将现实环境数字化,通过仿真、模型和数据闭环支持多种物理AI应用。
中诚华隆在北京发布HL200推理芯片及超节点智算集群方案,实现从单芯片到万卡集群的体系化突破。HL200支持FP4/FP8超低精度推理,能效比达5.12 TFLOPS/W,兼容主流技术栈,并在DeepSeek V4等模型测试中性能领先。公司同时与多家企业达成战略合作,推动国产推理算力生态建设。
Hugging Face 博客宣布举办 FINCHAL 金融预测挑战赛,这是一场 AI 与人类交易员的竞赛,涉及 NVIDIA、比特币、黄金和石油四种资产,总奖金 2000 美元。该竞赛旨在通过随机基准和自检评分代码来区分运气与技能,并允许 AI 代理与人类平等参与。竞赛采用仓位连续值(-1 到 1)的评分机制,并固定杠杆为 1,以避免过度投机。
Ornith AI 发布了 Ornith-1.5-397B,这是一个 397B 参数的混合专家模型,通过端到端自我改进训练,在 Terminal-Bench 2.1 上得分 86.1,在 DeepSWE 上得分 56.0,性能与 Claude Opus 4.8 相当,并优于 GLM-5.2 和 DeepSeek-V4-Flash-0731 等开源模型。该模型
本文介绍了 PrimeAgentOrchestrator (PAO),一个为个人 AI 基础设施设计的系统,能够在启动时从用户的异构记忆后端(PostgreSQL 和 Cloudflare Worker 语义搜索)并行检索相关信息,并通过文件系统注入预加载到新生成的 Claude Code 编码代理中。PAO 管理代理的完整生命周期,包括信任预置、就绪轮询和
该研究提出PV-SST测试平台,通过448次试验和112个完整块,评估LLM智能体群体在社交反馈下的行为。结果显示,基于同行点赞的排名信息流显著提高了最终帖子的词汇相似度(核心面板平均差异+0.0082 TF-IDF余弦单位),但未发现分布式来源相比单一来源在改变立场上的可靠优势。研究强调其结论仅适用于合成LLM智能体群体,不直接推断人类行为。
该综述系统分析了多模态智能体框架中感知、推理、规划、记忆和行动等核心模块,并提出了按模态分类的架构分类法。文章回顾了从文本智能体到多模态框架的演变,以及委托、晚期融合和早期融合等集成方式,并评估了在机器人、GUI与网页导航、多媒体内容生成与编辑、长视频理解与检索等领域的应用。最后讨论了性能、效率与可扩展性之间的权衡,并指出了未来研究方向。
本文介绍了 BridgeGuard,一个完全离线(air-gapped)的基于智能体检索增强生成(RAG)的系统,用于自动化 FHWA 桥梁检查合规性验证。该系统在边缘硬件上本地运行,结合向量搜索和 SQL 查询,通过多步骤 ReAct 循环实现,在 Delaware 和 Texas 的桥梁数据上分别达到 99.77% 和 100% 的分类准确率,并实现 1
本研究探讨了基于LLM的数字孪生中人物信息结构化的影响,提出固定BDE结构在同类任务上优于原始转录,但在异构任务上效果不佳。为此,作者提出自动结构发现流程,在13个多样化子研究中恢复性能,表明关键限制在于信息组织方式而非信息量。
该技术报告提出规格驱动智能体开发(SDAD)框架,将软件开发生命周期重构为意图捕获、机器可读规格、智能体合成和独立多智能体验证四个阶段。报告回顾了从瀑布到敏捷再到智能体时代的范式演变,并引入AI代码作为第四种生产范式。报告还定义了团队角色转型、量化治理指标(如歧义税、规格保真度)以及分阶段迁移蓝图,强调智能体速度将工程纪律上移至规格精确性。
arXiv 论文提出 RecVerse,一种基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆)解决长会话记忆挑战,并用轨迹级强化学习优化整体行为分布和购物意图。实验表明 RecVerse 在行为保真度和意图一致性上优于现有基线,并发布了 USB 基准数据集。
该研究提出了一个用于评估深度搜索中澄清能力的基准,基于百度搜索的真实查询构建了518个实例,并采用闭卷协议和静态金标准来防止意图泄漏。实验表明,澄清能提升搜索效用,其中ERNIE-4.5-Turbo-128K在开源模型中表现最佳,甚至超过GPT-5.2等闭源模型。研究还发现,在严格闭卷条件下,系统常提出无法回答的区域性问题,导致交互效率低下。