编译器引导的自适应证明搜索与跨模型协同
罗切斯特大学的研究者提出了一种编译器引导的自适应证明搜索框架,用于Lean 4项目级定理证明。该框架通过双模型生成和停滞触发的重采样来探索多样化的起始证明,并利用编译器反馈进行当前最优精化。在miniCTX-v2的七个真实项目上,该方法在pass@预算内将平均通过率提高了12.8个百分点,同时将LLM调用减少了21.9%。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
罗切斯特大学的研究者提出了一种编译器引导的自适应证明搜索框架,用于Lean 4项目级定理证明。该框架通过双模型生成和停滞触发的重采样来探索多样化的起始证明,并利用编译器反馈进行当前最优精化。在miniCTX-v2的七个真实项目上,该方法在pass@预算内将平均通过率提高了12.8个百分点,同时将LLM调用减少了21.9%。
该研究提出一个本地可部署的、基于工具的大语言模型多智能体框架,用于自动化甲烷排放分析与报告。框架通过LLM智能体协调现场测量、气象数据、传感器处理、高斯羽流反演和报告生成,在多种实地环境中实现92.0%的工作流路由和参数提取准确率、85.0%的排放率估算成功率及95.0%的报告生成成功率,将工作流时间从小时级缩短至分钟级,并减少数据泄露风险。
arXiv 论文提出 BayesBeliefAgent,将分层 LLM 规划器与贝叶斯跟踪模块结合,用于多智能体协作中的自适应重规划。该方法仅在伙伴行为与推断技能矛盾时中断当前技能,从而缩小信念-行动差距,并在 Overcooked 基准上比启发式方法减少约两个数量级的重规划次数。
雷峰网报道了开源项目J-Space Cognition Suite被指造假,其宣称通过外部Harness让小模型追平甚至超越顶级大模型,但独立复测结果相反。OpenAI思维链发明者Jason Wei发文指出小模型加工具无法替代大模型的内化能力,引发行业对Scaling Law与工程路线的讨论。
SemaPLC 是一个面向 PLC 代码生成的验证门控代理框架,通过外部编译和实时运行验证生成的逻辑,而非仅依赖模型自评。在 117 个独立 POU 任务中,SemaPLC 在七个模型上取得了最高的严格验证通过率(平均 72.6%);在 65 个真实项目上下文任务中,其集成编译、静态行为和动态行为均表现最佳。动态行为测试最能区分方法,SemaPLC 得分 5
FM-Bench 是一个用于评估大语言模型智能体在长期决策任务中表现的基准测试,模拟管理足球俱乐部20年的场景。研究发现,管理行为而非模型规模或计算资源决定性能,且所有模型均未能从拒绝的报价中学习市场隐藏价格。该基准提供了首个大规模智能体对抗评估,代码已开源。
PydanticAI 发布了 v2.32.1 版本,主要包含三个 bug 修复:拒绝在 agent 运行中的同步回调里调用 run sync(),避免向 Anthropic 发送空签名的 thinking 块,以及允许任意可调用对象作为 FunctionModel 的 function 或 stream function。这些修复提升了框架的稳定性和兼容性。
华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex等工具。报告将Agent能力拆分为模型与Harness,千问办公的隐含Harness分居首,且API价格较低,具备成本优势。报告认为企业级Agent竞争核心在于工作流和生态协同,千问办公已初步打通钉钉。
另有 1 家信源报道
CrewAI 发布了 1.15.17 版本,主要新增了声明式对话流程功能,并修复了多个 bug,包括 MCP 服务器名称、SSRF 检查、OpenAI Responses API 兼容性等问题。该版本还更新了文档,并有多位贡献者参与。
Stripe 确认收购 AI 模型路由初创公司 OpenRouter,交易金额约 75 亿美元,远高于其 5 月时的 13 亿美元估值。Stripe 创始人称收购与‘奇点’有关,但实际意图是嵌入 AI 时代的资本流动,管理 AI 支出,并可能影响模型供应商。OpenRouter 将保持独立运营。
Jeremy Morrell 在 2026 年 8 月 19 日提出,LLM 大幅降低了扩展的编写成本,现代沙箱原语降低了部署成本并提供安全边界,为 Web 上的可扩展软件带来新机遇。他建议将应用构建为可靠的核心,并允许用户通过 LLM 安全地扩展功能。
Simon Willison 在 Talking Postgres 播客中讨论 AI 如何改变软件开发,认为在编码代理时代,代码行数仍可作为生产力指标,因为代理能大幅提升产出,但认知能力成为新瓶颈,团队仍需多人分担。他还强调概念完整性在快速迭代中更难维持,类比为温彻斯特神秘屋,需要纪律约束。
NVIDIA 技术博客介绍了如何使用 AI 编码代理开发 Holoscan 应用,通过 CLI、技能和代理实现实时内窥镜工具分割应用。开发流程采用工程师指导的迭代方式,代理使用 Codex 和 GPT-5.6 完成代码实现,并复用 MONAI 模型。该方法提高了开发效率,并强调了将复杂目标分解为可验证迭代的重要性。
Vercel AI SDK 发布了 ai@7.0.70 版本,包含多项补丁更新:停止客户端工具审批时的多步文本生成、修复 streamObject 结果拒绝和失败完成报告、过滤不完整工具输出、防止不安全完成原因时自动执行工具,以及清除 WorkflowAgent 重试时的部分 UI 消息。同时更新了依赖 @ai-sdk/provider-utils 和 @a
AWS 宣布在 Amazon Bedrock AgentCore 的 Web Search 连接器 1.2.0 版本中推出运行时域和发布日期过滤功能,允许开发者在每次 API 调用中控制搜索的域名和结果的时间范围,且由服务端强制执行。该功能与管理员级域策略结合,形成分层过滤模型,确保企业治理的同时提供灵活的调用级控制。此外,Web Search 服务扩展至欧
AWS 博客介绍了在无服务器流水线中异步调用 Amazon Bedrock AgentCore 代理的三种模式,以消除调用方在代理处理期间的空闲计算成本。文章通过文档验证示例,对比了阻塞反模式与任务令牌回调、直接服务集成和持久函数三种模式,并指出 AgentCore 运行时按消耗计费,空闲 CPU 不收费,而调用方如 Lambda 在等待时会持续计费。
Anthropic 发布了 Python SDK 的 v0.125.0 版本,主要新增了托管代理的网页搜索配置功能,并支持自托管沙箱内存。该更新通过 API 扩展了代理的能力,使其能够进行网页搜索并持久化沙箱状态。
Anthropic 发布了 Java SDK 的 v2.57.0 版本,主要新增了托管代理的网页搜索配置和自托管沙箱内存功能。该更新通过 API 扩展了代理能力,允许开发者配置网页搜索和沙箱内存。
Anthropic 发布了 TypeScript SDK 的 v0.120.0 版本,主要新增了托管代理的网页搜索配置和自托管沙箱内存功能。此外,内部工程上统一了 pnpm 工作区锁文件。该版本通过 API 更新增强了代理的搜索与内存能力。
据彭博社报道,SpaceX 曾试图收购 AI 编程初创公司 Cognition,但 Cognition CEO Scott Wu 否认该报道,称公司不出售且双方未进行谈判。此前 SpaceX 刚以 600 亿美元收购了另一家 AI 编程公司 Cursor,并计划通过 AI 编码业务提升收入。Cognition 估值已达 250 亿美元,并正洽谈新一轮融资。