SPIEval:评估大语言模型作为移动助手处理分散个人信息的能力
SPIEval是一个新基准,用于评估大语言模型作为移动助手处理分散在多个应用中的个人信息的能力。该基准包含250个任务,覆盖10个应用中的4335条个人记录,并支持通过21个工具进行多轮交互。评估发现,最佳模型GPT-5.5(xhigh)准确率仅为57.3%,最弱模型为16.4%,且79%的失败源于信息定位不准确。研究揭示了当前基于LLM的移动助手的根本局限
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2489 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
SPIEval是一个新基准,用于评估大语言模型作为移动助手处理分散在多个应用中的个人信息的能力。该基准包含250个任务,覆盖10个应用中的4335条个人记录,并支持通过21个工具进行多轮交互。评估发现,最佳模型GPT-5.5(xhigh)准确率仅为57.3%,最弱模型为16.4%,且79%的失败源于信息定位不准确。研究揭示了当前基于LLM的移动助手的根本局限
Hugging Face 发布新基准 VibeLifeBench,用于评估长期主动型生活代理,包含 200 个跨 10 个日常领域的多周任务,模拟 22 个模拟服务和 288 个工具。评估发现七个前沿模型表现均不佳,最佳模型 Claude Opus 5 平均得分仅 32.5,且所有模型在时间线推进中性能下降 10-15 分。该基准强调代理需主动发现静默变化并
Mendel Gödel Machine (MGM) 是一种递归自改进编码代理,通过多轨迹突变和跨谱系杂交加速收敛并提升性能。该研究在理论上证明了新策略在加性适应度景观模型下的优势,并在 SWE-bench 和 Polyglot 基准上验证了其性能、效率和泛化能力的提升。
Manus 宣布恢复独立运营,此前被 Meta 收购后因数据合规要求进行拆分。作为分拆的一部分,部分用户数据将在 2026 年 8 月被删除,官方提供备份和恢复工具。Manus 表示将推出新功能,继续拓展通用 AI Agent 能力边界。
美的作为独家家电合作伙伴,通过A2A协议接入千问App,用户可在千问App内享受美的全品牌产品咨询、家庭环境监测等一站式服务。此前美的与阿里签署战略合作协议,共建全屋智能能力。未来双方将深化合作,打通阿里系生态服务,整合淘宝闪购、盒马、高德等场景,提供全链路智慧生活体验。
CrewAI 发布了 1.15.15 版本,新增了报告流程结果、持续时间和人工介入信号的功能。修复了边界钩子中止流程时未发出 FlowStartedEvent 的问题,并将 torch 升级到 2.13.0 以修复安全漏洞。此外,还更新了代理的日期注入功能,并将 CLI 标志标准化为 kebab-case。
Gated Hindsight Distillation (GHD) 是一种改进移动 GUI 代理训练的方法,利用未来截图作为特权信息,在标准模仿失败时恢复正确的推理。该方法在 AndroidWorld 和 AndroidLab 上,通过两种视觉语言模型,相比 GRPO 提高了任务成功率。代码和检查点将公开。
本期早报涵盖AI行业多项动态:DeepSeek招聘土木工程师并组建Harness团队,拓展算力基础设施与代码智能体;原阿里千问负责人林俊旸创立语用科技,获腾讯等投资,聚焦下一代AI智能体;宇树科技公布中签结果;Manus将恢复独立运营;OpenAI前机器人业务负责人加入Anthropic;智谱ZCode用户破百万并上线新功能。
AWS与OpenAI合作,将Daybreak Red和Daybreak Blue两款网络安全模型引入Amazon Bedrock,供符合条件的客户使用。Daybreak Red提供GPT-5.6 Cyber模型,Daybreak Blue提供GPT-5.6 Sol模型,均支持漏洞发现、检测工程和事件响应等任务。这些模型在Bedrock上运行,具备零操作员访问
Hugging Face 每日论文发布了一篇关于 Business Arena 基准的论文,该基准用于评估 LLM 代理在真实跨境市场中的商业运营能力。研究发现,15 个前沿模型在最终净资产上存在九倍差异,即使最佳模型也落后于人类设计的策略,表明商业运营对 LLM 代理仍具挑战性。该基准基于真实的阿里巴巴采购数据和市场条件,并提供技能级分析和动作级归因,以诊
LangChain 发布了 1.3.15 版本,包含多项功能更新和错误修复。新增功能包括在 AgentMiddleware 中暴露 trace policy、为 wrap tool call 添加 state schema 参数、在 init chat model 中支持 LangSmith provider,以及将 reasoning effort 作为标
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
谷歌CEO桑达尔·皮查伊宣布,Gemini应用月活跃用户数突破10亿,成为谷歌第14个达到此里程碑的产品。Gemini的增长速度与OpenAI的ChatGPT相当,后者在6月达到10亿用户。谷歌持续将Gemini整合到搜索、工作空间、安卓等产品中,并推出Gemini 3.5 Flash模型以提升编码和AI代理任务能力。此外,63%的用户使用语音功能,Gemi
另有 1 家信源报道
A^2E(Agent Auditing Engine)是一个端到端的智能体评估引擎,通过标准化的任务协议(ATP)和自动插桩的监控器捕获执行轨迹,从效率、工具使用、任务规划和错误恢复等多个维度评估智能体框架的能力。实验表明,模型与框架的组合在不同任务上表现差异显著,没有单一组合能在所有任务上持续最优,这凸显了系统化评估的必要性。该研究的代码已在GitHub上
由xAI联合创始人Igor Babuschkin创立的AI初创公司River AI,在成立仅两个月后获得了由General Catalyst和AMP PBC领投的11亿美元融资,Nvidia、AMD Ventures、Y Combinator和Temasek参投。River AI旨在从头重建AI技术栈,包括训练、模型、产品层和硬件,以开发个人可训练的AI助手
Hugging Face 博客介绍了 ALTK-Evolve 与 ACE 两种智能体记忆系统,均通过将智能体历史轨迹转化为可复用经验并在推理时注入,避免压缩经验。ALTK-Evolve 采用按需检索少量指南的方式,而 ACE 每步注入完整手册。在 AppWorld 基准上,ALTK-Evolve 在 DeepSeek-V3.2 上准确率更高且 token 消
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并
另有 1 家信源报道
Google Research 与 Google DeepMind 在首次研究中展示了其医疗 AI 系统 AMIE 的实时临床视频咨询能力。该系统基于 Gemini 和 Project Astra 构建,采用多智能体架构,能够解读视觉和听觉线索,指导虚拟体检并进行实时诊断推理。在模拟咨询的随机研究中,临床评估者对其病史采集、诊断准确性、管理适当性和沟通质量给
另有 1 家信源报道
Anthropic 宣布其未发布模型在黎曼猜想上取得重大进展,显著提高了该猜想成立的下界。该模型在无专业数学训练的员工引导下,通过 60 个子代理协作,测试了 650 个想法,花费 3100 万输出 token,最终由两名子代理提出关键数学思想,并经内部数学家验证和 Lean 证明助手形式化。这一成果引发数学界对 AI 在数学发现中作用的争议,部分数学家担忧