商汤大装置首提TPW指标,以算电协同重构AI基础设施效能标尺
商汤大装置提出全新效率指标TPW(Tokens Per Watt),以单位电力成本产生的有效Token为核心,统一衡量算力、能源与业务价值,弥补PUE指标的不足。商汤在临港AIDC实践算电协同Agent,通过数据贯通、任务分级和多维协同,实现IT有效承载能力提升约60%,单位电力成本Token产出提升80%,并参与电网需求响应。该方案旨在推动AI基础设施从设
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2465 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
商汤大装置提出全新效率指标TPW(Tokens Per Watt),以单位电力成本产生的有效Token为核心,统一衡量算力、能源与业务价值,弥补PUE指标的不足。商汤在临港AIDC实践算电协同Agent,通过数据贯通、任务分级和多维协同,实现IT有效承载能力提升约60%,单位电力成本Token产出提升80%,并参与电网需求响应。该方案旨在推动AI基础设施从设
本文报告了一项由AI编码代理在规范优先协议下完成的大规模架构重构案例研究。该任务涉及在717,725行代码的TypeScript应用中拆除核心生命周期不变量,跨越189个文件,且无测试预言机或人工代码审查。代理通过14轮规范细化、17轮验证循环,在31次审计中修正了201个缺陷,最终在三天内以2,430美元成本成功完成,软件行为符合规范且未观察到错误。完整规
Anthropic 正在测试其 AI 编程工具 Claude Code 自主维护公司内部软件的能力。在最近几周内,Claude 创建了 388 个拉取请求,其中 180 个在人工审核后被合并,合并率约 46%。Claude 通过 Slack 频道运行 12 种日常维护例程,涵盖崩溃模糊测试、重复代码合并、死代码移除等任务。Anthropic 工程师 Bori
中国AI初创公司智谱AI发布了GLM-5.3模型,声称其是最强大的开源权重编码模型,所有改进均来自扩展的后训练。该模型在基于代理的任务上表现突出,并在网络安全方面通过训练发现软件漏洞,共发现2436个漏洞。GLM-5.3现已通过GLM编码计划提供,权重将在两周后开源。
智谱今日发布GLM-5.3模型,在Coding能力上接近Claude Fable 5,并成为最强开源安全模型。该模型在CyberGym白盒代码审查中得分84.5%,高于前代及GPT-5.6 Sol。智谱联合清华、南开等机构进行了密集红队测试,累计发现2404个漏洞,其中1088个为中高危。实测显示GLM-5.3能完成可交付的模拟游戏开发,并能自主发现、修复安
百度文库网盘在AI Day上宣布其通用智能体GenFlow中文名为“库库AI”,并推出独立办公端及企业版。目前AI办公MAU超2500万,位居行业第一。库库AI支持多Agent协作和全模态内容生成,并针对金融场景优化,获得国家工信安全中心测评第一。
Langfuse 发布 v4.11.0 版本,包含多项功能改进和修复。主要新增功能包括:在 trace 中如实展示超过加载上限的观测数据、暴露迁移观测证据、为应用内代理增加后台会话活动提示和 toast 卡片、为通过第三方提供商集成的旧 SDK 项目引入强制 v3 体验、使 Markdown 渲染字符限制可配置、在会话中显示现有标注计数,并在 v4 迁移侧边
Meta AI Research 开源了 Muse Glimmer,一个 300 亿参数、Apache 2.0 许可的模型,专为本地设备上的自主代理、工具调用和编码任务设计。该模型通过动态量化和 DFlash 投机解码优化,可在消费级 GPU 上运行,内存占用降至 17-20 GB。Muse Glimmer 在多个基准测试中表现优于同类模型,并支持多种本地框
LLMRouter 论文提出了一个统一的 LLM 路由基础设施,将路由形式化为包含五个组件的顺序决策过程,并构建了覆盖多种任务的 xRouteBench 基准。该框架包含 16 种以上的路由方法,实验表明学习型路由器比最强固定模型基线相对提升 14.6%,并支持从训练到部署的端到端流程。
arXiv 上发布了一篇关于基于大语言模型的多智能体系统通信拓扑的研究论文。论文提出 E2-Explainer 框架,通过因果推断识别通信拓扑中的关键子图,以解释协作成功的原因并剪除冗余边。实验表明,该框架能有效降低通信成本并保持任务性能。
本文报告了一项大规模架构重构案例研究,作者使用AI编码代理在规范优先协议下,成功拆除了一个717,725行TypeScript代码库中的核心生命周期不变量,涉及189个文件,且无人工代码审查和测试预言。通过14轮规范细化、17轮验证循环和31次审计,修正了201个缺陷,最终在三天内完成,成本为2,430美元,软件行为符合规范且无错误。该研究挑战了传统代码审查
另有 1 家信源报道
SynWeaver 提出一种网站先验的任务与轨迹协同合成框架,通过结构化网站探索构建网站地图,训练 UI 感知模型,并协同优化任务与执行轨迹,以生成可执行且语义对齐的监督数据。在 WebArena 和 WebVoyager 上的实验表明,SynWeaver 优于现有合成基线,并显著提升智能体的领域内和跨领域泛化能力。
该论文提出了一种名为Experience Orchestrator(EO)的框架,通过控制理论(PID控制器、POMDP信念跟踪和上下文赌博机)来治理多LLM代理系统,以解决代理间缺乏共享目标函数导致的协作失败问题。在金融服务的模拟环境中,EO将高意向顾问联系率从46.1%提升至78.1%,提升32个百分点,且治理策略占结果差异的97%。但研究基于LLM模拟
本文提出一种在笔记本电脑上模拟大规模LLM智能体社会的低成本方法,用低参数代理模型替代昂贵的大模型智能体,并引入交互顺序记忆分类法预测替代误差趋势。作者在EconAgent等八个LLM模拟上验证了该方法,发现EconAgent对奥肯定律的复现实为会计恒等式,而菲利普斯曲线才是真正的行为特征。该方法使宏观模拟成本大幅降低,并揭示了推理步骤而非提示词措辞是涌现宏
该论文提出一个两层级代理系统,将维护的时间点知识库与报告写作分离,以解决长文研究报告中数值漂移、来源缺失和信任扁平化问题。系统在包含6130个来源的公共语料上评估,消除了6845个跨章节数字矛盾,并实现零前瞻违规。
DarwinX 提出了一种通过自然选择进化智能体 harness(提示、工具、技能和控制流)的方法,在冻结基础模型的情况下,利用种群选择和验证器评估来提升性能。在多个基准测试中,该方法平均提升约 17 个百分点,例如 Terminal-Bench 2.1 从 75.5% 提升至 83.2%,WebArena-Infinity 从 43.5% 提升至 93.0
AutoDesign 是一个利用元优化器递归改进代码代理的框架,用于长时程代理设计,在学术论文到海报生成任务上取得最新成果。在 PosterBench 主赛道中,AutoDesign 得分 78.32,超过商业系统 Claude Design 7.45 分。在完全自主的长时程循环中,它能在 40 分钟内执行 253 次工具调用和 11 次编辑,成本低于 3
Spatial Memory Agent (SMA) 提出了一种无需参数更新的框架,通过经验驱动的自我进化提升冻结视觉语言模型的空间推理能力。SMA 在可验证环境中利用验证器引导的反思,将空间经验提炼为可迁移的教训,并分配转移可靠性评分以优化检索。在五个空间基准和四个基础模型上,SMA 取得了最佳或接近最佳的性能,展示了无需外部工具的参数更新自由路径。
PydanticAI 发布 v1.107.5 安全更新,修复了本地开发 Web 聊天界面(Agent.to web() 和 clai web)未验证 Host 头的问题,该漏洞可能被 DNS 重绑定攻击利用,导致本地代理的工具和凭据被远程执行。新版本默认验证 Host 为 localhost/loopback/LAN 地址,并新增 allowed hosts
Hugging Face 每日论文介绍了 PlayWorld,这是一个用于评估交互式视频世界模型的新基准。它使用多模态智能体玩家在长时程目标下与模型交互,评估几何一致性、交互保真度和状态演化等维度。实验发现当前最先进的世界模型在长时程交互目标上仍不可靠,尤其是在空间一致性和持续状态演化方面。