LadderTeam:双智能体阶梯式需求引出框架
LadderTeam 是一个基于双智能体大语言模型架构的自动化阶梯访谈框架,用于从软件可用性反馈中提取可操作的需求。它通过主动访谈代理执行 ACV、5-Whys 和 JTBD 三种探询策略,并由后台评判代理实时监控话题漂移。在 216 次模拟访谈中,实现了 99.1% 的链收敛率和 81.0% 的可行响应匹配率,且零漂移。该框架将开源,以提升软件需求获取的效
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
LadderTeam 是一个基于双智能体大语言模型架构的自动化阶梯访谈框架,用于从软件可用性反馈中提取可操作的需求。它通过主动访谈代理执行 ACV、5-Whys 和 JTBD 三种探询策略,并由后台评判代理实时监控话题漂移。在 216 次模拟访谈中,实现了 99.1% 的链收敛率和 81.0% 的可行响应匹配率,且零漂移。该框架将开源,以提升软件需求获取的效
PydanticAI 发布 v2.32.0 版本,新增了模型名称建议、xAI 附件搜索生命周期支持、OpenRouter 网络搜索来源展示以及工具结果角色标注等功能。同时修复了同步钩子线程池执行、取消操作处理、空文本响应、工具列表展示、Bedrock 多工具揭示和重放工具调用等多个问题,并将 HTTP 客户端依赖升级为 httpx2。
RUPA是一个针对LLM代理的轨迹级不确定性量化框架,它将执行历史建模为有向图,通过传播不确定性来捕捉错误在长轨迹中的累积和转移。在τ-2、Terminal-Bench-2和GAIA基准测试中,使用6个开源LLM进行的实验表明,RUPA在准确性、早期失败检测和不确定性引导执行方面优于现有方法。该研究强调了显式建模关系依赖对于长周期LLM代理可靠不确定性量化的
Together AI 在 DeepSWE 基准上对比了 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol,发现 Sol 在单次尝试中准确率更高(72.7% vs 62.8%),但 Pro 成本仅为 Sol 的 1/35,且在多次尝试后覆盖率反超。通过先运行 Pro、失败时升级到 Sol 的级联策略,可解决 83.0% 的任务,每任务成本
支付宝在首届智能体商业生态合作伙伴大会上发布国内首个AHA多智能体跨端互联协议体系,并与比亚迪、吉利等20余家生态伙伴共同发起多智能体互联协同生态共建计划。支付宝‘阿宝’智能体车载服务已覆盖16家车企、超1600万辆汽车,新增60余家定点合作,推动智能体商业规模化落地。
StateM 是一个通过持久状态、可恢复运行手册和程序化控制来提升长时程智能体执行能力的运行时系统,无需修改模型权重。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 的准确率从 83.1% 提升至 92.1%,并将 GPT-5.6 Sol xhigh 提升至 95.3%,同时将 DeepSeek-V4 Flash
AI 初创公司 Cursor 本周推出了新的代码托管平台 Origin,旨在与 GitHub 竞争,提供协作、浏览、编辑和拉取请求等功能。Origin 支持与 GitHub 互操作,允许开发者同时使用两者。此举正值 GitHub 遭遇频繁宕机和服务降级,引发开发者不满之际。
Glean CEO Arvind Jain 在接受 Latent Space 采访时表示,模型路由正成为企业控制 AI 成本的关键,因为前沿模型价格高昂且开源权重模型(如 Kimi K3、Qwen3.8-Max)日益流行。Glean 通过三级模型选择(用户手动、管理员限制、自动路由)和人类反馈循环优化路由,其 Waldo 模型负责在调用前沿模型前组装原始材料
Amazon Bedrock AgentCore payments 现已正式可用,该服务与 Coinbase 和 Stripe 合作,使代理能够安全自主地进行支付。新功能包括钱包支持、支付编排(支持 x402 和 MPP 协议)、支付限额、可观测性以及付费端点发现。该服务旨在支持企业级生产工作负载,并已应用于 Anchor Browser 等客户场景。
Artificial Analysis 发布了名为“Search Index”的新基准,用于评估搜索 API 提供商在 AI 代理场景中的质量、成本和速度。该基准使用统一模型 GPT-5.6 Luna 和开源框架 Stirrup 测试了 Parallel、Exa、Firecrawl 等七家提供商,并结合三个子基准进行评分。结果显示,更好的搜索质量能降低总成本
NVIDIA 发布了 ALCHEMI Toolkit 的 agent skills 和参考文件,使 AI 编码代理能够根据自然语言描述生成 GPU 加速的原子模拟工作流。该工具包基于 PyTorch,支持 MLIP,并通过让代理执行生成的代码来减少错误。在 45 个管线的测试中,该设置避免了导入错误,但提示质量对结果影响显著。
小米发布2026年第二季度财报,营收约1089亿元,同比下降6.1%,经调整净利润约62亿元,同比下降42.6%。智能电动汽车及AI等创新业务收入同比增长17.1%至249亿元,但经营亏损26亿元,仍处于战略投入期。小米在AI领域密集发布多项技术,包括MiMo大模型、MiMoCode、澎湃OS 4、超级小爱2.0及具身智能模型,同时手机高端化战略见效,ASP
国内大厂正从AI办公转向企业核心业务场景,蚂蚁数科推出Agentar生态版,帮助商家将服务AI化并接入智能体体系,实现从工具到业务交付的跨越。海外Palantir和OpenAI也在布局AI商业应用,麦肯锡预测到2030年AI代理将参与3万亿至5万亿美元消费交易。蚂蚁数科Agentar已在金融等领域落地超300个智能体,并获IDC市场报告认可。
闪极于8月18日发布新款AI眼镜loomos L1,重约40克,综合续航40小时,支持主动AI记忆和AI日记,可接入飞书、腾讯WorkBuddy等Agent生态,售价2699元起。该产品历时两年研发,投入超1亿元,旨在解决上代产品的交付问题,但能否成功仍待市场检验。
网易传媒今日发布“蜜蜂AI”系统,已应用于年轻人内容社区网易小蜜蜂,提供AI搜索、AI助手、互动小游戏等功能。蜜蜂AI旨在作为C端AI入口,从信息获取、个性化服务和内容创作三方面融入社区,并整合开源智能体工具“龙虾”。网易传媒表示现阶段暂不优先考虑商业化,将先验证用户价值。
另有 1 家信源报道
AWS 博客介绍了如何通过 Amazon Quick 的嵌入式聊天功能,在 Web 应用中定制聊天界面的视觉主题和对话风格。文章详细说明了通过 CSS 容器样式、SDK frameOptions 参数移除默认品牌元素,以及通过配置聊天代理的 persona 指令来调整回复语气和内容,从而提供一致且品牌化的用户体验。
AWS 博客介绍了一种基于 Amazon Bedrock 的多智能体文档分类方案,用于保险行业对政策、宣誓书等文档进行准确分类。该方案使用 Strands Agents SDK 编排三个智能体:文档分析智能体(基于 Claude Haiku 4.5)、向量相似性搜索智能体(基于 Titan Multimodal Embeddings 和 FAISS)以及验证
AWS 机器学习博客介绍了 Axonius 如何在 Amazon Bedrock AgentCore 上构建安全的多租户 AI 代理。Axonius 作为资产情报平台,在 AWS 上运行 SaaS 基础设施,管理数百个隔离的客户环境。文章探讨了 SaaS 提供商部署 AI 代理的三种模式(silo、bridge、pool),并详细说明了 Axonius 选择
Cloudflare 推出 WriteGuard 私有测试版,为 MCP 服务器提供细粒度安全控制,旨在让 AI 代理在访问可修改数据的工具时更安全。WriteGuard 作为共享策略、归因和审计层,拦截所有 MCP 请求,根据工具策略决定放行或阻止,并记录审计日志。它无需为代理创建独立账户,而是复用现有 OAuth 凭证,并将代理上下文附加到人类身份上。W
Warp 公司推出了 Warp Factories,这是一个用于构建和运营 AI 软件工厂的基础设施层系统,旨在简化 AI 开发流程。该系统基于软件开发的传统阶段,支持自动化,并可与 Codex、Claude Code 等模型及 Linear、Jira 等工具集成。Warp 首席执行官 Zack Lloyd 表示,该系统主要面向缺乏资源自建系统的中小公司,目