返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2398 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月3日周四 · 20 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

实测飞猪AI:智能助理突围OTA,商业化仍待探索

飞猪在2026年上半年推出升级版AI产品「飞猪帮帮」,定位为智能助理团队,覆盖行前行中行后场景,支持自然语言订酒店、行程规划、抄攻略、代办事务等。飞猪采用LUI与GUI融合的交互设计,并基于Multi-Agent架构和agentic RL技术,提升结果可用率超70%。此举旨在突破传统OTA商业模式,探索AI Agent在旅游垂类的落地,但商业化暂未提上日程。

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

美团智播数字人直播技术突破:从高保真形象到万路并发

美团技术团队在2026年中国互联网大会上展示了美团智播数字人直播解决方案,该方案融合大模型、数字人与多模态交互技术,实现高保真形象生成、自然动作驱动、语音手势协调及高效推理部署,使数字人直播月日均GTV同比增长82.12%,开播场次提升11倍。团队自研的SDIP、SREdit、MoTiGA、StreamingTalk及Glance2Gaze等技术分别被ACM

正文结构化主题已通过公开置信门槛
Latent Space产品发布

Muse Spark 1.3 对标前沿模型,斯坦福推智能体工程课程

Meta 发布 Muse Spark 1.3,据称性能接近 OpenAI 和 Anthropic 的前沿模型,并承诺开放权重,训练成本可降低 90% 以上。斯坦福大学推出两门 AI 智能体工程课程,强调从提示工程转向系统化智能体构建。业界讨论 Astra 循环变压器架构的实质,以及智能体评估和技能检索的新方法。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DisCo:将 GitHub 仓库蒸馏为 AI 技能,显著提升研究代理性能

Hugging Face 每日论文页面介绍了 DisCo,一个将 GitHub 仓库中的操作知识提炼为可复用技能的研究代理。通过任务无关和任务导向两种蒸馏方式,DisCo 从 1000 个广泛使用的 ML 仓库中提炼出 5000 多个验证技能,形成 AREX-Skill 库。在固定 GPT-5.5 骨干和预算下,配备技能的代理在 MLE-bench、Pape

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

信息共享何时改善去中心化发现:聚合、独立救援与均衡选择

该论文研究信息共享对去中心化发现的影响,指出共享虽能提升共同行动的准确性,但会减少独立救援行动。通过精确的增量共享恒等式,作者得出共享有益的局部条件:当池化残差收缩快于被移除的私有失败因素时。在两人对称博弈中,当信号精度为3/5且相关系数在特定区间时,共享严格改善发现结果,但该结论依赖于均衡选择。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

RosettaBitcoin:代理辅助共识验证器验证基础设施的经验报告

RosettaBitcoin 是一个单开发者项目,用 12 种语言实现了比特币 testnet4 共识验证器。本文基于 2026 年 6 月 17 日的不可变快照,分析了其验证基础设施,包括 SQLite 证据数据库、测试夹具和验证脚本。快照显示所有端口均通过 45/45 脚本语料库证明和 5000 区块基线,但无端口满足完整节点门禁。文章强调显式失败记录和

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

事件记忆:通过序列模式挖掘与速度分层检索实现免训练操作记忆

arXiv 论文提出 Incident Memory,一种免训练的操作记忆系统,结合速度分层检索、指纹条件 PrefixSpan 挖掘和溯源感知指标定义,从事件日志中提取有序剧本。在 UCI ITSM 数据集上挖掘 39 个剧本,覆盖 84.3% 的保留事件,受控基准下有序精度达 99.2%,优于 Claude Haiku 基线。结果表明,在低熵事件历史中,

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

DocuSearch:结合知识图谱扩展与逐块接地评估的混合 RAG 企业文档搜索

DocuSearch 是一个面向企业文档搜索的混合检索增强生成系统,在电信网络运维环境中开发并评估。它结合了基于 Qdrant 的语义搜索、基于 SQLite FTS5 的 BM25 全文搜索以及知识图谱邻居扩展,通过加权 RRF 融合,并采用交叉编码器重排序和 MMR 进行选择。其核心创新是逐块智能体评估循环,用于验证上下文充分性和答案接地性,未接地的答案

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

WMLLM:基于预测-行动世界建模的自进化优化智能体

WMLLM 提出一种基于预测-行动世界建模的自进化优化智能体框架,利用 LLM 在生成候选前预测结果,并通过预测误差自我改进。在分子优化等黑箱优化任务中,该方法提升了样本效率和最终性能,并在多目标分子优化基准上达到最先进结果。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

PRISM:面向自动驾驶的智能体多模型主动安全架构

PRISM 研究提出了一种名为 PRISM 的智能体多模型安全架构,用于自动驾驶系统,将安全从被动碰撞避免转变为主动持续风险管理。该系统结合逆碰撞概率建模、三个专用模型(轨迹、天气、VRU交互)以及强化学习协调层,提供四级安全干预。在自然驾驶数据集上验证,平均安全评分为68,77.6%场景为咨询级,3.8%为近碰撞率,约11%场景升级为干预或紧急响应。该框架

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向LLM工具使用的Agent原生可复用工具原语框架HEART

arXiv 论文提出 Tool Primitives,用自然语言接口替代 API schema 调用,并构建含 25,519 个函数的 ToolFace 仓库,支持推理时动态检索。在此基础上提出 HEART 框架,包含 Planner、Router、Verifier 组件,在五个基准上平均超越 SFT 模型及 GPT-5.4、Claude-4.6-Sonne

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.38.0 发布:新增模型支持与多项修复

PydanticAI 发布 v2.38.0 版本,新增了 context window 字段、gemini-3.8-flash 模型支持,以及 Claude Fable 5.1 和 Claude Mythos 5.1 模型支持。同时修复了多个 bug,包括 DeepSeek 和 Together 的 tool choice 处理、Bedrock Mantle

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

腾讯发布WorkBuddy金融版,推动金融业务AI原生转型

腾讯于9月3日正式发布WorkBuddy金融版,这是一款面向金融机构的AI智能工作台,提供80多个金融专家、丰富数据源及安全底座,覆盖投研、合规、信贷尽调等核心业务场景。该产品已在中金公司、平安银行等100多家金融机构落地,据称可将信贷尽调从10天压缩至1天,整体业务提效超10倍。腾讯云副总裁胡利明表示,金融AI应用正从工具试用走向业务重构,旨在推动组织级智

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

千问办公落地长安汽车,覆盖研产供销服全链条

长安汽车在研发、生产、供应链、销售和服务等业务场景中全面接入阿里千问办公AI Agent,推动企业向AI原生组织转型。通过具体案例,如线束选型计算工具、扫码转中文工具等,显著提升了工作效率,缩短了流程周期。阿里云副总裁李强指出,未来车企竞争将从单车智能转向企业智能,千问办公的落地具有示范价值。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Palo Alto Networks 以 5 亿美元收购 AI 初创公司 Console

Palo Alto Networks 以 5 亿美元现金加股票收购了 AI 初创公司 Console,该公司利用 AI 代理自动化 IT 帮助台任务。Console 成立于 2024 年,此前融资 2900 万美元,收购前估值 1.57 亿美元。此次收购将 Console 集成到 Cortex 平台,以增强其自主安全能力,这是 Palo Alto Netwo

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 在澳大利亚推出 Bedrock 上的 OpenAI GPT-5.6 跨区域推理

AWS 宣布澳大利亚的悉尼和墨尔本区域现可通过 Amazon Bedrock 的全球跨区域推理访问 OpenAI GPT-5.6 系列模型(Sol、Terra、Luna)。这些模型支持文本和图像输入、100 万 token 上下文,并可通过 Responses API、Chat Completions API 和 Converse API 调用。文章还介绍了

正文结构化主题已通过公开置信门槛
The Verge AI模型发布

谷歌发布Gemini 3.8 Flash:性能更强但成本可能更高

谷歌发布了Gemini 3.8 Flash模型,该模型通过更多推理步骤和迭代工具调用实现更强性能,但可能因token消耗增加而提高使用成本。该模型在软件工程和自主智能体基准测试中表现优异,同时谷歌推出了面向政府和可信伙伴的Fairwind计划,提供Gemini 3.8 Flash Cyber和CodeMender代理。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 生成式 AI 助力支持运营现代化与扩展

AWS 机器学习博客发布文章,介绍如何利用生成式 AI 现代化和扩展支持运营。该方案通过从培训视频自动生成标准操作程序(SOP),应用检索增强生成(RAG)指导工单解决,并使用机器学习优化工作负载分配和预测 SLA 风险,同时通过代理工作流自动化工单标记、评论和状态更新,并保持人工参与以确保准确性。文章通过实际用例展示了架构,并指出该方案可适用于金融、医疗、

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

用 Amazon Bedrock AgentCore 实现从代码到架构图的自动化文档生成

AWS 机器学习博客介绍了一种使用 Amazon Bedrock AgentCore 构建的自动化架构文档生成方案,该方案通过自主代理分析代码库、生成架构图并发布文档,已在一家全球金融服务公司生产环境中运行。该方案集成了 AWS CodePipeline、S3 和 Bedrock Knowledge Bases,以解决架构文档过时、知识孤岛和合规问题。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Trinity:基于代理式AI的残疾学生过渡计划解决方案

University Startups 与 AWS 合作伙伴 g/d/n/a 合作,基于 Amazon Bedrock 构建了名为 Trinity 的对话式 AI 解决方案,帮助残疾学生制定个性化过渡计划。该方案采用六代理分层架构,解决了单一模型在检索、合规和个性化推荐方面的不足,并集成了 HIPAA 和 FERPA 合规控制。Trinity 已在美国多个州