返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月19日周三 · 20 条
正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.14.0 发布:新增图表视图与时间线渲染优化

Langfuse 发布 v4.14.0 版本,新增了分数表图表视图、时间线密集渲染器等功能,并修复了 RBAC、OTel 映射、Stripe 计量事件等问题。该版本还进行了后台执行重构,将运行时所有权移至 worker,并更新了 Docker 镜像源。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

支付宝晓政联合民政通上线七夕婚姻登记智能服务

支付宝政务AI助手“晓政”联合民政部民政通推出七夕婚姻登记专项服务,通过MCP接入十省官方通道,提供预约、政策咨询和网点查询等功能。该服务旨在将婚姻登记从“找服务”转变为“对话办”,提升线上服务效率。晓政自2025年9月上线以来,已服务100余家政务机构,覆盖16000项事项,累计服务超1亿次。未来将扩展更多便民场景。

正文结构化主题已通过公开置信门槛
RAGFlow Releases一手来源产品发布

RAGFlow v0.27.0 发布:模型提供者、过滤器及 Go 迁移

RAGFlow 发布 v0.27.0 版本,主要更新包括模型提供者功能、聊天和搜索页面的过滤器、任务执行器迁移到 Go、以及多个 Go 代理组件的修复和增强。此外,该版本修复了多个 bug,如内存错误信息显示、内置元数据问题、以及安全漏洞(CVE-2026-9256)。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

豆包工作任务新增本地与云电脑双模式

豆包产品近期升级了“工作任务”功能,新增支持本地电脑和云电脑双模式。用户可根据任务需求选择运行环境,云电脑模式支持手机远程控制,适用于长时间、高资源消耗的任务,如数据采集、批量文件处理和定时监测。此前本地电脑模式已支持手机远程操作和Windows虚拟桌面功能。

正文结构化主题已通过公开置信门槛
量子位商业

360入选IDC中国AI50强:智能体与安全双轮驱动

IDC发布2026中国AI50强榜单,360集团因企业级智能体与AI安全双轮驱动入选。360推出纳米Work智能体办公平台,并打造AI安全攻防系统图龙锋与倚天阵,已发现近9000个漏洞。业内认为2026年AI产业从技术竞赛转向产业竞赛,安全与落地能力成为关键。

正文结构化主题已通过公开置信门槛
量子位商业

MiniMax核心工程负责人阿岛离职

MiniMax核心工程负责人阿岛(缪宇航)已离职,其飞书状态显示离职,下一站未公开。阿岛曾负责M3.x、Agent、Audio及海螺AI等关键业务,并多次代表团队对外解释技术路线。他的离职发生在MiniMax重押Coding和Agent的关键时期,其职责交接情况尚不明确。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

以GLM-5为例:九章智算云如何落地训推一致的强化学习系统

本文以GLM-5为例,探讨九章智算云如何通过强化学习系统实现训推一致。文章指出,随着预训练边际收益递减,模型能力Scaling正转向后训练强化学习,RL成为模型能力持续提升的关键。九章智算云通过将Generator、Environment和Trainer纳入统一工作流,实现动态调度和状态资源化,提升有效Token产出率,并与模型厂商形成算法与基础设施双向RL

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

Bedrock-RL:用于训练和评估 VLM 智能体的确定性 Minecraft 框架

Hugging Face 博客发布了 bedrock-rl,一个用于训练和评估视觉语言智能体(VLM agents)的确定性 Minecraft 框架。它结合了 Netherite(Minecraft 模拟的确定性 C/CUDA 重实现)和 verl(分布式强化学习库),支持多种训练方法(如 GRPO、SFT 等),并采用可替换组件的设计,通过 YAML 配

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

杰富瑞实测:阿里千问办公Agent综合排名第一,超越Claude Cowork和Codex

华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex。测试涵盖五项真实办公任务,千问办公在复杂任务、浏览器控制及多模态生成中表现突出,且隐含Harness分居首。报告指出,Agent竞争正转向企业级场景,成本与生态协同成为关键。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位产品发布

人形机器人走进国家级实验室,源络科技推动实验室3.0

源络科技与国家级科研实验室联合研发了人形机器人Monte2,已在该实验室落地,可自主完成细胞毒性检测等复杂实验流程,计划到2027年底扩展至约百台规模。源络科技还发起了“原点计划”,招募100位合作伙伴,推动AI for Science从计算走向实验执行,实现实验室3.0。

正文结构化主题已通过公开置信门槛
n8n Releases一手来源产品发布

n8n 2.35.4 发布:修复与 AI 助手遥测增强

n8n 发布 2.35.4 版本,修复了 API 路由请求模式返回和 Google Ads 节点指标选择问题,并新增 AI Assistant 设置漏斗遥测功能及托管 OAuth 凭据作用域显示选项。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

IJCAI 2026前瞻:中国厂商将大模型融入复杂系统

IJCAI 2026 在德国不来梅召开,聚焦 Agent、多智能体、机器人和强化学习。中国厂商如阿里、字节、百度、腾讯、华为等正将大模型融入复杂系统,补齐 Agent 能力缺口,竞争从模型能力转向系统能力。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

CARA:认知自适应推荐智能体框架

CARA 是一个受认知决策过程启发的推荐智能体框架,将推荐建模为结构化决策过程,包含候选过滤和情感/理性双视角决策建模,并引入边界感知 KTO 策略优化训练。在 Amazon Reviews 三个领域上的实验表明,CARA 在多数指标上优于基线,相对提升最高达 10.15%。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

ICD-Deepresearch:基础模型与深度研究结合的临床代码预测

arXiv 论文提出 ICD-Deepresearch,一种结合结构化 EHR 基础模型(SparseEHR)与语言模型(GPT-5)的深度研究流程,用于预测下一次就诊的 ICD 诊断代码。该方法通过候选生成、研究扩展和最终选择,在 MIMIC-III 和 MIMIC-IV 数据集上取得了优于基线(如 GPT-5 网页搜索和 Medical Deep Res

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源开源

Graphectory Viewer:软件代理轨迹过程中心分析工具

Graphectory Viewer 是一个基于 Web 的交互式工具,用于对软件代理轨迹进行过程中心分析。它基于 Graphectory 表示,将异构原始轨迹转换为阶段感知图,支持节点级检查、搜索过滤和桑基图摘要。该工具支持多种代理框架,并已开源,附带文档、预计算图和大型轨迹语料库。初步用户评估显示,与 SWE-agent 命令行查看器相比,任务准确率从

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

ORCA:基于可观测性的微服务事故程序修复方法

ORCA是一个面向微服务事故的、基于可观测性的自动程序修复流水线。它通过对比故障与参考遥测数据生成故障签名,定位候选代码和配置位置,并利用修复图代理生成补丁,最后由遥测验证器评估。在575个案例的基准测试中,ORCA在成本效益上优于所有基线,表明遥测数据可转化为可操作的修复上下文。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

Aegis:代理 AI 运行时治理系统实现行动边界控制

SPQR Technologies 提出 Aegis 运行时治理系统,将模型输出视为行动提案,在工具执行前通过可信决策层进行调解,实现行动边界控制。在包含 6300 行的沙盒语料库评估中,Aegis 治理的 2100 行记录显示零治理风险副作用完成,而提示策略条件化产生 79 行风险泄漏。该系统采用服务器端溯源解析、失败关闭机制和基于法定人数的 Senate

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

MITRE-SAGE:多智能体网络安全问答模型

MITRE-SAGE 是一个多智能体检索增强生成框架,用于网络安全问答,通过整合语义和结构知识提升 LLM 的可靠性和可解释性。该框架在八个基准任务中的五个上优于独立 LLM 和传统 RAG 方法,并发布了包含 3000 个问答对的 MITRE-QA 基准。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

基于契约的AI代理测试生成:规范驱动方法的实证评估

该研究提出了一种名为Spec-Driven Test Generation的测试生成方法,通过让AI代理在生成测试前先提取并记录代码的前置条件、后置条件和未定义行为,形成半形式化规范作为引导。在Google的90个历史生产bug上的评估显示,该方法相比传统基线在bug检测率上提升了9.8个百分点,分支覆盖率提升了2.5个百分点。LLM-as-a-Judge评

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

GxP-Agent:基于过程DAG拓扑的可靠临床试验编程LLM代理系统

GxP-Agent 是一个多智能体系统,将临床试验编程的监管流程编码为有向无环图(DAG),分解为15个领域特定节点,由具备pharmaverse技能上下文的工人代理执行,并包含验证门和条件重试。在CDISC-Bench基准测试中,GxP-Agent使用Claude Sonnet 4.6实现了100%的结构匹配,而所有单代理和扁平多代理方法均为0%,表明编码