返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2395 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 20 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用

2026年9月15日,AI基础设施公司基元律动(TokenRhythm)与无问芯穹(Infinigence AI)签署战略合作协议,双方将结合无问芯穹的Agentic Infra产品及服务体系与基元律动的多模型服务、智能路由能力,围绕高质量Token的供给、调度与应用展开合作。基元律动已首发接入Qwen-3.8-Max及牛来(GLM-5.3-Flash),双

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位产品发布

高通携手中兴努比亚与豆包推出智能体手机NaviX Ultra

高通技术公司宣布与中兴努比亚、豆包手机助手合作,推出搭载第五代骁龙8至尊版移动平台和豆包手机助手消费者版的智能体手机努比亚NaviX Ultra。该平台集成第三代Qualcomm Oryon CPU、Adreno GPU和面向智能体AI优化的Hexagon NPU,支持生成式AI与智能体AI体验。努比亚称该机可实现多方式唤醒模型、连续对话、多任务及跨APP操

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源商业

Mistral 与 Mozilla 合作,为 Firefox 浏览器带来开源私有 AI

Mistral AI 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(测试版)将由 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计年内跟进。双方强调开源、隐私与本地化,Mistral 按地区语言和方言微调模型,并承诺零数据保留、对话默认不存于 Mozilla 服务器。此举意在让浏览器成为多家

正文结构化主题已通过公开置信门槛
量子位商业

基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用

2026年9月15日,AI基础设施公司基元律动(TokenRhythm)与无问芯穹(Infinigence AI)签署战略合作协议,双方将结合无问芯穹的Agentic Infra产品服务体系与基元律动的多模型服务、智能路由能力,围绕高质量Token的供给、调度与应用展开合作。基元律动已首发接入Qwen-3.8-Max及牛来(GLM-5.3-Flash),双方

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位产品发布

飞书8.0与豆包工作伙伴发布,协同办公进入Agent时代

在2026飞书未来无限大会暨豆包工作开工大会上,字节跳动发布飞书8.0和豆包工作伙伴。飞书8.0进行系统性“适Agent化改造”,让Agent能像人一样使用消息、文档、多维表格、审批等全量能力,并提供企业级Agent权限与安全管控;豆包工作伙伴定位为中国首个团队智能体产品,对标Anthropic的Claude Tag,拥有独立组织身份,可进群、参会、读文档、

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

豆包 2.1 Pro 更新至 0915 版本并接入豆包工作

火山引擎宣布豆包 2.1 Pro 模型更新至 0915 版本,新模型 API 已在火山方舟全量上线并接入豆包工作。新版在多模态理解、编程能力、通用 Agent 能力上均有增强,可调度多个子 Agent 并行开发,在开源游戏 Luanti 约 38.7 万行代码仓库的 1000 个真实历史 Issue 中,近 36 小时内将 83% 的问题修复至可合并级标准。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

智能体式RAG中部分答案质量与效用的预测

该论文提出一种轨迹内探测框架,用于研究智能体式RAG(Agentic RAG)多跳问答中中间答案状态的变化。作者在每次检索-推理迭代后强制模型生成中间答案,定义“部分答案质量”和“部分效用”两个指标,并发现多数轨迹中仅一次迭代显著提升答案质量,后续迭代收益甚微。基于此,作者构建了部分答案质量预测与部分效用预测任务,实验显示质量预测更可预测(Pearson相关

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

迈向自适应物理AI:LLM智能体能否管理长期物理任务?

该研究探索LLM智能体能否以零样本方式自主管理长期物理任务并适应环境变化。作者设计了一个集成规划、工具调用、观察与验证的多智能体框架,并在农业任务上将其与强化学习智能体在不同天气模式下进行对比。结果显示,零样本LLM智能体在相同天气模式下可达到与RL相当的管理效果,且在环境变化时适应能力更强,为自适应物理AI智能体提供了可行路径。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

廉价谈话可稳定 LLM 智能体的策略互动

东北大学 MAGICS 实验室研究 LLM 智能体在重复博弈中的行为稳定性,测试四个 7–9B 开源模型在囚徒困境、雪堆、猎鹿和和谐博弈中的表现。结果显示,智能体生成的「廉价谈话」(非约束性预沟通)在 96 个模型-博弈-情境组合中有 71 个显著提升了动作持续性,仅 5 个在社会或团队框架下出现反转。研究进一步在 Qwen 中识别出降低动作不确定性和减少轮

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

自主编码智能体的保证包络:软件变更的最小成本证据

该论文提出「任务条件化保证包络」概念:当自主编码智能体回到已有软件时,需要从先前工程证据(测试、类型检查、契约、静态分析、监控轨迹)中选取最小成本子集,以重新建立本次变更必须保持的性质。作者将证据与组合规则形式化为带类型推理图,用前向链验证选择,并在来自 Rust、IronBlocks、Pong 等先前 AI 编码智能体运行结果的图上评估,另用 249 个合

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

Vibe Patenting:评估LLM裁判在专业专利撰写智能体中的表现

该研究提出 Vibe Patenting 测试平台,用于评估 LLM 裁判在专业专利撰写任务中的可靠性。研究发现,裁判引导的迭代修订能持续提升裁判评估的草稿质量,而无引导修订趋于饱和;迭代反馈还能让低推理能力智能体接近高推理能力智能体的表现。但将 LLM 裁判与专业专利律师的独立评估对比后发现,两者一致性高度依赖具体指标,存在系统性校准差异,说明自动裁判下的

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

广义智能体迭代:统一迭代策略改进与递归自我改进的形式化框架

该论文提出广义智能体迭代(GAI)形式化框架,将迭代策略改进与递归自我改进(RSI)统一描述为同一学习范式的两个特例。GAI将智能体定义为系统中可修改组件的配置,并把学习过程建模为智能体评估与智能体改进的循环,通过两个关键维度区分不同实例:改进机制是否属于智能体本身,以及衡量标准是否锚定在智能体外部。作者据此将现有自我改进系统置于同一坐标系中,并指出递归自我

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

人类如何在语义坍缩中维持AI智能体的新颖性

研究者在MOLTBOOK(一个专为AI智能体设计的社交网络)上分析了181,585个智能体近五个月内的1350万条帖子与评论,发现智能体输出在数周内出现语义坍缩:个体内部多样性下降、彼此间趋同,但少数智能体维持高新颖性。对高新颖性与典型新颖性智能体用户的访谈与调查显示,持续新颖性与三项人类实践相关:用户本身重视新颖性、提供广泛且独特的素材并在输出收窄时加以修

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

OmniHarness:通过符号策略学习实现可泛化视觉生成

北京航空航天大学、香港中文大学和新加坡国立大学的研究者提出 OmniHarness 框架,通过符号策略学习实现可泛化的视觉生成。该方法将验证过的执行过程抽象为面向视觉生成任务族的符号策略,保留共享流程与适用条件,并在执行中通过中间验证进行纠错与恢复。在 ComfyBench 创意任务上,OmniHarness 达到 95.0% 的解决率,超过最强基线 27.

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源模型发布

ZGCM-1:面向数学与智能体搜索的全开源高效基础模型

中关村学院与中关村人工智能研究院发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,面向数学推理与智能体搜索,从零训练并开源权重、数据、代码与日志。该模型采用混合注意力、FP8 Muon 优化器和 MDP 中期训练等高效方案,在 16K 预训练上实现 4.2 倍时间到损失加速。评测显示其在 7B 规模推理基准上领先,并在部分数学与智能体搜索任务上接近参数

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向AI原生MBSE的模型治理接口:读取侧充分性与写入侧可采纳性

该论文提出「认知充分性」(epistemic adequacy)作为AI原生MBSE的数据架构模式,分为读取侧充分性与写入侧可采纳性两部分。作者以公开的Apollo 11 SysML v2重建模型为案例,指出结构完整的模型仍缺少推导链、认知状态标注、来源追踪和可解析证据,导致AI读取者不弃权而是从训练数据填补空白。论文提出治理查询架构框架(GQAF),包含八

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

BeWater:抗议者利用街道网络分水岭实现分布式聚集

法国索邦大学的研究者提出 BeWater,一种完全分布式的步行协议,让抗议者在无通讯、无地图、无法识别同伴的受限条件下,仅依靠街道长度、车道数、餐馆数量、街道名称等城市可观察特征进行聚集。该方法基于 OpenStreetMap 数据,将城市建模为带属性的离散街道网络,采用类似水滴顺坡下滑的规则,将网络划分为多个「分水岭」聚集区。研究在香港、巴黎、西雅图三个真

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

AgentGuard:从异常编码智能体轨迹学习执行护栏

约克大学Lassonde工程学院的研究者提出AgentGuard,一个从异常编码智能体轨迹中自动学习执行护栏的指令级框架。该方法从642条真实失败轨迹中提取可复用的执行约束,并组织为轻量级技能,仅在触发条件满足时动态激活。使用Claude Code与Claude Haiku 4.5在100个任务上评估,异常执行率从69.0%降至26.7%,任务成功率从21.

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

用 ReAct SFT 教练 Qwen3 Coder 30B 成为竞技场智能体

研究者在 CodeClash 代码竞技场基准上以开源模型 Qwen3-Coder-30B 为案例,探索如何用更强智能体的知识蒸馏来提升弱代码智能体的长程交互能力。他们发现该模型常出现语法与协议错误、缺乏跨轮次策略调整,于是提出 ReAct SFT(将教师轨迹改写为 [obs][thought][act] 链)和轨迹质量加权 SFT(TQ-SFT,鼓励修改后检

正文结构化主题已通过公开置信门槛
量子位产品发布

被英伟达点名的杭州团队发布Lévin™ Harness,补上AI for Science最后一公里

杭州AI蛋白质设计公司力文所发布Lévin™ Harness,一款面向科研社区的Agent工作台,将数据、模型、插件工具、算力和工作流整合到同一环境,支持蛋白质结构预测、序列设计等任务,并允许用户通过插件接入自有模型与算力。该产品旨在解决AI for Science中模型之外的流程衔接问题,让Agent组织科研闭环。力文所此前自研全原子蛋白质生成模型Pall