返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2396 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月14日周一 · 12 条
正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源观点

立场:推荐系统应从平台中心排序转向个人代理中介推荐

一篇 arXiv cs.IR 立场论文提出推荐系统应从平台中心排序转向个人代理中介推荐(PAMR),由面向用户的个人代理在分布式来源间发现、过滤、聚合和治理推荐证据。作者定义了 PAMR 的边界标准、核心中介决策和以中介为中心的评价框架,并在 Yelp 餐厅推荐任务上做了概念验证,显示来源选择与受控披露在效用、可追溯性、暴露和成本之间取得最佳平衡。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源观点

Agentic Web 中推荐系统向谁推荐?

这篇 arXiv cs.IR 立场论文指出,随着 LLM 驱动的 AI 代理在 Agentic Web 中代替用户浏览、比较、谈判和交易,推荐系统的核心假设——推荐由人类直接消费——正在被打破。作者提出推荐范式正在分叉:在可委托场景(如常规购物、旅行)中,代理成为推荐的主要操作消费者,需要新的优化目标、交互协议和评估标准;在体验型场景(如娱乐、艺术)中,人类

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

古兰经背诵转录中的背诵事件标注:什么算错误?

该论文针对古兰经背诵场景,提出将ASR转录文本与参考文本的差异标注为类型化、定位化的事件,而非简单视为错误。作者完成了100个生产录音案例的人工标注,包含348个评分单元和162个定位事件,并定义了十种组合标签。实验显示,普通diff的标签感知F1为0.525,而编码智能体在初步试点中表现差异巨大(F1从0.143到0.892),主要剩余挑战在于标注约定而非

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

当 Agent 指标测量不同事物:Praxa AI 管线的证据审计

该论文对 Praxa AI 的 agent 评估管线进行回溯性测量审计,发现多项指标在数值正确的情况下测量了与标签不符的构念:139 例离线路由报告有 112 通过、27 失败,但门控失败为零,因为已知缺口被显式豁免;8,843 条工具尝试记录中 448 条时长缺失,且 121 条时长等于 32 位有符号整数最大值并带有被放弃客户端标签;单轨迹压缩试点报告的

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Bash 就够了?企业数字员工代理工具接口实证研究

微软与卡内基梅隆大学的研究者对两种企业级工作流基准(TheAgentCompany 和 APEX-Agents)进行了受控工具接口消融实验,比较了五种接口:纯类型化工具、类型化工具加 bash、纯 bash、带持久化合成工具的 bash,以及程序化工具调用(PTC)。使用 Opus-4.8 和 GPT-5.5 测试发现,纯 bash 在两个基准上均优于纯类型

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

LLM 软件工程中的测试驱动方法:阶段、任务与智能体技能综述

一篇 arXiv 综述论文系统梳理了大语言模型驱动软件工程中的测试驱动方法,围绕「测试改变了什么决策」这一核心问题,整合了 87 条研究记录(其中 83 条做了方法或协议级提取)及 5 项实践资源。论文区分了 Red–Green–Refactor 循环与测试条件生成、执行引导精炼、测试中介分析和仅评估测试等不同机制,并跨代码生成、修复、翻译、重构、克隆检测、

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

Harness还是模型?在防污染私有套件中隔离智能体编码的Harness效应

该研究通过配对同模型对比,在256个私有防污染任务上测试了厂商原生harness与中立harness(deepagents)对智能体编码能力的影响。结果显示,Opus 4.8和GPT-5.5上两种harness的解决率差异均不显著(分别约1.25个百分点),但Opus在仓库任务上原生harness落后9.0个百分点、在竞赛任务上领先23.7个百分点,呈现任务

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

Orchestra:基于多源佐证的调控候选发现 MCP 智能体

该论文提出 Orchestra,将两个独立构建的生物信息学 MCP 服务器 RegNetAgents(推断调控网络拓扑)与 CASCADE(提供 LINCS 敲低、DepMap 必需性、超级增强子、DoRothEA 等独立实验证据)组合为基于 LangGraph 的多智能体工作流,并通过 MCP 协议暴露。核心主张是:要求网络拓扑证据与独立实验证据在候选调控

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向 OpenFOAM CFD 编码代理的案例包操作模型

该论文提出一种面向 OpenFOAM CFD 的「案例包(case-bundle)」操作模型,包含 Build 与 Replay 两种模式:Build 由工程师审查、编码代理协助开发案例,Replay 将已审查案例复用于新变体。研究用 GPT-5.5 在 Codex 中构建了一个 interFoam 案例包,并在远程 HPC 上回放执行 140 个 STL

正文结构化主题已通过公开置信门槛
量子位研究

CosmosMind发布MetaRSI-v1:统一RSI的元递归架构

CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家高校发布MetaRSI-v1,称其为全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,可改进自我改进过程本身。在无外部教师模型参与下,30亿激活参数小模型在四项基准平均自我提升10.9分,GPT-5.6、Claude Opus 5等六款前沿模型平均提升7.3

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

豆包手机助手消费者版本发布,首款新机9月16日开售

9月14日,豆包手机助手消费者版本正式发布,以豆包App为基础与手机厂商在系统层面合作,强调稳定性和日常可用性。该版本支持语音、AI键等多种唤醒方式,具备屏幕问答、本地记忆检索和任务执行能力,并以Beta版开放“操作手机”功能,同时推出屏幕自动化操作声明协议(SAEP)并启动30天规则公示。首个消费者版本将搭载于努比亚NaviX Ultra手机,9月16日正

正文结构化主题已通过公开置信门槛
智东西商业

英特尔2026技术创新与产业生态大会9月22日开幕

智东西报道,英特尔将于9月22日-23日举办2026英特尔技术创新与产业生态大会(Intel Connection 2026),聚焦智能体AI、端侧全场景创新与AI基础设施三大赛道。大会包含11场主题演讲、7大专题论坛、40+场技术课堂、15000平方米AI成果展区(1300+项成果)及5场免费开发者实操工作坊,英特尔与60余家合作伙伴展示云边端全栈技术。

9月13日周日 · 8 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

AllSpark 发布开源搜索智能体 Iris-mini 与 Iris-pro

中国实验室 AllSpark 发布开源搜索智能体 Iris-mini(350 亿参数)和 Iris-pro(3970 亿参数),基于 Qwen 系列模型,支持 256K 上下文,并公开完整训练配方。训练数据从网页链接结构反向构造多步问题,经两阶段过滤和强化学习(SFT-RL climbing)优化。团队称两者在各自规模的开源搜索智能体中表现最强,并指出运行时

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源产品发布

Codex 因 GitHub 服务中断导致审查与 PR 创建失败

OpenAI 状态页面报告 Codex 的代码审查发布和拉取请求创建功能出现故障,原因是上游 GitHub 服务中断。GitHub 应用缓解措施后,受影响服务已完全恢复。事件已从调查、定位、监控推进至解决状态。

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

蚂蚁数科外滩大会达成31项AI合作,推动智能体落地千行百业

蚂蚁数科在2026 Inclusion·外滩大会上围绕绿色能源、智能终端、酒店文旅、数字内容等领域达成31项AI合作,携手多家签约单位推动AI智能体、区块链、可信数据等技术落地。合作覆盖AI数智降碳、AI量化电力交易、AI工业机器人、具身智能机器人售卖亭、酒店AI云管家、文旅票务智能体等场景。此外,蚂蚁数科与阜博集团联合共建版权大模型,面向文生视频、AI短剧

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

大模型牌桌上,蚂蚁如何出牌?

雷峰网通过2026外滩大会观察蚂蚁集团的AI布局:底层为已迭代至Ling 3.0的百灵模型(含flash、tiny及多模态、金融版本),上层面向用户推出阿福(用户1.5亿、日均健康咨询约2000万次)和阿宝,面向企业由蚂蚁数科推出升级为商业智能体超级工厂的Agentar,并延伸至具身智能的灵波通用大脑。蚂蚁数科CEO赵闻飙披露AI To B业务增速达三位数。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

SImi-2B 公开权重发布:JAX/Flax 训练的 Llama 风格模型

开发者 Dakuwon Moody 在 Hugging Face 发布了 SImi-2B 的公开权重镜像,这是一个约 23.2 亿参数的 Llama 风格因果语言模型,使用 JAX/Flax 在 AMD MI300X 上以 bf16 训练。该仓库仅提供权重,不包含架构源码、训练器或 Transformers 检查点,因此无法通过 AutoModel.from

正文结构化主题已通过公开置信门槛
量子位观点

GitHub三榜第一背后:一个专升本工程师的十年

量子位报道了画图Agent Archify开发者涂少坤的故事。Archify单日最高新增5000 Star,总获5.88万Star、3.8k Fork,项目与开发者双双登顶GitHub热榜。涂少坤16岁辍学打工,后通过专升本考入重庆邮电大学,求职时因'专升本'学历多次在HR背调环节被撤回offer,最终成为小红书AI Native工程师。他将Archify的

正文结构化主题已通过公开置信门槛
量子位产品发布

外滩大会最特别Agent:能干活能陪聊还会拉黑你

量子位报道了米羊科技在外滩大会路演中推出的桌面Agent产品白艾莉(Alice),提出「关系型生产力Agent」概念,将生产力任务交付与人格化陪伴结合。白艾莉具备自研AI人格系统(四层架构)、世界模拟引擎(接入高德地图API、330个真实场馆)以及专业子Agent协作能力,并支持朋友圈互动、拉黑等关系化行为,官方称次日留存73%、7日留存45%、90日留存1