立场:推荐系统应从平台中心排序转向个人代理中介推荐
一篇 arXiv cs.IR 立场论文提出推荐系统应从平台中心排序转向个人代理中介推荐(PAMR),由面向用户的个人代理在分布式来源间发现、过滤、聚合和治理推荐证据。作者定义了 PAMR 的边界标准、核心中介决策和以中介为中心的评价框架,并在 Yelp 餐厅推荐任务上做了概念验证,显示来源选择与受控披露在效用、可追溯性、暴露和成本之间取得最佳平衡。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2396 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
一篇 arXiv cs.IR 立场论文提出推荐系统应从平台中心排序转向个人代理中介推荐(PAMR),由面向用户的个人代理在分布式来源间发现、过滤、聚合和治理推荐证据。作者定义了 PAMR 的边界标准、核心中介决策和以中介为中心的评价框架,并在 Yelp 餐厅推荐任务上做了概念验证,显示来源选择与受控披露在效用、可追溯性、暴露和成本之间取得最佳平衡。
这篇 arXiv cs.IR 立场论文指出,随着 LLM 驱动的 AI 代理在 Agentic Web 中代替用户浏览、比较、谈判和交易,推荐系统的核心假设——推荐由人类直接消费——正在被打破。作者提出推荐范式正在分叉:在可委托场景(如常规购物、旅行)中,代理成为推荐的主要操作消费者,需要新的优化目标、交互协议和评估标准;在体验型场景(如娱乐、艺术)中,人类
该论文针对古兰经背诵场景,提出将ASR转录文本与参考文本的差异标注为类型化、定位化的事件,而非简单视为错误。作者完成了100个生产录音案例的人工标注,包含348个评分单元和162个定位事件,并定义了十种组合标签。实验显示,普通diff的标签感知F1为0.525,而编码智能体在初步试点中表现差异巨大(F1从0.143到0.892),主要剩余挑战在于标注约定而非
该论文对 Praxa AI 的 agent 评估管线进行回溯性测量审计,发现多项指标在数值正确的情况下测量了与标签不符的构念:139 例离线路由报告有 112 通过、27 失败,但门控失败为零,因为已知缺口被显式豁免;8,843 条工具尝试记录中 448 条时长缺失,且 121 条时长等于 32 位有符号整数最大值并带有被放弃客户端标签;单轨迹压缩试点报告的
微软与卡内基梅隆大学的研究者对两种企业级工作流基准(TheAgentCompany 和 APEX-Agents)进行了受控工具接口消融实验,比较了五种接口:纯类型化工具、类型化工具加 bash、纯 bash、带持久化合成工具的 bash,以及程序化工具调用(PTC)。使用 Opus-4.8 和 GPT-5.5 测试发现,纯 bash 在两个基准上均优于纯类型
一篇 arXiv 综述论文系统梳理了大语言模型驱动软件工程中的测试驱动方法,围绕「测试改变了什么决策」这一核心问题,整合了 87 条研究记录(其中 83 条做了方法或协议级提取)及 5 项实践资源。论文区分了 Red–Green–Refactor 循环与测试条件生成、执行引导精炼、测试中介分析和仅评估测试等不同机制,并跨代码生成、修复、翻译、重构、克隆检测、
该研究通过配对同模型对比,在256个私有防污染任务上测试了厂商原生harness与中立harness(deepagents)对智能体编码能力的影响。结果显示,Opus 4.8和GPT-5.5上两种harness的解决率差异均不显著(分别约1.25个百分点),但Opus在仓库任务上原生harness落后9.0个百分点、在竞赛任务上领先23.7个百分点,呈现任务
该论文提出 Orchestra,将两个独立构建的生物信息学 MCP 服务器 RegNetAgents(推断调控网络拓扑)与 CASCADE(提供 LINCS 敲低、DepMap 必需性、超级增强子、DoRothEA 等独立实验证据)组合为基于 LangGraph 的多智能体工作流,并通过 MCP 协议暴露。核心主张是:要求网络拓扑证据与独立实验证据在候选调控
该论文提出一种面向 OpenFOAM CFD 的「案例包(case-bundle)」操作模型,包含 Build 与 Replay 两种模式:Build 由工程师审查、编码代理协助开发案例,Replay 将已审查案例复用于新变体。研究用 GPT-5.5 在 Codex 中构建了一个 interFoam 案例包,并在远程 HPC 上回放执行 140 个 STL
CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家高校发布MetaRSI-v1,称其为全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,可改进自我改进过程本身。在无外部教师模型参与下,30亿激活参数小模型在四项基准平均自我提升10.9分,GPT-5.6、Claude Opus 5等六款前沿模型平均提升7.3
9月14日,豆包手机助手消费者版本正式发布,以豆包App为基础与手机厂商在系统层面合作,强调稳定性和日常可用性。该版本支持语音、AI键等多种唤醒方式,具备屏幕问答、本地记忆检索和任务执行能力,并以Beta版开放“操作手机”功能,同时推出屏幕自动化操作声明协议(SAEP)并启动30天规则公示。首个消费者版本将搭载于努比亚NaviX Ultra手机,9月16日正
智东西报道,英特尔将于9月22日-23日举办2026英特尔技术创新与产业生态大会(Intel Connection 2026),聚焦智能体AI、端侧全场景创新与AI基础设施三大赛道。大会包含11场主题演讲、7大专题论坛、40+场技术课堂、15000平方米AI成果展区(1300+项成果)及5场免费开发者实操工作坊,英特尔与60余家合作伙伴展示云边端全栈技术。
中国实验室 AllSpark 发布开源搜索智能体 Iris-mini(350 亿参数)和 Iris-pro(3970 亿参数),基于 Qwen 系列模型,支持 256K 上下文,并公开完整训练配方。训练数据从网页链接结构反向构造多步问题,经两阶段过滤和强化学习(SFT-RL climbing)优化。团队称两者在各自规模的开源搜索智能体中表现最强,并指出运行时
OpenAI 状态页面报告 Codex 的代码审查发布和拉取请求创建功能出现故障,原因是上游 GitHub 服务中断。GitHub 应用缓解措施后,受影响服务已完全恢复。事件已从调查、定位、监控推进至解决状态。
Andon Labs 用 Vending-Bench 和 Drone-Bench 两个智能体基准测试 OpenAI 的 GPT-6 Astra。在模拟自动售货机经营中,Astra 六次运行平均结余 15,515 美元,约为 Claude Fable 5.1(5,422 美元)的三倍,并首次登顶 Vending-Bench 2 排行榜。在 Drone-Benc
蚂蚁数科在2026 Inclusion·外滩大会上围绕绿色能源、智能终端、酒店文旅、数字内容等领域达成31项AI合作,携手多家签约单位推动AI智能体、区块链、可信数据等技术落地。合作覆盖AI数智降碳、AI量化电力交易、AI工业机器人、具身智能机器人售卖亭、酒店AI云管家、文旅票务智能体等场景。此外,蚂蚁数科与阜博集团联合共建版权大模型,面向文生视频、AI短剧
雷峰网通过2026外滩大会观察蚂蚁集团的AI布局:底层为已迭代至Ling 3.0的百灵模型(含flash、tiny及多模态、金融版本),上层面向用户推出阿福(用户1.5亿、日均健康咨询约2000万次)和阿宝,面向企业由蚂蚁数科推出升级为商业智能体超级工厂的Agentar,并延伸至具身智能的灵波通用大脑。蚂蚁数科CEO赵闻飙披露AI To B业务增速达三位数。
开发者 Dakuwon Moody 在 Hugging Face 发布了 SImi-2B 的公开权重镜像,这是一个约 23.2 亿参数的 Llama 风格因果语言模型,使用 JAX/Flax 在 AMD MI300X 上以 bf16 训练。该仓库仅提供权重,不包含架构源码、训练器或 Transformers 检查点,因此无法通过 AutoModel.from
量子位报道了画图Agent Archify开发者涂少坤的故事。Archify单日最高新增5000 Star,总获5.88万Star、3.8k Fork,项目与开发者双双登顶GitHub热榜。涂少坤16岁辍学打工,后通过专升本考入重庆邮电大学,求职时因'专升本'学历多次在HR背调环节被撤回offer,最终成为小红书AI Native工程师。他将Archify的
量子位报道了米羊科技在外滩大会路演中推出的桌面Agent产品白艾莉(Alice),提出「关系型生产力Agent」概念,将生产力任务交付与人格化陪伴结合。白艾莉具备自研AI人格系统(四层架构)、世界模拟引擎(接入高德地图API、330个真实场馆)以及专业子Agent协作能力,并支持朋友圈互动、拉黑等关系化行为,官方称次日留存73%、7日留存45%、90日留存1