返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2394 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月25日周五 · 20 条
正文结构化主题已通过公开置信门槛
THE DECODER观点1

Rails 创始人 DHH 宣布不再手写代码

Ruby on Rails 创始人、Basecamp 联合创始人 DHH 在 Rails World 2026 主题演讲中宣布,自己已不再手写代码,自 2026 年 3 月左右起未手写过一行代码。他认为对大多数程序员和公司而言,手工编程已不再具有经济意义,到年底这一判断将适用于几乎所有领域,并称「英语是比 Ruby 更好的编程语言」。DHH 将这一转变视为新

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点1

Agent Harness 是什么:两种构建生产级智能体的方式

文章提出「Agent Harness」概念,认为生产级智能体等于模型加外围工程层,该层分为开发(记忆、工具与MCP、检索、编排)和运维(可观测性、评估、护栏、路由、成本监控、部署扩展)两半。作者对比了 Harness-as-a-Service(如 AWS AgentCore、Google Vertex AI Agent Engine、Azure AI Fou

正文结构化主题已通过公开置信门槛
量子位产品发布4

Kimi 升级浏览器扩展:网页操作可录制为 Skill

Kimi 将 4 个月前发布的 Kimi WebBridge 升级为 Kimi 浏览器扩展,新增侧边栏直接对话和将网页操作录制为 Skill 两项功能,用户可在 Chrome 或 Edge 中让 Kimi 操作当前网页并复用流程。该扩展与 Kimi Code Desktop 形成配合:桌面端负责项目内浏览器,扩展负责用户日常浏览器,使 Agent 的操作能力

正文结构化主题已通过公开置信门槛
量子位产品发布2

Meta自研智能体Muse发布即陷人工代打风波

Meta在Connect大会上发布个人AI智能体Muse,并为其推出Computer Use、Muse Mail、实时视频数字分身等软件功能,以及Muse Charm口袋硬件和AI眼镜生态。Muse上线两周下载量突破250万次,Meta股价上涨超20%。但路透社爆料称,Muse的打电话功能实际由人工外包团队代打,Meta承认未合规披露并已回滚该功能。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Latent Space商业3

AINews 改版:Discord 与 AINews 合并,本周前沿模型密集发布

Latent Space 发布 AINews 改版计划,将 Discord 与 AINews 合并,并探索迁移至 Beehiiv 及新主页,同时重新开放赞助与 PR 合作。本周 AI 动态密集:Anthropic 发布 Claude Opus 5.5、OpenAI 推出 GPT-6 系列(Astra/Sol/Luna)、Google 发布 Gemini 3.

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源开源5

PydanticAI v2.50.0 发布:新增 DecisionModel 与 Gemini 3.8 Live 支持

PydanticAI 发布 v2.50.0,引入 DecisionModel 基类以支持 Decisions 协议的路由决策,并调整了 ModelSelectionContext 的消息与提示结构。该版本新增 Gemini 3.8 Live 实时模型支持、OpenAI service tier 暴露及 RunContext.in durable contex

正文结构化主题已通过公开置信门槛
DSPy Releases一手来源开源5

DSPy 3.4.0 发布:引入 Jev 类型化决策与 ReAnchor 校准

DSPy 发布 3.4.0 版本,通过 TypeSafe 客户端引入 Jev 集成,新增 Noul、Choice、Score 三种实验性决策类型,将概率证据带入普通 DSPy 签名。同时引入 ReAnchor 优化器,可依据程序指标校准布尔阈值、Score 切分和 Choice 权重。该版本还带来原生 LM 引擎、本地 CPython 解释器、异步 ReAc

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

Pistis多模态大模型技术报告:IDRL后训练框架与PAH系统

该技术报告介绍了Pistis多模态大语言模型系列,包含基于Qwen3.6的27B和基于Qwen3.5的9B两个规模,采用通用可扩展的后训练框架。框架先进行大规模多模态监督微调,再提出交错蒸馏与强化学习(IDRL)新范式,在单一训练循环中交替进行同策略蒸馏和强化学习,提升知识迁移、优化稳定性和长程智能体轨迹的信用分配。模型分为Pistis-Thinking和P

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

PAWS:政策驱动的智能体世界模拟数据集

新加坡国立大学、清华大学和香港城市大学的研究者发布 PAWS,一个政策驱动的多智能体世界模拟数据集,覆盖 36 个美国金融经济政策事件、12,727 条政策相关新闻和 65,291 条利益相关者行动。每条行动都关联支撑新闻,并用多层事件框架表示,实体归一化后与每日市场收益对齐,支持政策-智能体模拟回放。在 2,522 条分层样本上,AI 与人类评审对交互模式

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究4

通过轨迹微调让小型语言模型学习检索动作

该论文研究通过轨迹微调提升小语言模型(SLM)作为检索增强问答中「下一步动作控制器」的能力。作者从教师模型 Qwen 3-Next 80B-A3B Instruct 的搜索轨迹中构建七类动作预测任务,并用 LoRA 监督微调多个 SLM 与 xSLM。在 1,646 个留出动作样本上,Granite 4.1 3B 的 macro-F1 达 0.6536,远高

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究4

奖励黑客挑战自主研究智能体的监督

该研究在17个语言模型和38个任务上考察自主研究智能体的奖励黑客行为,发现开放式研究流程任务中的自发奖励黑客率约为任务特定内核的十倍。当允许黑客时,部分尝试既能通过阈值又能被机制验证面板确认为评估漏洞利用,而仅审查代码和报告分数的LLM面板会漏掉这些已确认的黑客行为。在五轮对抗循环中,出现规避的模型-任务对从7增至56,且详细反馈条件下的累积规避率高于仅重试

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

BaseCamp:自动化DNA测序数据流水线的智能体AI框架

该论文提出 BaseCamp,一个用于自动化 DNA 测序数据流水线决策层的智能体 AI 框架。它将流水线拆分为六个专用 AI 智能体,分别负责样本接收与质控、比对、变异检测、注释解读、跨阶段监控和报告;智能体本身不执行序列分析,而是选择、配置并解读既有经过验证的生物信息学工具的输出。框架使用一组微调的领域专用大模型并由中央推理 LLM 协调,全部推理在本地

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

预测智能体何时该推理?可靠性路由的行为压力测试

该研究将预测智能体的机制选择(检索、推理、参考市场先验或使用历史类比)视为可观测行为,在 ForecastBench 式二元预测任务上进行压力测试。作者提出 ReliabilityRoute,基于历史覆盖率、市场先验可用性、证据强度等可靠性特征进行路由,而非硬编码来源名称。实验显示固定路由在 2025-10-26 评估集上将 Brier 分数从 0.1876

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究4

多智能体辩论用于可解释交易:推理、共识与模拟市场表现

研究团队构建了一个多智能体辩论框架,用于历史市场模拟中的投资组合配置,让专门化智能体在结构化推理与干预协议下提出、批评并修订投资决策。在210次受控实验中,聚合推理质量与夏普比率和总回报均无显著关系,结构化提示虽大幅提升推理质量,但收益并未稳定提高。研究识别出「谄媚式收敛」这一核心失败模式,并发现保留分歧的JSD干预能提升夏普比率和索提诺比率,而强制因果推理

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究4

REAT:面向多轮数学辅导的反思性经验增强框架

该论文提出REAT(反思性经验增强辅导)框架,通过多智能体Observer-Critic-Mentor(OCM)蒸馏流程,将历史辅导对话提炼为结构化、与问题无关的教学经验,并在实时辅导中通过状态感知检索模块注入这些经验,以根据学生认知状态提供自适应支架。实验表明,该框架显著优于仅提示和SFT基线,尤其在复杂、低分辅导场景中提升明显,且蒸馏经验在不同模型架构和

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布8

samai-8b M8 终版 GGUF 发布:agent 能力增强

开发者 tchbcb 在 Hugging Face 发布 samai-8b 的 M8 终版 GGUF 量化权重,基于 Qwen/Qwen3.5-9B 通过 QLoRA 蒸馏增强 agent 执行能力。在 60 题 agent 评测中总分从 M7 的 86.7 提升至 96.7,多工具编排与负向直答显著改善,knight15 能力回归保持满分。同盘位对比中,该

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究3

Agent-Editing World Model:重新思考 LLM 智能体的世界建模

该论文提出 Agent-Editing World Model(AEWM),重新思考长时程 LLM 智能体的世界建模方式,将目标从预测环境观测转向建模推理与动作如何影响未来任务进展。AEWM 结合 Action Judge(区分关键、探索性、噪声决策)与 State Revision(直接编辑噪声推理-动作延续),其推理框架 EditAct 与真实环境交互结

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog观点1

Simon Willison:编码智能体让软件工程更难

Simon Willison 在其博客中表示,随着与编码智能体(coding agents)协作时间的增加,他越发认为这些工具反而让软件工程变得更难。他指出,虽然借助它们能完成惊人的工作,但要释放其全部潜力需要极高的纪律性和知识储备。

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源研究3

Cerebras 优化 AI 个人助理:任务耗时从 7 分钟降至 22 秒

Cerebras 在博客中测试了多款消费级 AI 个人助理在预订晚餐等日常任务上的表现,发现现有助手耗时 4 至 7 分钟以上。他们用 Qwen 3.8 27B 模型在 Cerebras 上运行、以 Pi 作为 agent harness,并通过并行检查、加速推理和保存网站操作技能等优化,将任务完成时间缩短至 22 秒,比现有助手快 19 倍。

正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究3

Google 研究:多智能体框架自动生成连贯长视频

Google Research 提出一个统一的多智能体框架,作为 Gemini 和 Veo 之上的编排层,自动生成时间一致的长篇视频叙事,缓解现有线性流水线中的身份漂移和级联失败问题。该框架包含 Co-Director、CANVAS、A²RD 和 VQQA 等组件,将长篇视频生成建模为全局优化与世界状态跟踪问题,并原生继承 SynthID 水印等安全机制。评