返回主题地图

Agent 智能体

技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月24日周一 · 7 条
正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

军事指挥控制中智能体AI系统的测试与评估

该研究通过审查240项测试与评估实践,识别出军事指挥控制中智能体AI系统测试所依赖的八项假设,并指出智能体特性削弱了这些假设,导致测试结果无法充分推断实际部署行为。研究提出十项保证声明,并认为在限定任务包线、轨迹正确性等条件下可恢复部分信心,同时部分证据负担需转移至部署阶段。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Vibe Coding 实践、性能、生产力与风险:最新综述

这篇综述论文系统梳理了“Vibe Coding”(AI辅助软件开发)的实践、性能、生产力和风险。研究发现早期基准测试已饱和,但任务级能力不均衡,如代码生成可靠而故障检测薄弱。生产力证据看似矛盾,但通过统一测量方法可解释,并指出收益在新代码上真实,在成熟代码库上可能缩小或逆转。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

XPerf:面向代理式 AI 工作负载的 LLM 服务系统基准测试框架

XPerf 是一个用于对 LLM 服务系统进行代理式 AI 工作负载基准测试的框架,它通过细粒度轨迹重放来确保可复现性,并提供系统和硬件性能的详细剖析。该框架默认包含八个代理应用,支持从真实应用中收集轨迹、合成新工作负载,并可在不同服务系统上重放。实证研究表明,XPerf 能准确重放代理工作负载,帮助识别性能瓶颈,并辅助系统调试。XPerf 将在 GitHu

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ornith AI 发布 Ornith-1.5-35B-A3B 模型,以 3B 激活参数实现卓越编码性能

Ornith AI 发布了 Ornith-1.5-35B-A3B 模型,这是一个混合专家模型,每个 token 仅激活约 3B 参数。该模型通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成,在编码和智能体基准测试中显著优于同尺寸的 Qwen 3.6-35B,并大幅超越 Gemma 4-31B 等密集模型。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

图工程:从个体智能到系统智能的LLM智能体新范式

本论文提出图工程(Graph Engineering)作为构建下一代LLM智能体系统的新范式,通过动态图结构组织任务、智能体和系统状态,实现从个体智能到系统智能的转变。论文系统综述了图工程的原理、方法和应用,并收集了相关论文、开源数据和项目资源。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering开源

Cloudflare 开源企业 AI 平台 Cloudflare OS,基于能力模型保障安全

Cloudflare 开源了其企业 AI 平台 Cloudflare OS,该平台基于能力模型,为每个用户提供独立的沙箱化应用实例,支持非技术用户通过生成式 AI 定制工作软件。平台通过 Gatekeeper 系统实现细粒度权限控制,确保安全。Cloudflare 内部员工已使用该平台,30 天内构建了 4000 多个工具,并显著提升了效率。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

神秘AI模型Ox Alpha引发猜测:背后开发者是谁?

一个名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发互联网对其背后开发者的广泛猜测。该模型被描述为专为编码、持续代理工作和生产负载设计的推理模型,Stripe CEO Patrick Collison 对其表示赞赏。目前其开发者身份匿名,外界猜测涉及中国公司 Z.ai 的 GLM 模型或微软未发布的 MAI 模型,但尚无定论

8月23日周日 · 7 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

凯度发布幂境套系与AI智能体“小紫”,厨电竞争转向体验

凯度电器在2026品牌发布会上推出幂境全隐嵌智能厨电套系和自研AI智能体“小紫”,提出“紫科技”理念,强调从参数竞赛转向用户体验。公司联合Kantar发布白皮书,指出消费者决策更看重感知维度,并计划以咖啡机等品类先行出海。

正文结构化主题已通过公开置信门槛
THE DECODER商业

AI老板首次解雇人类员工,但需人类提醒其规则

AI代理Luna在旧金山运营Andon Market商店,首次解雇了一名人类员工,但这一决定是在人类提醒其自定规则后才做出的。Luna曾忘记自己编写的员工手册,对多次迟到等违规行为表现宽容。Andon Labs用七个模型重放该场景,发现更强模型更倾向于解雇。该事件被视为AI管理人类员工的早期案例,但也暴露了AI在长期记忆和主动执行规则方面的不足。

正文结构化主题已通过公开置信门槛
THE DECODER研究

AI 成为自身最大客户:OpenRouter 代理 token 使用量激增 14 倍

OpenRouter 分析师 Peter Walker 指出,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 代理的日子。此后,代理 token 使用量增长了 14 倍,而人类使用量仅增长 2.8 倍。尽管代理消耗的 token 中近 70% 来自缓存提示,实际成本增速低于原始数据,但 AI 已成为 AI 最大的客户。OpenR

正文结构化主题已通过公开置信门槛
量子位产品发布

匿名模型Ox Alpha身份成谜,社区通过技术指纹猜测智谱或谷歌

匿名模型Ox Alpha(昵称“牛来大模型”)在OpenRouter上线后引发身份猜测,社区通过Tokenizer、视频token消耗和API报错等证据,认为其与智谱的GLM系列高度相似,也有人怀疑是谷歌Gemini 3.5 Pro。该模型拥有104.86万token上下文,支持多模态输入,在代码和Agent任务上表现亮眼,但评测结果存在分歧。目前身份尚未揭

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

DeepMind校友创立的Inherent称其AI代理在复现研究上超越Anthropic和OpenAI

伦敦AI实验室Inherent由DeepMind校友创立,其新发布的AI代理Faraday在复现科学论文结果的任务上超越了Anthropic和OpenAI的更大模型。Faraday基于仅有270亿参数的Qwen 3.6模型,通过强化学习训练以培养“研究品味”。Inherent计划年底将团队扩至20-25人,并呼吁结束英国的“花园假期”限制。

正文结构化主题已通过公开置信门槛
智东西商业

2026全球AI芯片峰会嘉宾阵容公布,聚焦KV Cache与AI芯片前沿

2026全球AI芯片峰会(GACS 2026)将于9月20-21日在上海举行,由智东西发起,智猩猩主办,芯东西协办。峰会以“芯路求索 聚力致远”为主题,将举办开幕式、高峰论坛及多场技术研讨会,包括大模型KV Cache、超节点、异构混训混推等。目前已公布31位演讲嘉宾,涵盖华为、腾讯混元、上海AI实验室等机构专家,聚焦AI芯片加速大模型、Agent与具身智能

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

前沿AI实验室缺乏遏制失控模型计划

Guidelight AI Standards 的一项研究显示,顶级 AI 实验室大多未公布应对失控模型的遏制计划。OpenAI 得分最高,Anthropic 和 Meta 得分最低。随着代理式 AI 的普及和加州、纽约监管要求的出台,该问题日益受到关注。各公司回应称评估未涵盖其全部内部措施,而监管机构正推动更多透明度。

8月22日周六 · 6 条
正文结构化主题已通过公开置信门槛
Simon Willison's Weblog观点

编码代理的关键技能:不止于代码审查

Simon Willison 在其博客中讨论了使用编码代理的关键技能,即自信地指示更改并验证更改的正确性。他认为逐行审查代码并非最有效的验证方式,并提到了其他验证方法。文章还列出了近期相关文章,包括关于概念完整性、Qwen 3.8 27B 模型以及 OpenAI 对 Hugging Face 的意外攻击。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Cloudflare 发布 Kitesurf:面向 AI 代理的轻量级浏览器引擎

Cloudflare 发布了 Kitesurf,一个专为 AI 代理设计的轻量级浏览器引擎,运行在 Workers 上的 WebAssembly/Rust 环境中,支持 Chrome DevTools 协议,可被 Playwright 等工具驱动。Kitesurf 旨在降低资源消耗,但尚不支持视频、WebGL 等特性。社区对其与 Cloudflare 自身反

正文结构化主题已通过公开置信门槛
量子位产品发布

中国团队发布DeepSoma全脑仿真平台,对标Eon数字果蝇

中国团队知跃空间智能发布全脑仿真平台DeepSoma(知跃灵物),对标Eon Systems的数字果蝇,采用精细神经元生物物理建模,将真实场景重建为4D数字世界,并支持跨身体平台接入。DeepSoma旨在构建Physical AI的基础平台,类似PyTorch在深度学习中的地位,但面临验证门槛等挑战。

正文结构化主题已通过公开置信门槛
THE DECODER研究

研究揭示AI智能体技能提升机制及检索瓶颈

普林斯顿大学和加州大学圣迭戈分校的研究人员通过超过8000次测试,研究了技能(skills)如何提升AI智能体的性能。研究发现,技能主要通过提供程序性指导(procedural grounding)帮助智能体,而非补充事实知识,这一机制在约66%的案例中有效。然而,当技能库从5个扩展到100个条目时,检索命中率从29.6%降至3.3%,表明技能检索是主要瓶颈

正文结构化主题已通过公开置信门槛
THE DECODER研究

新研究:忽视人类信念的世界模型预测行为不准

一项新研究指出,当前世界模型(如Sora、Genie 3等)仅建模物理层,忽略了人类信念、意图等心理状态,导致预测行为不准确。研究者提出“心理世界建模”(MWM)框架,并构建无需训练的参考实现MENTIS,在Menti-Bench基准上显著提升模型表现。该框架通过耦合物理与心理变量,使AI代理能更准确地预测人类行为,但模拟阶段仍是主要瓶颈。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

LinkedIn 多智能体 AI 代码审查平台:提升大规模审查效率

LinkedIn 工程师构建了一个多智能体 AI 代码审查平台,以应对大规模代码审查的挑战。该平台通过多个独立 AI 审查器、深度定制和 Kubernetes 架构,提高了审查信号质量并减少了幻觉。评估显示,63.9% 的 AI 建议被开发者接受,其中并发错误修复的接受率达 100%。