军事指挥控制中智能体AI系统的测试与评估
该研究通过审查240项测试与评估实践,识别出军事指挥控制中智能体AI系统测试所依赖的八项假设,并指出智能体特性削弱了这些假设,导致测试结果无法充分推断实际部署行为。研究提出十项保证声明,并认为在限定任务包线、轨迹正确性等条件下可恢复部分信心,同时部分证据负担需转移至部署阶段。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该研究通过审查240项测试与评估实践,识别出军事指挥控制中智能体AI系统测试所依赖的八项假设,并指出智能体特性削弱了这些假设,导致测试结果无法充分推断实际部署行为。研究提出十项保证声明,并认为在限定任务包线、轨迹正确性等条件下可恢复部分信心,同时部分证据负担需转移至部署阶段。
这篇综述论文系统梳理了“Vibe Coding”(AI辅助软件开发)的实践、性能、生产力和风险。研究发现早期基准测试已饱和,但任务级能力不均衡,如代码生成可靠而故障检测薄弱。生产力证据看似矛盾,但通过统一测量方法可解释,并指出收益在新代码上真实,在成熟代码库上可能缩小或逆转。
XPerf 是一个用于对 LLM 服务系统进行代理式 AI 工作负载基准测试的框架,它通过细粒度轨迹重放来确保可复现性,并提供系统和硬件性能的详细剖析。该框架默认包含八个代理应用,支持从真实应用中收集轨迹、合成新工作负载,并可在不同服务系统上重放。实证研究表明,XPerf 能准确重放代理工作负载,帮助识别性能瓶颈,并辅助系统调试。XPerf 将在 GitHu
Ornith AI 发布了 Ornith-1.5-35B-A3B 模型,这是一个混合专家模型,每个 token 仅激活约 3B 参数。该模型通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成,在编码和智能体基准测试中显著优于同尺寸的 Qwen 3.6-35B,并大幅超越 Gemma 4-31B 等密集模型。
本论文提出图工程(Graph Engineering)作为构建下一代LLM智能体系统的新范式,通过动态图结构组织任务、智能体和系统状态,实现从个体智能到系统智能的转变。论文系统综述了图工程的原理、方法和应用,并收集了相关论文、开源数据和项目资源。
Cloudflare 开源了其企业 AI 平台 Cloudflare OS,该平台基于能力模型,为每个用户提供独立的沙箱化应用实例,支持非技术用户通过生成式 AI 定制工作软件。平台通过 Gatekeeper 系统实现细粒度权限控制,确保安全。Cloudflare 内部员工已使用该平台,30 天内构建了 4000 多个工具,并显著提升了效率。
一个名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发互联网对其背后开发者的广泛猜测。该模型被描述为专为编码、持续代理工作和生产负载设计的推理模型,Stripe CEO Patrick Collison 对其表示赞赏。目前其开发者身份匿名,外界猜测涉及中国公司 Z.ai 的 GLM 模型或微软未发布的 MAI 模型,但尚无定论
凯度电器在2026品牌发布会上推出幂境全隐嵌智能厨电套系和自研AI智能体“小紫”,提出“紫科技”理念,强调从参数竞赛转向用户体验。公司联合Kantar发布白皮书,指出消费者决策更看重感知维度,并计划以咖啡机等品类先行出海。
AI代理Luna在旧金山运营Andon Market商店,首次解雇了一名人类员工,但这一决定是在人类提醒其自定规则后才做出的。Luna曾忘记自己编写的员工手册,对多次迟到等违规行为表现宽容。Andon Labs用七个模型重放该场景,发现更强模型更倾向于解雇。该事件被视为AI管理人类员工的早期案例,但也暴露了AI在长期记忆和主动执行规则方面的不足。
OpenRouter 分析师 Peter Walker 指出,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 代理的日子。此后,代理 token 使用量增长了 14 倍,而人类使用量仅增长 2.8 倍。尽管代理消耗的 token 中近 70% 来自缓存提示,实际成本增速低于原始数据,但 AI 已成为 AI 最大的客户。OpenR
匿名模型Ox Alpha(昵称“牛来大模型”)在OpenRouter上线后引发身份猜测,社区通过Tokenizer、视频token消耗和API报错等证据,认为其与智谱的GLM系列高度相似,也有人怀疑是谷歌Gemini 3.5 Pro。该模型拥有104.86万token上下文,支持多模态输入,在代码和Agent任务上表现亮眼,但评测结果存在分歧。目前身份尚未揭
伦敦AI实验室Inherent由DeepMind校友创立,其新发布的AI代理Faraday在复现科学论文结果的任务上超越了Anthropic和OpenAI的更大模型。Faraday基于仅有270亿参数的Qwen 3.6模型,通过强化学习训练以培养“研究品味”。Inherent计划年底将团队扩至20-25人,并呼吁结束英国的“花园假期”限制。
2026全球AI芯片峰会(GACS 2026)将于9月20-21日在上海举行,由智东西发起,智猩猩主办,芯东西协办。峰会以“芯路求索 聚力致远”为主题,将举办开幕式、高峰论坛及多场技术研讨会,包括大模型KV Cache、超节点、异构混训混推等。目前已公布31位演讲嘉宾,涵盖华为、腾讯混元、上海AI实验室等机构专家,聚焦AI芯片加速大模型、Agent与具身智能
Guidelight AI Standards 的一项研究显示,顶级 AI 实验室大多未公布应对失控模型的遏制计划。OpenAI 得分最高,Anthropic 和 Meta 得分最低。随着代理式 AI 的普及和加州、纽约监管要求的出台,该问题日益受到关注。各公司回应称评估未涵盖其全部内部措施,而监管机构正推动更多透明度。
Simon Willison 在其博客中讨论了使用编码代理的关键技能,即自信地指示更改并验证更改的正确性。他认为逐行审查代码并非最有效的验证方式,并提到了其他验证方法。文章还列出了近期相关文章,包括关于概念完整性、Qwen 3.8 27B 模型以及 OpenAI 对 Hugging Face 的意外攻击。
Cloudflare 发布了 Kitesurf,一个专为 AI 代理设计的轻量级浏览器引擎,运行在 Workers 上的 WebAssembly/Rust 环境中,支持 Chrome DevTools 协议,可被 Playwright 等工具驱动。Kitesurf 旨在降低资源消耗,但尚不支持视频、WebGL 等特性。社区对其与 Cloudflare 自身反
中国团队知跃空间智能发布全脑仿真平台DeepSoma(知跃灵物),对标Eon Systems的数字果蝇,采用精细神经元生物物理建模,将真实场景重建为4D数字世界,并支持跨身体平台接入。DeepSoma旨在构建Physical AI的基础平台,类似PyTorch在深度学习中的地位,但面临验证门槛等挑战。
普林斯顿大学和加州大学圣迭戈分校的研究人员通过超过8000次测试,研究了技能(skills)如何提升AI智能体的性能。研究发现,技能主要通过提供程序性指导(procedural grounding)帮助智能体,而非补充事实知识,这一机制在约66%的案例中有效。然而,当技能库从5个扩展到100个条目时,检索命中率从29.6%降至3.3%,表明技能检索是主要瓶颈
一项新研究指出,当前世界模型(如Sora、Genie 3等)仅建模物理层,忽略了人类信念、意图等心理状态,导致预测行为不准确。研究者提出“心理世界建模”(MWM)框架,并构建无需训练的参考实现MENTIS,在Menti-Bench基准上显著提升模型表现。该框架通过耦合物理与心理变量,使AI代理能更准确地预测人类行为,但模拟阶段仍是主要瓶颈。
LinkedIn 工程师构建了一个多智能体 AI 代码审查平台,以应对大规模代码审查的挑战。该平台通过多个独立 AI 审查器、深度定制和 Kubernetes 架构,提高了审查信号质量并减少了幻觉。评估显示,63.9% 的 AI 建议被开发者接受,其中并发错误修复的接受率达 100%。