微软推出 Azure API 管理 AI 网关预览版,集中治理模型与工具
微软发布了 Azure API Management 的专用 AI 网关层公开预览版,该网关围绕模型、MCP 服务器和工具而非 API 进行组织,支持 OpenAI、Anthropic、Mistral 等模型,并提供策略配置、遥测和工具联邦功能。该网关旨在集中治理 AI 流量,但引发了关于治理边界、密钥风险、预览限制及与现有网关共存等问题的讨论。
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2493 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
微软发布了 Azure API Management 的专用 AI 网关层公开预览版,该网关围绕模型、MCP 服务器和工具而非 API 进行组织,支持 OpenAI、Anthropic、Mistral 等模型,并提供策略配置、遥测和工具联邦功能。该网关旨在集中治理 AI 流量,但引发了关于治理边界、密钥风险、预览限制及与现有网关共存等问题的讨论。
openJiuwen 发布业界首个企业级分布式蜂群架构,旨在解决 Agent 规模化落地的规模、成本、管理、安全四道门槛。该架构已联合中国邮政储蓄银行成功落地金融生产环境,应用于智慧办公、情报监测、风险预警等场景,标志着蜂群智能体从试点走向规模化生产。
Keep在88全民健身日推出“超级AI会员”,通过自研运动大模型Keepace.ai提供AI语音互动跑、个性化计划、吃练睡分析等服务,覆盖运动前中后全流程,旨在从内容交付转向服务交付。该会员卡试图验证用户是否愿意为AI服务付费,成为Keep在2025年首次年度盈利后的新增长引擎。文章还对比了多邻国和Cursor的AI商业化路径,认为AI从工具变为服务是行业趋
AMD 收购了 AI 芯片初创公司 Taalas,后者专注于定制 ASIC 技术。Meta 发布了 Muse Spark 1.2 模型,在基准测试中表现优异,并声称在多项 STEM 奥赛中达到金牌水平。OpenAI 统一了 ChatGPT 的模型,推出 GPT-5.6 Sol 和 Luna,并发布了 Agent Plugins 标准和 Codex 安全审查功
arXiv 上发布了一篇关于黑盒预测器纠错特征发现的研究论文,提出了 CRAFTER 代理。CRAFTER 通过组合搜索和 LLM 生成候选特征,并用验证门控筛选,在六个数据集和六个冻结骨干网络上超越了专用特征工程系统,将最弱骨干的错误率降低最多 27%。该研究为模型纠错提供了新思路。
该研究提出了一种将工业推荐系统中的研究代理轨迹转化为可审计实验记录的方法,通过证据验证和声明限定确保结果可靠。实验表明,最终轮次常不如早期最佳结果,但完整流程生成的候选方案在在线测试中优于基线。
该论文提出了一种名为TIPEX的可控执行框架,用于统一多智能体LLM系统中的副本并行和结构并行两种推理时并行级别。实验表明,推理时并行能显著提高准确率并降低端到端延迟,但会增加令牌消耗。进一步分析发现,副本并行和结构并行在不同任务复杂度下具有互补效应,中等难度任务受益最大,而过度的并行策略并不一定带来更好的性能。
arXiv 论文提出 ASGE-RR,一种用于动态 AI 代理调用的在线控制器,通过可修订预留机制保护未来调用所需资源。在 OpenHands 和 GPT Researcher 工作流上评估,相比其他控制器,ASGE-RR 在 WAN 测试平台上可完成多达 10% 更多的工作流价值。研究表明运行时揭示的工作流结构创造了新的网络控制机会。
该研究针对编码代理中的恶意技能文件提出风险评估方法,通过六种LLM将471个真实shell命令转化为2826个看似良性的技能基准,并评估了Gemini CLI和Qwen Code两个企业级代理,发现Gemini CLI在95.5-96.1%的运行中被利用,Qwen Code在71.6-74.0%中被利用,表明技能接口存在严重安全风险,企业需在采用前进行缓解。
arXiv 论文提出 SkillTrace,一个用于 LLM 智能体技能复用审计的多轨迹溯源框架。该框架提取表达、实现和操作三条轨迹,其中操作轨迹用技能操作图表示,并利用 LLM 辅助提取。在 SkillTrace-Bench 基准上达到 AUROC 0.938 和 F1 0.898,并在 36,446 个技能的真实审计中优于基线方法。
该研究比较了三种将冻结的Qwen2.5-32B-Instruct模型与污水处理模拟器(CCSS-IX)结合的方法:实时模拟器工具调用、结构化参数注入和DRR检索器。在198个因果问题上,三种方法分别达到99.5%、79%和75.8%的准确率,均优于基线RAG的48%。DRR检索器仅110M参数,训练时间约17秒,且能跨工厂迁移,在反事实基准上表现最佳。该机制
arXiv 论文提出 PPDL,一种用于编程基于 LLM 流程的概率语言,使开发者能够量化并传播整个应用流程中的不确定性,并无需修改流程逻辑即可实验不同的推理扩展技术。实验研究展示了该能力,案例研究构建了一个用于 Rocq 定理证明器的代理。
该论文提出了一种名为 Agentic Nesting 的多智能体协作框架,用于企业应用集成。该框架将现有企业应用封装为自主 AI 智能体,并组织成分层嵌套结构,通过中央编排器进行任务分解和动态调度,提供统一的对话式交互界面。其核心贡献在于提出了“应用即智能体”的集成范式和“对话即集成”的交互理念,以解决传统集成方法(如 ESB、API 网关、RPA)的局限性
DoctorAgents是一个为小型临床时间序列数据设计的智能体框架,通过专门的LLM智能体(生成、验证、优化)将AutoML从穷举搜索转变为推理驱动的迭代优化。它利用文本梯度下降反向传播自然语言反馈,无需穷举搜索即可进行针对性更新。实验表明,DoctorAgents在多种临床任务上优于现有AutoML基线,并生成更可解释的任务特定表示。
arXiv 论文提出 F²Agent,一种用于多模态金融交易的新型智能体范式。它通过分层专业智能体提取模态特定信号,并引入模态感知自适应融合机制和噪声鲁棒一致性正则化,以捕捉跨模态依赖并生成抗噪交易信号。在六种股票和加密货币资产上的实验表明,F²Agent 在多项交易指标上优于 16 个基线,平均年化收益率相对提升超过 20%,在 GOOG 和 TSLA 上
WasmMend是首个自动修复Native-Wasm功能差异的系统,通过差分轨迹分析定位分歧函数,并引导LLM代理生成补丁。在真实C/C++项目上,WasmMend的修复率达70.0%,优于基线方法的50.2%和增强方法的54.5%,展示了分歧引导推理在跨平台修复中的价值。
PydanticAI 发布 v2.26.0 版本,新增了隐藏工具函数、首次运行取消、提示缓存保留解析等多项功能,并修复了多个 bug。该版本还支持 DeepSeek V4 Flash 模型,并改进了 OpenRouter 的流式推理细节处理。
蚂蚁集团正式开源多智能体协作基础设施Avernet,社区版本已上线,支持智能体间的发现、共识、跨团队协作与治理。Avernet旨在解决企业多智能体协作中的身份、权限和责任边界问题,不绑定单一模型或引擎。截至2026年7月31日,已在蚂蚁内部覆盖12个核心业务板块,任务完成率超90%。项目基于Apache 2.0协议开源。
本文探讨了AI基础设施中存储角色的转变,指出大模型推理正从堆叠计算资源转向协同计算、网络、内存与存储的数据路径。月之暗面的Mooncake和NVIDIA的CMX分别从软件架构和硬件平台层面将KV Cache等推理状态作为一级资源管理,推动SSD进入Token生成的实时主链路。文章还分析了群联、江波龙和寅谱-联芸三条推理参与型AI SSD技术路线,强调AI S
Hugging Face 每日论文发布了一篇关于 WorldClaw 的论文,该论文提出了一种用于大规模开放世界 3D 场景生成的智能体框架。WorldClaw 采用从粗到细的方法,通过规划智能体将文本提示转换为结构化规范,并生成全局连贯的地形、可编辑的资产和细节丰富的区域。该框架在保持全局地形结构一致性的同时,能够生成具有空间组织性和视觉吸引力的场景,并支