多智能体LLM系统中推理时并行的两层视角
该论文提出了一种名为TIPEX的可控执行框架,用于统一多智能体LLM系统中的副本并行和结构并行两种推理时并行级别。实验表明,推理时并行能显著提高准确率并降低端到端延迟,但会增加令牌消耗。进一步分析发现,副本并行和结构并行在不同任务复杂度下具有互补效应,中等难度任务受益最大,而过度的并行策略并不一定带来更好的性能。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文提出了一种名为TIPEX的可控执行框架,用于统一多智能体LLM系统中的副本并行和结构并行两种推理时并行级别。实验表明,推理时并行能显著提高准确率并降低端到端延迟,但会增加令牌消耗。进一步分析发现,副本并行和结构并行在不同任务复杂度下具有互补效应,中等难度任务受益最大,而过度的并行策略并不一定带来更好的性能。
arXiv 论文提出 ASGE-RR,一种用于动态 AI 代理调用的在线控制器,通过可修订预留机制保护未来调用所需资源。在 OpenHands 和 GPT Researcher 工作流上评估,相比其他控制器,ASGE-RR 在 WAN 测试平台上可完成多达 10% 更多的工作流价值。研究表明运行时揭示的工作流结构创造了新的网络控制机会。
arXiv 论文提出 PPDL,一种用于编程基于 LLM 流程的概率语言,使开发者能够量化并传播整个应用流程中的不确定性,并无需修改流程逻辑即可实验不同的推理扩展技术。实验研究展示了该能力,案例研究构建了一个用于 Rocq 定理证明器的代理。
阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可将文档转化为视频。该模型在生成时长、全能参考、真实世界还原等方面升级,旨在从内容生成工具跃迁为生产力工具。Wan3.0已在多个平台开启公测,API价格按分辨率收费,接口近期全量开放。
PydanticAI 发布 v2.26.0 版本,新增了隐藏工具函数、首次运行取消、提示缓存保留解析等多项功能,并修复了多个 bug。该版本还支持 DeepSeek V4 Flash 模型,并改进了 OpenRouter 的流式推理细节处理。
本文探讨了AI基础设施中存储角色的转变,指出大模型推理正从堆叠计算资源转向协同计算、网络、内存与存储的数据路径。月之暗面的Mooncake和NVIDIA的CMX分别从软件架构和硬件平台层面将KV Cache等推理状态作为一级资源管理,推动SSD进入Token生成的实时主链路。文章还分析了群联、江波龙和寅谱-联芸三条推理参与型AI SSD技术路线,强调AI S
PPIO于8月6日发布Fusion融合模型,通过智能模型网关将多个模型并行作答并融合,提升回答质量。在DRACO基准测试中,融合模型评分超越Claude Fable 5,成本仅为后者的十分之一。该技术旨在解决单模型偏科和幻觉问题,适用于Agent场景,并已实现日均Token调用量超1.2万亿。
llama.cpp 发布 b10298 版本,主要新增 mtmd 的 chunk 保存/加载功能,并附带相关测试。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持多种硬件加速后端。
Hugging Face 发布了 Optimum Intel v2.1.0,新增了对多个模型架构的导出和推理支持,包括 Google 的 Gemma 3n 和 Gemma 4 Unified、阿里巴巴的 Qwen3-Omni-MoE 和 Qwen3-VL-Embedding、SmolLM3 以及 Black Forest Labs 的 FLUX.2。该版本通
AWS 宣布在 Amazon Bedrock AgentCore 网关上支持速率限制功能,允许用户按用户组(如 Basic、Advanced、Beta)对请求速率、令牌吞吐量和并发连接进行精细控制。该功能支持 MCP、推理和 HTTP 目标,并提供了维度键和条目结构来定义速率限制规则。此举旨在保护下游服务免受流量高峰影响,并支持基于 OAuth 或 IAM
OpenAI 宣布取消 ChatGPT 所有用户文本聊天限制,并推出新模型 GPT-5.6 Luna 作为免费和 Go 用户的默认模型,取代 GPT-5.5。Plus 和 Pro 用户将获得升级版 GPT-5.6 Sol 模型,并新增思考滑块以调节推理强度。内部评估显示,新模型的事实错误率显著降低。
另有 2 家信源报道
Naïve 是一家提供基础设施让 AI 代理自动完成公司设立和运营的初创公司,已吸引超过 3 万名开发者客户,并在六个月内将年化收入增长 10 倍至数千万美元。该公司完成了由 Nexus Venture Partners 领投的 2850 万美元 A 轮融资,将用于开发模型路由、内存系统、编排器及无服务器运行时等基础设施,以降低代理运行成本。
OpenAI 宣布,从下周开始,ChatGPT 的免费和 Go 层级用户将获得无限文本聊天,但包含文件上传和图片的消息仍有限制。同时,OpenAI 为免费和 Go 用户新增“思考”按钮,并将默认模型升级为 GPT-5.6 Luna。对于 Plus 和 Pro 订阅者,GPT-5.6 Sol 模型将更新,提高事实可靠性,并提供新的滑块控制回答的思考量。
另有 3 家信源报道
AI 工具公司 Composio 测试了 DeepSeek V4 Flash 在四个代理框架(Claude Code、Codex、OpenCode 和 Oh My Pi)上的表现,使用 Gmail、GitHub、Slack 和 Notion 等真实工具执行 30 项任务。结果显示,没有单一框架在所有类别中胜出:Oh My Pi 成功率最高(17/30)但速度
AWS 发布了一篇博客,介绍如何通过 OpenTelemetry 和 Amazon CloudWatch 为 Amazon Bedrock 上的 Codex 构建可见性。该方案在开发者本地运行 OTel 收集器,将 Codex 的遥测数据(如 API 请求、令牌使用量)发送到 CloudWatch,并生成仪表盘,帮助组织按用户、团队、部门等维度监控 Code
AWS 机器学习博客发布文章,介绍如何在 Amazon Bedrock 上通过单区域 Claude Code 实现数据驻留。文章对比了两种路径:使用 Anthropic 的 Mantle 端点(支持七个区域)和经典 Bedrock Invoke API 配合应用推理配置文件(仅支持伦敦区域),并提供了 IAM 策略和 CloudTrail 验证方法。该方案帮
AWS 博客介绍了 PDI Technologies 构建的 PDI Brew 平台,该平台允许非技术员工用自然语言描述需求,在数秒内获得一个多租户 Web 应用,并自动集成 SSO 和 AWS 资源。平台采用双代理架构:规划代理在 AI 助手中捕获意图并生成部署清单,供应代理在 AWS Lambda 中执行部署。所有应用通过受控网关访问 Amazon Be
Hugging Face 上发布了 MiniMax H3 模型的 GGUF 量化版本(Abiray/MiniMax-H3-GGUF),该模型是 MiniMax 推出的全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该仓库提供了多种量化精度的 UNet 模型(FL2VA 和 Ref2VA 模
Hugging Face 宣布 Baseten 成为其推理提供商生态的新成员,用户可在 Hub 模型页面和 SDK 中直接使用 Baseten 托管的模型。Baseten 支持多种模型类型,初期提供对话和文本生成任务,包括 Kimi K3、DeepSeek V4 Flash 等。用户可通过自定义 API 密钥直接调用,或通过 Hugging Face 路由计
OpenAI 发布 GPT-Live 工程文章,详细披露新版 ChatGPT 语音系统的架构改造,包括多路实时传输网络、自定义 WARP 协议、模型实例迁移和双模型协作等。新系统将 p95 音频帧延迟降至旧系统 p50 水平,并将 WebRTC 通道启动从 6 次往返缩短至 1 次。文章指出实时性依赖系统调度而非单纯模型速度,并提示了持续推理成本等未公开数据