返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月7日周五 · 17 条
正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

多智能体LLM系统中推理时并行的两层视角

该论文提出了一种名为TIPEX的可控执行框架,用于统一多智能体LLM系统中的副本并行和结构并行两种推理时并行级别。实验表明,推理时并行能显著提高准确率并降低端到端延迟,但会增加令牌消耗。进一步分析发现,副本并行和结构并行在不同任务复杂度下具有互补效应,中等难度任务受益最大,而过度的并行策略并不一定带来更好的性能。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

ASGE-RR:面向动态 AI 代理调用的可修订预留服务图嵌入

arXiv 论文提出 ASGE-RR,一种用于动态 AI 代理调用的在线控制器,通过可修订预留机制保护未来调用所需资源。在 OpenHands 和 GPT Researcher 工作流上评估,相比其他控制器,ASGE-RR 在 WAN 测试平台上可完成多达 10% 更多的工作流价值。研究表明运行时揭示的工作流结构创造了新的网络控制机会。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

PPDL:将基于 LLM 的流程作为概率程序

arXiv 论文提出 PPDL,一种用于编程基于 LLM 流程的概率语言,使开发者能够量化并传播整个应用流程中的不确定性,并无需修改流程逻辑即可实验不同的推理扩展技术。实验研究展示了该能力,案例研究构建了一个用于 Rocq 定理证明器的代理。

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里视频大模型Wan3.0公测:文档PPT也能变视频

阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可将文档转化为视频。该模型在生成时长、全能参考、真实世界还原等方面升级,旨在从内容生成工具跃迁为生产力工具。Wan3.0已在多个平台开启公测,API价格按分辨率收费,接口近期全量开放。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.26.0 发布:新增工具隐藏与运行取消功能

PydanticAI 发布 v2.26.0 版本,新增了隐藏工具函数、首次运行取消、提示缓存保留解析等多项功能,并修复了多个 bug。该版本还支持 DeepSeek V4 Flash 模型,并改进了 OpenRouter 的流式推理细节处理。

正文结构化主题已通过公开置信门槛
量子位研究

AI SSD:大模型推理的存储范式转移

本文探讨了AI基础设施中存储角色的转变,指出大模型推理正从堆叠计算资源转向协同计算、网络、内存与存储的数据路径。月之暗面的Mooncake和NVIDIA的CMX分别从软件架构和硬件平台层面将KV Cache等推理状态作为一级资源管理,推动SSD进入Token生成的实时主链路。文章还分析了群联、江波龙和寅谱-联芸三条推理参与型AI SSD技术路线,强调AI S

正文结构化主题已通过公开置信门槛
量子位产品发布

PPIO发布Fusion融合模型:低成本超越顶级模型

PPIO于8月6日发布Fusion融合模型,通过智能模型网关将多个模型并行作答并融合,提升回答质量。在DRACO基准测试中,融合模型评分超越Claude Fable 5,成本仅为后者的十分之一。该技术旨在解决单模型偏科和幻觉问题,适用于Agent场景,并已实现日均Token调用量超1.2万亿。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10298 发布:新增 mtmd chunk 保存/加载功能

llama.cpp 发布 b10298 版本,主要新增 mtmd 的 chunk 保存/加载功能,并附带相关测试。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Optimum Intel v2.1.0 发布,新增多模型支持

Hugging Face 发布了 Optimum Intel v2.1.0,新增了对多个模型架构的导出和推理支持,包括 Google 的 Gemma 3n 和 Gemma 4 Unified、阿里巴巴的 Qwen3-Omni-MoE 和 Qwen3-VL-Embedding、SmolLM3 以及 Black Forest Labs 的 FLUX.2。该版本通

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS AgentCore 网关推出 AI 流量速率限制功能

AWS 宣布在 Amazon Bedrock AgentCore 网关上支持速率限制功能,允许用户按用户组(如 Basic、Advanced、Beta)对请求速率、令牌吞吐量和并发连接进行精细控制。该功能支持 MCP、推理和 HTTP 目标,并提供了维度键和条目结构来定义速率限制规则。此举旨在保护下游服务免受流量高峰影响,并支持基于 OAuth 或 IAM

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

ChatGPT 免费用户获无限文本聊天,新模型 Luna 上线

OpenAI 宣布取消 ChatGPT 所有用户文本聊天限制,并推出新模型 GPT-5.6 Luna 作为免费和 Go 用户的默认模型,取代 GPT-5.5。Plus 和 Pro 用户将获得升级版 GPT-5.6 Sol 模型,并新增思考滑块以调节推理强度。内部评估显示,新模型的事实错误率显著降低。

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Naïve 融资 2850 万美元,用 AI 代理自动化公司运营

Naïve 是一家提供基础设施让 AI 代理自动完成公司设立和运营的初创公司,已吸引超过 3 万名开发者客户,并在六个月内将年化收入增长 10 倍至数千万美元。该公司完成了由 Nexus Venture Partners 领投的 2850 万美元 A 轮融资,将用于开发模型路由、内存系统、编排器及无服务器运行时等基础设施,以降低代理运行成本。

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

OpenAI 为免费用户提供无限文本聊天,并升级模型

OpenAI 宣布,从下周开始,ChatGPT 的免费和 Go 层级用户将获得无限文本聊天,但包含文件上传和图片的消息仍有限制。同时,OpenAI 为免费和 Go 用户新增“思考”按钮,并将默认模型升级为 GPT-5.6 Luna。对于 Plus 和 Pro 订阅者,GPT-5.6 Sol 模型将更新,提高事实可靠性,并提供新的滑块控制回答的思考量。

另有 3 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER研究

Claude Code 速度最快但成本为最便宜对手近三倍

AI 工具公司 Composio 测试了 DeepSeek V4 Flash 在四个代理框架(Claude Code、Codex、OpenCode 和 Oh My Pi)上的表现,使用 Gmail、GitHub、Slack 和 Notion 等真实工具执行 30 项任务。结果显示,没有单一框架在所有类别中胜出:Oh My Pi 成功率最高(17/30)但速度

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

AWS 为 Bedrock 上的 Codex 提供 OpenTelemetry 与 CloudWatch 可见性方案

AWS 发布了一篇博客,介绍如何通过 OpenTelemetry 和 Amazon CloudWatch 为 Amazon Bedrock 上的 Codex 构建可见性。该方案在开发者本地运行 OTel 收集器,将 Codex 的遥测数据(如 API 请求、令牌使用量)发送到 CloudWatch,并生成仪表盘,帮助组织按用户、团队、部门等维度监控 Code

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

在 Amazon Bedrock 上通过单区域 Claude Code 实现数据驻留

AWS 机器学习博客发布文章,介绍如何在 Amazon Bedrock 上通过单区域 Claude Code 实现数据驻留。文章对比了两种路径:使用 Anthropic 的 Mantle 端点(支持七个区域)和经典 Bedrock Invoke API 配合应用推理配置文件(仅支持伦敦区域),并提供了 IAM 策略和 CloudTrail 验证方法。该方案帮

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

PDI Brew:基于 Amazon Bedrock 和 Lambda 的智能应用部署平台

AWS 博客介绍了 PDI Technologies 构建的 PDI Brew 平台,该平台允许非技术员工用自然语言描述需求,在数秒内获得一个多租户 Web 应用,并自动集成 SSO 和 AWS 资源。平台采用双代理架构:规划代理在 AI 助手中捕获意图并生成部署清单,供应代理在 AWS Lambda 中执行部署。所有应用通过受控网关访问 Amazon Be

8月6日周四 · 3 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax H3 发布 GGUF 量化版本,支持多模态视频生成

Hugging Face 上发布了 MiniMax H3 模型的 GGUF 量化版本(Abiray/MiniMax-H3-GGUF),该模型是 MiniMax 推出的全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该仓库提供了多种量化精度的 UNet 模型(FL2VA 和 Ref2VA 模

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Baseten 加入 Hugging Face 推理提供商,支持多款前沿模型

Hugging Face 宣布 Baseten 成为其推理提供商生态的新成员,用户可在 Hub 模型页面和 SDK 中直接使用 Baseten 托管的模型。Baseten 支持多种模型类型,初期提供对话和文本生成任务,包括 Kimi K3、DeepSeek V4 Flash 等。用户可通过自定义 API 密钥直接调用,或通过 Hugging Face 路由计

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

GPT-Live 底层拆解:OpenAI 如何将音频帧延迟降至旧系统 p50 水平

OpenAI 发布 GPT-Live 工程文章,详细披露新版 ChatGPT 语音系统的架构改造,包括多路实时传输网络、自定义 WARP 协议、模型实例迁移和双模型协作等。新系统将 p95 音频帧延迟降至旧系统 p50 水平,并将 WebRTC 通道启动从 6 次往返缩短至 1 次。文章指出实时性依赖系统调度而非单纯模型速度,并提示了持续推理成本等未公开数据