返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1731 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

7月8日周三 · 1 条
正文结构化主题已通过公开置信门槛
MLX Releases一手来源产品发布

MLX v0.32.0 发布:多项修复与平台支持增强

MLX 发布了 v0.32.0 版本,包含多项修复和改进,如 CUDA 内核修复、新增行列式函数、支持 Windows JIT 编译、默认启用 iOS Metal 后端等。这些更新提升了 MLX 在多种平台上的性能和稳定性。

7月7日周二 · 3 条
正文结构化主题已通过公开置信门槛
Berkeley AI Research Blog一手来源观点

智能近乎免费,数据系统如何为智能体重塑?

Berkeley AI Research Blog 发文指出,AI 推理成本大幅下降,GPT-4 级能力从每百万 token 约 30 美元降至不足 1 美元,部分低于 0.10 美元,年降幅中位数约 50 倍,预示近乎免费智能时代到来。文章提出数据系统需面向智能体(for agents)、由智能体构成(of agents)和由智能体合成(by agents

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布存储保留、多租户隔离及代理改进

Mastra 发布 2026 年 7 月 3 日更新,核心新增可选存储保留策略与 storage.prune() 批量清理功能,支持多租户隔离、持久化轨迹评分 API,并改进代理嵌套子代理和模型路由安全性。同时新增 Apple Container、Mesa 等沙箱提供商,并包含若干破坏性变更。

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.31.2 发布:支持旧 GPU 闪存注意力并修复多项问题

Ollama 发布 v0.31.2 版本,主要更新包括:在旧款 NVIDIA GPU(计算能力 6.x)上启用 flash attention,iGPU 可卸载视觉模型以适配内存,修复了思考模型禁用思考时的结构化输出问题,并强化了 GGUF 模型创建。此外, ollama launch 为 Claude Code 默认禁用遥测,修复了非 UTF-8 路径加载

7月6日周一 · 1 条
正文结构化主题已通过公开置信门槛
Import AI研究

Import AI 464:Fable编写GPU内核,AI自动化与模拟计算

Import AI 464期报道了Fable模型在KernelBench-Mega基准上编写GPU内核,实现18.71倍加速,创下最快megakernel记录,显示AI在自动化AI研发任务上的进步。同时,CAIS和Scale Labs的Remote Labor Index显示AI系统在在线自由职业任务上的成功率从2.5%升至16.1%,表明AI对经济就业的潜

7月1日周三 · 4 条
正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布心跳调度、文件式 agent 及记忆升级

Mastra 发布 2026 年 7 月 1 日更新,新增心跳 API 支持定时调度 agent,引入基于文件系统的 agent 定义与自动注册,增强人机协同的挂起运行发现,并升级观察记忆提取器。同时,InngestAgent 与 DurableAgent 功能对齐,并包含若干破坏性变更,如 Vercel 沙箱导出重命名。

正文结构化主题已通过公开置信门槛
Open WebUI Releases一手来源产品发布

Open WebUI v0.10.2 发布:新增流式推理显示与多项管理功能

Open WebUI 发布 v0.10.2 版本,新增流式推理显示、知识库文件夹上传、记忆系统上下文开关、语音转文字请求格式选项、API 配置环境变量、提供商失败事件、竞技场模型环境变量等多项功能。同时修复了安全漏洞、意外登出、网络搜索域名过滤、图片提示日志隐私、数据库升级崩溃、非管理员保存设置失败等问题。该版本包含安全修复,建议生产环境尽快升级。

正文结构化主题已通过公开置信门槛
One Useful Thing观点

聊天机器人的黄昏:AI工作模式加速变革

美国领先AI实验室的模型发布速度加快,能力提升呈超指数增长,如Opus 4.7可自主完成需数周的人类工作。中国开源模型虽落后6-12个月,但也在快速进步。AI使用方式正从聊天机器人转向智能体,OpenAI内部已有四分之一员工每周同时运行至少四个智能体,工作模式转向管理AI。

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.31.1 发布:Gemma 4 在 Apple Silicon 上提速近 90%

Ollama 发布 v0.31.1 版本,显著提升了 Gemma 4 在 Apple Silicon 上的运行速度,通过多 token 预测(MTP)技术,在编码代理基准测试中平均生成速度提升近 90%。该版本默认启用自动调优,无需配置,且不改变模型输出。此外,更新了 MLX 引擎和 llama.cpp 引擎,并改进了 Gemma 4 MoE 模型的加载性能

6月30日周二 · 2 条
正文结构化主题已通过公开置信门槛
Ray Releases一手来源产品发布

Ray 2.56.0 发布:增强数据稳定性与 LLM 服务性能

Ray 2.56.0 发布,重点提升 Ray Data 稳定性、Ray Serve LLM 性能和 Ray Core 的 GPU 域感知调度。新版本引入多数据集支持、自动批大小选择、逻辑内存配置,并重构了 LLM 服务路径,新增一致性哈希路由和容量队列路由。此外,支持 Kubernetes 原地 Pod 调整,增强集群弹性。

正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.24.0 发布:新增 MiniMax-M3 与 DiffusionGemma 支持

vLLM 发布 v0.24.0 版本,包含 571 个提交,来自 256 位贡献者。新增 MiniMax-M3、DiffusionGemma 等模型支持,并持续优化 DeepSeek-V4 的性能。Model Runner V2 默认支持量化模型,Rust 前端新增多项 API 功能。设备选择机制改为使用 device ids 参数,不再内部设置 CUDA

6月27日周六 · 1 条
正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.14 发布:新增多模型支持与 DeepSeek-V4 性能优化

SGLang v0.5.14 发布,新增对 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、DiffusionGemma 等模型的支持,并针对 DeepSeek-V4 在 NVIDIA GB300 上实现 5 倍吞吐提升。该版本还引入了 Waterfill 和 LPLB 两种 MoE 负载均衡方法,以及 KDA CuteDSL

6月26日周五 · 1 条
正文结构化主题已通过公开置信门槛
MCP Python SDK Releases一手来源产品发布

MCP Python SDK v2.0.0a3 发布:无状态协议与多轮工具调用支持

MCP Python SDK 发布 v2.0.0a3 预发布版本,该版本实现了 2026-07-28 规范修订中的无状态协议端到端协商,将协议类型拆分为独立的 mcp-types 包,并支持多轮工具调用。此外,还重构了 ServerMiddleware,增加了 OpenTelemetryMiddleware,并增强了 OAuth 客户端符合性。这些变化旨在提

6月25日周四 · 1 条
正文结构化主题已通过公开置信门槛
LlamaIndex Releases一手来源产品发布

LlamaIndex v0.14.23 发布:增强多模态合成与查询引擎

LlamaIndex 发布了 v0.14.23 版本,主要更新包括核心模块的多模态合成功能、多模态查询引擎、工具调用模拟 LLM,以及多项 bug 修复和性能优化。此外,多个嵌入适配器(如 Cohere、Google GenAI)和回调模块也进行了依赖更新和兼容性调整。

6月19日周五 · 1 条
正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 推出 AI 代理临时账户,实现免注册部署

Cloudflare 推出了面向 AI 代理的临时账户功能,允许代理无需注册即可通过 Wrangler CLI 的 --temporary 标志部署 Worker,部署有效期为 60 分钟,用户可在此期间认领账户。该功能旨在消除代理部署时的注册障碍,支持代理快速迭代和验证代码。Cloudflare 还计划通过与其他公司的合作进一步简化代理部署流程。

6月16日周二 · 2 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers 发布补丁 v5.12.1:修复 PEFT 下限与 Mistral 分词器

Hugging Face 发布了 Transformers 库的补丁版本 v5.12.1,主要更新了 PEFT 库的下限版本,并修复了自动分词器在安装 mistral-common 时无法正确解析 Mistral 分词器的问题。该版本与 v5.10.3 类似,但排除了主版本中已包含的修复,vLLM 将首先针对 5.10.3 版本。

正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers 补丁版 v5.10.4 发布,修复多项问题

Hugging Face 发布了 Transformers 库的补丁版本 v5.10.4,修复了多个问题,包括与 vLLM 的同步、ProcessorMixin 中的 token 处理、InternVL 模型、处理偏移、peft 下界以及 mistral 后端。该版本在 PyPI 上以 5.10.4 发布,跳过了 5.10.3。

6月11日周四 · 2 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers v5.11.0 发布:新增 DiffusionGemma 和 DeepSeek-V3.2 支持

Hugging Face Transformers 库发布 v5.11.0 版本,新增 DiffusionGemma 和 DeepSeek-V3.2 模型支持。DiffusionGemma 采用编码器-解码器架构和多画布采样,加速文本生成;DeepSeek-V3.2 引入 DeepSeek 稀疏注意力机制,提升长上下文训练和推理效率。此外,该版本扩展了 Ke

正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

DiffusionGemma:文本扩散模型实现4倍加速生成

Google DeepMind 发布了实验性开放模型 DiffusionGemma,采用文本扩散技术,可在 GPU 上实现高达 4 倍的文本生成加速。该 26B MoE 模型激活参数仅 3.8B,支持双向注意力,适合本地低并发推理场景,但输出质量低于标准 Gemma 4。模型权重以 Apache 2.0 许可在 Hugging Face 上提供,并支持 vL

6月6日周六 · 1 条
正文结构化主题已通过公开置信门槛
Ahead of AI研究

2026年上半年LLM研究论文精选清单

作者延续往年习惯,整理了2026年1月至5月期间值得关注的LLM研究论文清单,涵盖架构设计、推理效率、强化学习、智能体系统等多个类别。清单特别关注混合架构、状态空间模型、长上下文效率等趋势,并推荐了Nemotron 3等必读论文。作者强调这是个人精选而非完整列表,旨在帮助读者快速定位相关研究。