返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月29日周六 · 5 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10676 修复多批次卷积转置问题

llama.cpp 发布 b10676 版本,修复了 conv transpose 2d 在 CPU 和 Metal 后端中多批次处理的问题,确保所有批次正确计算。该修复解决了多批次输出为零的 bug,并增加了测试用例。

正文结构化主题已通过公开置信门槛
智东西商业

曝Anthropic放弃70亿美元收购MatX,转合作并招揽芯片人才

据路透社报道,Anthropic曾商讨以约70亿美元收购AI芯片初创企业MatX,但最终放弃收购,转为合作关系磋商。Anthropic正扩大内部芯片团队,招募多位业界大牛,以加速定制硬件研发,降低对英伟达芯片的依赖,并计划在2028年实现2000亿美元营收,目标估值达2万亿美元。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA TensorRT Model Connect:两命令部署开放模型

NVIDIA 发布了 TensorRT Model Connect,这是一个开源参考实现集合,旨在简化开放模型在 TensorRT 上的部署。用户可以通过两条命令将 Hugging Face 模型转换为原生 C++ 推理应用,无需深入编译器知识。该项目提供语义级和模块级 API,支持自定义 GPU 内核集成,并利用 AI 原生开发流程和夜间发布保持与开放模型

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源商业

迪卡侬如何利用Chronos-2在AWS上实现大规模需求预测

迪卡侬在AWS上使用Chronos-2进行大规模需求预测,以支持其全球供应链运营。通过严格的基准测试,Chronos-2在零样本和微调配置下均优于其他时间序列基础模型,且微调后误差进一步降低。该解决方案降低了运营复杂性,提高了预测准确性,并计划扩展到更多地区。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Salesforce 利用 SageMaker 推理组件实现多可用区高可用

Salesforce 在构建 Agentforce 时,面临 Amazon SageMaker AI 推理组件(IC)默认放置策略无法满足多可用区(Multi-AZ)高可用合规要求的问题。AWS 通过新增 SchedulingConfig 参数(含 AvailabilityZoneBalance 和 PlacementStrategy)实现了 IC 副本跨

8月28日周五 · 15 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10675 发布:Vulkan 后端优化 MoE 推理

llama.cpp 发布 b10675 版本,主要更新为 Vulkan 后端新增对 shader 中行 ID 和专家计数的提升支持,优化了 MoE 模型的推理性能。该版本提供了多平台预编译二进制,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

现代LLM中的Engram:条件记忆的嵌入新方法

Hugging Face 博客文章解释了现代LLM中的“engram”概念,即通过哈希多个token序列来创建额外嵌入,以缓解感知机学习局部序列信息的负担。文章指出engram本质上是嵌入,但通过哈希n-gram序列实现条件记忆,并讨论了哈希冲突、置信门控等技术细节。该方法由DeepSeek和美团等提出,旨在提升模型对常见序列的记忆能力,同时保留注意力机制处

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10673 发布:新增 Apple M4 调优支持

llama.cpp 发布 b10673 版本,为 Apple M4 芯片添加了 fa-vec 调优记录,支持 F16、Q4 0、Q4 1、Q5 0、Q5 1 和 Q8 0 等量化格式,以优化 M4 上的推理性能。该版本同时提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CU

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10672 发布:OpenVINO 更新与 NPU 支持增强

llama.cpp 发布 b10672 版本,主要更新 OpenVINO 后端至 2026.3.1,新增对 whisper.cpp 的支持,并优化 Qwen3.5 在 NPU 上的运行。该版本还引入了新的算子支持(如 RELU、POOL 2D 等),并修复了静态形状和分块预填充等问题。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.24.0 发布:修复 AI 提供商配置与计费问题

Langfuse 发布 v4.24.0 版本,主要修复了 AI 功能中默认提供商的配置问题,现在必须显式设置 LANGFUSE AI PROVIDER 而非默认使用 Bedrock。同时修复了计费系统中 Stripe webhook 组织查找失败的日志级别问题,并清理了 Web 端的 UI 渲染和注释抽屉组件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10670 发布:BMG 架构启用 TILE 量化 KV 解码

llama.cpp 发布 b10670 版本,主要更新为在 Intel Xe2 (BMG) 架构上使用 TILE 指令集进行量化 KV 解码,其他架构仍使用 VEC。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 和 SYCL。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10668 发布:新增 M3 Max/M5/M5 Pro Metal 调优

llama.cpp 发布 b10668 版本,主要新增了对 Apple M3 Max、M5 和 M5 Pro 芯片的 Metal 后端 fa-vec 调优记录,以提升这些 GPU 上的推理性能。该调优由社区贡献,并借助 Qwen3.8-27B 模型辅助生成。同时发布了适用于多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10667 发布:新增 M4 Pro 支持

llama.cpp 发布 b10667 版本,为 Apple M4 Pro 芯片添加了 fa-vec 调优支持,提升了 Metal 后端性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 1.63.0 发布:增强日志追踪关联与部署就绪性

Mastra 发布 1.63.0 版本,引入新的日志适配器契约,实现 trace 关联日志,并集成 Pino,改善日志与追踪的链接可靠性。部署器新增 worker 健康检查端点,调度器和恢复机制得到增强,修复了多个问题。同时包含破坏性变更,清理了 playground-ui 的 DataList API。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

Agent点燃CPU市场,五年混战开启

英伟达GTC上黄仁勋展示独立CPU机柜,引发中国投资人重新关注CPU市场。Agent推理需求推动CPU需求与价格上升,未来五年被视为国内CPU公司关键窗口期。Arm路线公司率先受益,RISC-V面临生态挑战,x86、Arm、RISC-V三路线竞争加剧,最终比拼系统能力。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Meta 发布自研推荐训练芯片 MTIA 300,集成网络通信

Meta 发布了其首款用于训练排序和推荐模型的自研加速器 MTIA 300,该芯片将网络和集合通信直接集成到芯片中,以解决推荐模型训练中通信开销大的问题。MTIA 300 包含两个网络 chiplet,提供 1.2 TB/s 的总 I/O 带宽,并配备 16 个专用消息引擎,使通信与计算并行,性能损耗低于 0.5%。Meta 还扩展了与博通的合作,计划未来两

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

Jalapeño 跑分炸场,GPU 推理路线开始分裂?

OpenAI 公布自研推理芯片 Jalapeño 的跑分数据,显示其在 Token 吞吐、延迟和能效上较现有方案有显著提升,引发与 NVIDIA Rubin 的对比讨论。同时,NVIDIA 将 Groq 3 LPU 引入推理系统,Google 推出训练和推理分离的 TPU 8t/8i,三家公司在推理硬件路线上出现分化。文章分析指出,推理负载中 Decode

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

Sora 为何输给 Codex:算力调度与工作负载架构的差异

OpenAI CEO 奥特曼在播客中表示,Sora 因算力消耗巨大而优先级低于 Codex,资源向后者倾斜。文章分析认为,Sora 的算力集中在连续的视频生成路径中,难以复用,而 Codex 的 Agent 工作流可将算力碎片化,通过缓存、批处理和调度优化提高 GPU 利用率。这种架构差异导致两者扩张速度不同。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10666:跨架构状态保存测试与修复

llama.cpp 发布 b10666 版本,主要改进了测试基础设施,新增 test-save-load-state 的 --models 模式,可跨所有架构运行完整的保存/加载测试套件。修复了多个架构的测试问题,包括 deepseek4、gemma2、gpt-oss、lfm2、minimax-01 等,并优化了 on-device seq-copy 的 c

正文结构化主题已通过公开置信门槛
量子位商业

2026奇点智能技术大会北京站官宣,Transformer联合作者领衔

2026奇点智能技术大会北京站将于11月20-21日举行,由奇点智能研究院与CSDN联合主办。大会汇聚70余位技术专家,围绕18个前沿主题,涵盖大模型、AI原生软件研发、C++及系统软件等方向。OpenAI资深研究科学家、Transformer联合作者Łukasz Kaiser已确认发表主题演讲。