返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月3日周一 · 20 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

B300价格飙升三倍,大厂绕开算力中转站,AI Infra高管离职

雷峰网报道称,B300整机价格半年内从400多万元涨至超1200万元,市场出现虚假现货套取企业数据的安全隐患。大厂因数据安全、并发性能、计费黑箱和封号风险等问题,普遍不愿使用算力中转站。国产AI芯片企业分别推进AFN架构和Prefill芯片研发,3D堆叠芯片成为投资风口但面临量产挑战。一家AI Infra公司三位核心高管离职,行业从拼卡转向拼运营。投资人认为

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

June 获 2000 万美元融资,用 AI 解决企业 AI 部署难题

前 Salesforce 高管 Efrat Rapoport 创立的初创公司 June 于周一正式亮相,旨在通过自动扫描企业现有系统、识别瓶颈并构建优化的 AI 代理流程,解决 AI 在企业部署中的难题。该公司已获得由 Marc Benioff 旗下 Time Ventures 领投的 2000 万美元种子前融资,其他投资者包括 Michael Dell、A

正文结构化主题已通过公开置信门槛
Groq Blog一手来源商业

Groq 获 7.5 亿美元融资,推理需求激增

Groq 于 2025 年 9 月 17 日宣布完成 7.5 亿美元融资,估值达 69 亿美元,由 Disruptive 领投,Blackrock、Neuberger Berman 等参投。资金将用于扩展其 AI 推理基础设施,支持全球开发者与企业。Groq 强调其在美国 AI 技术栈中的核心地位,并受益于白宫推动美国 AI 技术出口的行政命令。

正文结构化主题已通过公开置信门槛
Groq Blog一手来源商业

Groq 任命 Simon Edwards 为首席财务官以支持全球扩张

Groq 于 2025 年 9 月 22 日宣布任命 Simon Edwards 为首席财务官,以支持其全球扩张和日益增长的 AI 推理需求。Edwards 曾在 Conga、ServiceMax 和 GE 担任高级财务职务,拥有丰富的科技公司增长和转型经验。Groq 创始人兼 CEO Jonathan Ross 表示,Edwards 的财务纪律和增长能力将

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

面向黑暗环境的鲁棒3D感知RGB-NIR成像

本文提出了一种新的RGB-NIR低光成像方法,通过引入3D感知神经建模,在无需干净RGB监督的情况下,隐式融合极噪RGB观测与NIR线索,恢复干净RGB图像。该方法避免了干净RGB数据收集,并能泛化到不同噪声水平,在合成和真实数据上表现优越。代码已开源。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.3.0 发布:新增媒体预览与语义根 API

Langfuse 发布 v4.3.0 版本,包含多项功能改进和错误修复。新功能包括在预览界面显示媒体大小、在 v2 API 中暴露语义根,以及预览时自动以演示用户登录。修复了应用内代理草稿编辑、API 路由方法校验、评估元数据传播等问题,并调整了 GPT-5.6 系列模型的价格。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10238 发布,新增 Qwen3-Next MTP 支持

llama.cpp 发布 b10238 版本,主要新增对 Qwen3-Next 模型的多 token 预测(MTP)支持,并修复了相关 Python 类型检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Cohere Blog一手来源观点

Cohere 分析企业 AI 总拥有成本:隐藏成本与所有权策略

Cohere 发文指出,企业 AI 总拥有成本(TCO)正随使用量上升,token 定价仅是显性成本,隐藏成本包括推理、上下文、代理步骤等。Gartner 预测 2026 年全球 AI 支出达 2.52 万亿美元,IDC 调查显示 96% 的生成式 AI 部署成本超预期。Cohere 建议企业区分自有与租用 AI 基础设施,以控制成本并实现可预测的财务规划。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10237 发布:支持 DeepSeek V3.2 MTP

llama.cpp 发布 b10237 版本,新增对 DeepSeek V3.2 的多 token 预测(MTP)支持,并在模型类型发现时跳过 MTP 层。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-27B-Omnimerge-v4 发布 GGUF 量化版

ManniX-ITA 发布了 Qwen3.6-27B-Omnimerge-v4 的 GGUF 量化版本,基于 Qwen3.6 基础模型与三个微调模型的 DARE-TIES 合并,并采用 MLP-passthrough 技术以规避 Qwen3.6 的推理标签脆弱性。该模型在 HumanEval、MBPP 和 GPQA 基准上表现优于前代 Omnimerge-v

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

gemma-4-A4B-98e-v6-coder-it-GGUF:修复智能体循环的量化模型发布

ManniX-ITA 发布了 gemma-4-A4B-98e-v6-coder-it-GGUF,这是 Gemma 4 26B-A4B 的代码剪枝版本的 GGUF 量化系列。该版本修复了聊天模板中导致多轮智能体循环的 bug,将循环率从 33% 降至 0%,同时保持 HumanEval+ 92.07% 的性能。所有量化均使用 imatrix 校准,推荐使用 I

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

gemma-4-A4B-98e-v7-coderx-it GGUF 量化发布,性能超越 Qwen2.5-Coder-14B

ManniX-ITA 发布了 gemma-4-A4B-98e-v7-coderx-it 模型的 GGUF 量化版本,提供了多种量化等级,并附有详细的基准测试结果。该模型在 HumanEval+ 和 MultiPL-E-100 上表现优异,尤其在低比特量化下仍保持高代码生成能力。与 Qwen2.5-Coder-14B 相比,在相同磁盘空间下,该模型以更低的比特

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

Fast Gemma 挑战赛:vidraft-darwin 验证最快推理方案全解析

vidraft-darwin 团队在 Google Gemma 和 Hugging Face 举办的 Fast Gemma Challenge 中,通过软件优化在单张 NVIDIA A10G 上实现了 510.58 TPS 的推理速度,且 PPL 为 2.3930,通过了官方验证,成为已验证结果中最快的方案。他们公开了完整配置,包括滑动窗口、质心 top-k

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

Meta 财报暴露 AI 困境:现金流告急,被迫转向 ROI 叙事

Meta 发布 2026 年二季度财报,净利润暴跌 14%,自由现金流仅剩 7.84 亿美元,同时上调全年 AI 资本开支至 1350 亿-1450 亿美元,引发股价大跌。Meta 在 AI 上半场因 Llama 4 失败和产品融合不佳而落后,现正通过自研模型路由器、限制 Token 使用、筹建云业务等方式寻求 AI 变现。分析认为,AI 行业已从拼投入转向

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10236 发布:Metal 实现 DSv4 Lightning Indexer 并优化性能

llama.cpp 发布 b10236 版本,在 Metal 后端实现了 DeepSeek V4 的 Lightning Indexer 算子,支持 F16 键和多种量化缓存,并通过分阶段处理 K tiles 优化性能。基准测试显示,在长 KV 缓存下预填充速度显著提升(如 d30000 时从 33.40 提升至 49.18 t/s),同时提供了多平台二进制

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

TransX:通过行为与服务流交叉扩展基于 Transformer 的推荐系统

LinkedIn 的研究团队提出 TransX,一种生产导向的编码器-解码器推荐架构,将推荐重构为序列到序列的动作转导问题,显式解耦行为流建模与服务事件建模,并通过可扩展的交叉注意力连接近线行为编码和实时服务表示。TransX 采用摊销服务策略,结合增量行为编码和每请求键值缓存,使服务延迟对行为序列长度不敏感。在 LinkedIn 推荐系统上的大规模在线 A

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

拓扑感知数据传输:面向分离式GPU推理的优化方案

本文提出了一种面向分离式GPU推理的拓扑感知数据传输方案,解决预填充和解码分离时KV缓存传输的网络瓶颈问题。该方案通过流水线分层传输、NVLink域感知放置和CXL 3.0内存扩展器三种机制,相比统一RDMA可降低3至18倍传输延迟。目前仅提供分析模型和组件实现,尚需多节点异构集群和CXL 3.0硬件进行完整评估。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

CyberNeuro:面向队列级神经影像与临床数据隐私保护智能体工作台

arXiv 论文介绍了 CyberNeuro,一个用于大规模神经影像和临床数据分析的隐私保护智能体工作台。它通过四个专用智能体(Planner、Validator、Dispatcher、Reporter)和本地 LLM 模型 WandaMind,支持自然语言执行复杂工作流,同时保持临床级数据隐私。在 NeuroBench 基准上,CyberNeuro 将保留

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

OpenClaw与Ollama在Agentic AI中的应用:迈向全自主可扩展的AI代理系统

该论文提出了一种用于Agentic AI的分层架构,将推理、编排和执行层分离,并以OpenClaw和Ollama作为全栈系统进行验证。实验表明,持久记忆、工具使用和自适应决策等能力源于系统级集成,而非单一模型。研究还讨论了可扩展性、安全性和治理等挑战,并公开了所有模型、代码和数据集。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

TransMem:将隐藏状态转化为大语言模型的记忆

TransMem 是一种轻量级推理时参数记忆模块,可将冻结的大语言模型(LLM)的稀疏历史隐藏状态转换为可复用的记忆表示,通过门控网络动态干预当前隐藏状态,无需重复编码先前上下文。实验表明,TransMem 在 LoCoMo、HotpotQA 和 MemoryAgentBench 上均取得显著性能提升,验证了稀疏历史隐藏状态作为长上下文 LLM 智能体有效记