返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月12日周三 · 20 条
正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Mistral 推出欧盟数据处理和优先访问服务,但存在重要限制

Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10373 发布:优化 imatrix 专家检查

llama.cpp 发布 b10373 版本,主要更新为 imatrix.cpp 中的有限检查逻辑,仅检查被触及的专家。该版本提供了适用于 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

幂律图注意力:缩放点积注意力的精确推广与推理坍缩

Hugging Face 每日论文发布了一篇关于新型注意力机制的研究,提出 Power Law Graph Attention (PLGA),用学习到的幂律双线性算子替代固定缩放点积注意力 (SDPA),并构建了 PLDR-LLM 模型。论文通过定理和测量验证了 PLGA 在特定条件下包含 SDPA,并发现推理时存在输入不变性导致推理坍缩的现象。该研究还提供

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

FP8 KV-Cache 在 Intel Arc Pro B70 上实现 2 倍容量与长上下文吞吐增益

Hugging Face 博客评估了 Intel Arc Pro B70 上 FP8 KV-cache 量化在 vLLM 中的表现,显示相比 BF16,FP8 KV 在所有测试模型上实现了确定性 2 倍 KV 缓存容量提升,并在长上下文(16K-32K)场景下带来最高 42.3% 的吞吐量增益。FP8 KV 在 10 个模型中的 8 个上接近无损,但 Dee

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

解码级禁忌:大语言模型鲁棒性的诊断压力测试

Hugging Face 每日论文介绍了一项名为 Decoding-Level Taboo 的运行时 logit 空间压力测试,用于评估大语言模型在非标称生成路径上的鲁棒性。研究发现,模型的鲁棒性受参数规模和指令对齐影响,规模越大、对齐越好则鲁棒性越强。该测试还可用于生成合成数据集、测试安全护栏和审计模型可靠性。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

UniMoMo:基于专家合并的推荐系统MoE加速方法

UniMoMo 是一种针对大型推荐系统中混合专家(MoE)模型的训练后压缩框架,通过功能相似性分组和层自适应保护,将训练好的 MoE 模型压缩为更小的标准 MoE 检查点,在保持精度的同时加速推理。实验表明,在 Amazon Beauty、KuaiRec 和 TenRec 数据集上,将专家数从 8 压缩到 4 时,NDCG@10 保持 99.92%–102.

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

AMD收购Taalas:为特定模型定制芯片的‘拖拉机’策略

AMD宣布收购AI推理芯片公司Taalas,计划将其技术纳入加速器路线图。Taalas采用模型硬化路线,将模型权重固化进硬件,以降低推理成本和提高速度,首款芯片HC1运行Llama 3.1 8B时生成速度达1.7万Token/s。该路线面临模型迭代风险,但Taalas通过可编程SRAM和掩膜修改应对。业内专家认为,AMD此举如同购买拖拉机,其价值取决于是否存

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10369 发布:支持 pocket-tts 并优化性能

llama.cpp 发布 b10369 版本,主要更新是支持 pocket-tts 文本到语音模型。该实现将转置卷积重构为 GEMM 加 col2im,使 CUDA 上每帧生成时间降低 80%,CPU 上降低 50%,输出与参考实现高度一致。同时新增了语言包特定参数(如帧尾填充、短文本填充)和模型变体支持,并更新了文档。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

多语言量化税:边缘小型语言模型的结构性崩溃与类型脆弱性

本研究首次对4-bit量化在Gemma 4和Qwen 3.5等小型语言模型上的多语言性能损失进行了零样本评估,覆盖八种类型多样的语言。研究发现量化税在不同语言间极不平等,低资源和非拉丁文字语言出现结构性崩溃,而模型的基础语言(如英语、中文)也缺乏免疫性。多步逻辑推理受损严重,但联想记忆领域表现出量化抵抗性。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

CurveFP:用于语言模型的封闭乘积有理基数对数数据类型

CurveFP 是一种新的低精度数据类型家族,通过交错对数曲线和紧凑块缩放实现封闭乘积,使乘法变为精确的符号异或和整数索引更新。CurveFP8 用于训练,CurveFP7 用于部署,在多个 7B-9B 模型上以更少的位达到或超过 FP8 的困惑度,并在 128.3M 参数预训练中实现 FP8 级质量,同时降低格式引起的惩罚。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

LLM Agents Factory:领域特定 LLM 代理的检索框架

LLM Agents Factory 是一个基于检索的框架,利用超过 20K 个预定义代理配置文件,按需构建领域特定且基于 Wikipedia 的代理。该框架支持语义搜索检索和蒸馏两种模式,在 MMLU、BIG-bench 等基准测试中,其检索式代理构建在准确率上超越非代理基线,并以更低推理成本匹配 AutoGen 的生成质量。该研究将代理构建视为信息检索问

正文结构化主题已通过公开置信门槛
魔搭 ms-swift Releases一手来源产品发布

ms-swift v4.4.3 发布:修复多模型模板并新增训练特性

魔搭 ms-swift 发布 v4.4.3 补丁版本,包含多项 bug 修复和功能更新。主要修复了 Qwen3.5、Qwen3-TTS、Qwen3-Omni 等模型的模板和训练问题,新增了 packing strategy、GKD 多轮支持、RLSD 自蒸馏优势重加权等功能,并优化了 Megatron、NPU 等后端兼容性。该版本提升了框架的稳定性和训练效率

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10362 发布:修复 HIP 采样器测试并更新多平台构建

llama.cpp 发布 b10362 版本,主要修复了 HIP 后端采样器测试中因缺少 CUB 支持而导致的崩溃问题,并调整了 CI 日志存储方式。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog研究

研究者从专有LLM API中窃取推理痕迹

研究者发现Anthropic、OpenAI和Google的专有LLM API返回的加密推理链可被重放至同系列较弱模型,通过越狱恢复明文推理内容。该漏洞已被修复,但论文附录展示了提取的推理细节,揭示了专有模型的思维链。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持

NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

窃取专有LLM API的推理痕迹

研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 36

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源产品发布

Mistral推进AI主权:区域推理、开放模型与欧洲新基建

Mistral AI 宣布三项举措以推进AI主权:推出区域端点和优先服务层级,支持第三方开放模型(如Z.ai的GLM-5.2),并组建联盟确保欧洲长期AI算力,目标到2030年建设1GW容量。这些措施旨在让企业和国家控制模型、基础设施和算力,同时保持区域合规和可靠性。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

ALTK-Evolve 对比 ACE:按需检索降低推理成本并提升准确率

Hugging Face 博客介绍了 ALTK-Evolve 与 ACE 两种智能体记忆系统,均通过将智能体历史轨迹转化为可复用经验并在推理时注入,避免压缩经验。ALTK-Evolve 采用按需检索少量指南的方式,而 ACE 每步注入完整手册。在 AppWorld 基准上,ALTK-Evolve 在 DeepSeek-V3.2 上准确率更高且 token 消

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型

NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10361 修复 EXAONE 4.5 SWA 启用问题

llama.cpp 发布 b10361 版本,修复了 EXAONE 4.5 模型滑动窗口注意力(SWA)未启用的问题,该问题源于 hparams 加载顺序错误,导致 MTP 头模型被误判。同时修复了元数据加载路径中 TENSOR SKIP 张量处理问题,并添加了相关测试。该版本提供了多平台二进制下载。