返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月13日周四 · 13 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10400 发布:修复 ARM 构建问题

llama.cpp 发布 b10400 版本,主要修复了 ARM 构建问题及未使用变量警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 等。部分平台构建(如 macOS KleidiAI、Ubuntu ROCm、openEule

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

视觉工具使用的幻觉:对图像思维模式的因果审计

该研究对多模态大语言模型的视觉工具使用进行了因果审计,发现尽管聚合准确率有所提升,但返回的视觉证据往往对答案没有因果影响,或调用计划不连贯。研究提出了视觉证据增益等干预指标,并在六个模型和五个基准上揭示了两种失败模式,将这种不一致称为视觉工具使用的幻觉。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

预训练语言模型循环深度改造:安装、外推、迁移与保留

该研究将预训练语言模型 Qwen2.5-0.5B-Instruct 改造为循环深度架构,通过权重共享的循环块和可训练桥接层实现迭代潜在计算。在两种参数预算(6M 适配器和 180M 全块)下,模型在 ARC 基准上表现不逊于基线,并能外推至监督深度的 1.5 倍。与同规模自回归模型相比,循环模型在深度推理上准确率更高(84% vs 72%),速度更快,且保留

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

测试时强到弱能力迁移:通过脚手架实现

本文研究了一种名为“强到弱脚手架”的测试时能力迁移方法,即由更强的构建模型为较弱的目标模型构建推理时脚手架,在不更新参数的情况下提升其任务表现。在四个心智理论基准测试中,该方法将目标模型的平均性能从0.49提升至0.91,主要归功于将不稳定的模型推理卸载到确定性代码、基准特定路由和严格答案格式执行。研究还发现,构建模型的推理努力与脚手架质量单调相关,且较弱的

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

mradermacher 发布 Qwen3-Next 80B 模型多量化 GGUF 版本

mradermacher 发布了 Qwen3-Next-80B-A3B-Thinking-GRPO-Uncensored 模型的 GGUF 量化版本,基于 puwaer 的原始模型,提供多种 i1 和 imatrix 量化格式,文件大小从 16.3GB 到 55.1GB 不等。该模型支持中英日多语言,采用 CC-BY-NC-SA-4.0 许可,旨在为本地部署

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

CoinRAG:通过上下文信息片段 KV 缓存复用优化长上下文 RAG

CoinRAG 是一种针对长上下文检索增强生成(RAG)的优化方法,通过复用细粒度的语义片段缓存而非完整块,在低预填充延迟约束下提升效率与准确性。在 LongBench 多跳问答任务上,CoinRAG 平均相对提升 F1 分数 5.3%,并实现了新的帕累托前沿。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

DeepSeek V4 Pro 0813 发布,仅限 API 访问

DeepSeek 发布了 V4 Pro 0813 模型,目前仅通过 API 提供,OpenRouter 已上线。作者推测其开放权重可能发布,因为前代模型均有权重。该模型在不同推理级别下生成的鹈鹕图像差异显著,且基准测试结果通过非官方渠道传播。

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.32.10 发布:默认重复惩罚调整与性能优化

Ollama 发布 v0.32.10 版本,主要更改包括:未设置 repeat penalty 的模型默认值从 1.1 改为 1.0(关闭),以匹配其他引擎并加速推测解码;NVFP4 MLX 模型全局缩放使预填充速度提升约 7-8%;修复了 OCI 清单配置和层共享摘要时 blob 验证被跳过的问题。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Grok 4.6 性能追平 GPT-5.6,价格大幅低于对手

SpaceXAI 发布了新模型 Grok 4.6,在 Artificial Analysis Intelligence Index 上得分 61,与 OpenAI 的 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude Opus 5 和 Claude Fable 5。该模型在代理任务上表现优异,在 GDPval-AA v2 基准上排名

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA 在 GB300 NVL72 上支持 Qwen3.8-2.4T-A95B 模型部署

阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数达 2.4T,每个 token 激活 95B 参数,采用细粒度 MoE 架构和全注意力与线性注意力混合设计,支持百万 token 上下文。NVIDIA 宣布该模型可在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4K tokens

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 多模型性能降级已解决

Anthropic 报告了多个模型出现性能降级问题,主要影响 Claude Fable 5,导致请求错误率上升。团队已识别并正在解决该问题,目前事件已解决。受影响的服务包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。

正文结构化主题已通过公开置信门槛
THE DECODER研究

研究人员实现从LLM输出文本近乎完美地逆向工程提示词

IIT Bombay和Adobe Research的研究人员开发了一种名为“Previous-Token Prediction”(PTP)的方法,能够仅根据LLM的输出文本以近乎完美的准确率重建原始提示词,无需访问模型权重,甚至适用于第三方模型。该方法通过训练一个逆语言模型来预测前一个token,并能在不知道具体模型的情况下提取提示词,这可能导致专有系统提示

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA AI 工厂全栈可观测性选型指南

NVIDIA 技术博客发布了一篇关于 AI 工厂全栈可观测性选型的指南,针对 AI 基础设施多层架构中故障定位难的问题,提出了一个基于 NVIDIA DGX 部署的决策框架。文章通过分布式训练中 InfiniBand 链路静默故障的案例,说明了全栈可观测性的重要性,并给出了组件到遥测工具的映射表,帮助运维团队选择最小工具集并构建分诊仪表板。

8月12日周三 · 7 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.10.0 发布:增强代理功能与多项修复

Langfuse 发布 v4.10.0 版本,新增多项功能,包括允许用户在应用内代理运行时开始新对话或切换对话、跟踪认证后端活动、添加 Cursor Cloud 环境、集成指标 API 以及提升观测负载上限至 20k。同时修复了多个问题,如公共评论创建时的 authorUserId 验证、SCIM 用户配置中的密码属性忽略、Docker socket 可达性

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

OneAdvanced 在 AWS 上部署 50 多个 AI 代理实现英国数据主权

OneAdvanced 是一家英国企业软件提供商,在 AWS 上部署了超过 50 个 AI 代理,使用 Llama 4 Maverick 和 Llama Guard 4 模型,通过自托管方式满足英国数据主权要求。该解决方案基于 Amazon SageMaker AI、vLLM、RAG 管道和 Strands Agents SDK,支持医疗、法律等受监管行业。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出 SageMaker HyperPod 分层 KV 缓存,提升 LLM 推理性能

AWS 在 SageMaker HyperPod 上推出分层 KV 缓存架构,结合 Curvine 分布式缓存文件系统,将 KV 缓存从 GPU 扩展到 CPU 和共享 NVMe 池,实现跨副本缓存复用。测试显示,该方案可将跨 Pod 缓存命中率提升至 100%,TTFT 改善最高达 2.7 倍,并允许在更低成本的 G6e 实例上运行原本需要 P5 实例的工

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10375 发布:优化 Qwen 模型解析

llama.cpp 发布 b10375 版本,主要更新为收紧 Qwen 模型的 bare function 解析逻辑。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
量子位研究

紫东太初推出GMC剪枝法:减80%Token仍保多模态能力

中国科学院自动化研究所紫东太初大模型团队提出核心集剪枝方法GMC,通过互补证据自适应筛选与群体互补信息传输双阶段架构,在免训练、无额外依赖的情况下压缩视觉Token。实验表明,在Qwen2.5-VL-7B上减少80% Token仍保留97.78%能力,在LLaVA-1.5-7B上性能几乎无损,并减少KV Cache占用,提升推理速度。该方法可兼容主流视觉语言

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

InSight-doc:面向长文档理解的智能视觉感知框架

InSight-doc 是一种用于长文档理解的智能视觉感知框架,将视觉分辨率视为可自适应调整的推理时资源。它从低分辨率开始,无需外部检索器即可选择性放大高分辨率区域以获取更精细的证据。通过包含17.9K SFT示例和19.2K硬RL示例的训练,InSight-doc-8B在文档VQA基准上提升了4.3-16.4个准确率点,在长文档上将幻觉减少超过40%,推理