返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月14日周五 · 7 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

潜在动力学推理实现视频世界模型的外推泛化

Latent Dynamics Reasoning (LDR) 将运动学动力学集成到结构化潜在空间中,使视频世界模型能够远超训练分布地外推物理规律,同时参数减少26倍、推理速度快143倍。在PhyWorld基准的五个任务上,LDR的分布内外误差差距比视频扩散基线小20倍以上,并能泛化到严重分布偏移场景。这是首个能外推学习动力学至训练分布之外的视频世界模型。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10414 发布:Metal 后端支持 TQ2 0 类型

llama.cpp 发布 b10414 版本,为 Metal 后端新增 TQ2 0 类型支持,该类型为三元 2 比特每元素,并优化了 mul mv 内核。同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10413 发布:自动检测草稿模型 spec 类型

llama.cpp 发布 b10413 版本,主要更新为自动检测草稿模型的 spec 类型。当使用 -md 加载本地草稿模型且未指定 --spec-type 时,系统会从 GGUF 元数据中读取架构信息,自动识别 draft-dspark 或 draft-dflash 类型,从而启用投机解码。该功能已移至 speculative 模块,并增加了日志输出。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10412 发布:支持 dflash/dspark 后端采样

llama.cpp 发布 b10412 版本,主要更新是启用了 dflash 和 dspark 的后端采样功能,并增加了 p min 0 的采样支持。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,但部分构建(如 KleidiAI、ROCm)被禁用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10411 发布:优化 flash-attention V-cache 转换

llama.cpp 发布 b10411 版本,主要更新为在 ggml-cpu/ops 中向量化 flash-attention V-cache 的 F16 到 F32 转换,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。部分平台构建

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 修复 Claude 5 系列模型错误率升高问题

Anthropic 报告其 Claude Mythos 5、Claude Fable 5 和 Claude Sonnet 5 模型出现错误率升高的问题,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前该问题已解决。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出 AgentCore Observability 跨平台 AI 代理监控方案

AWS 发布了 AgentCore Observability 的跨平台监控方案,支持通过 ADOT 自动埋点将非 AWS 环境(如本地、GCP、Azure)中运行的 AI 代理的遥测数据发送到 Amazon CloudWatch 和 AgentCore Observability 仪表板。该方案利用 IAM 认证和 OTLP 端点,实现代理推理链、工具调用

8月13日周四 · 13 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10410 发布:SYCL 后端 FP16 自动提升优化

llama.cpp 发布 b10410 版本,主要更新为在 SYCL 后端的非 oneDNN 路径中移除单独的 FP32 类型提升,改用自动 FP16 提升。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10408 发布:新增 SYCL ESIMD Q3 K 内核

llama.cpp 发布 b10408 版本,主要新增了 SYCL 后端下的 DMMV Q3 K ESIMD 内核,并重构了 ESIMD 内核以共享代码,默认启用 ESIMD(若可用)。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种二进制包,但部分构建(如 macOS KleidiAI、ROCm 等)被禁用。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Red Hat 发布 Qwen3.6-35B-A3B-FP8 量化模型

Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Red Hat 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版本

Red Hat 发布了基于 Qwen3.6-35B-A3B 的 NVFP4 量化版本模型 RedHatAI/Qwen3.6-35B-A3B-NVFP4,权重和激活均量化为 NVFP4 格式,使用 llm-compressor 工具生成。该模型针对推理和工具调用优化,支持 vLLM 部署,并在多个基准测试中保持了接近原始模型的性能,如 GSM8K 和 GPQA

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Red Hat 发布 Gemma 4 12B NVFP4 量化模型

Red Hat 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,权重和激活均量化为 4 位浮点格式,使用 vLLM 的 llm-compressor 工具和 GPTQ 方法。该模型在 GSM8K 和 Wikitext 基准上进行了评估,性能接近 BF16 基线,并已在 RHOAI 3.5 和 vLLM 0.24.0 上验证

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Red Hat 发布 gemma-4-12B-it FP8 动态量化模型

Red Hat 发布了基于 Google gemma-4-12B-it 的 FP8 动态量化版本,使用 vLLM 的 llm-compressor 工具对权重和激活进行量化,并提供了完整的量化脚本和评估方法。该模型已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24.0 上验证,旨在提升推理效率。

正文结构化主题已通过公开置信门槛
量子位商业

Acrab获4.8亿美元融资,端侧AI芯片GΞLIX 1量产在即

新加坡AI芯片公司Acrab完成1.3亿美元B轮融资,累计融资超4.8亿美元,用于扩大产能和研发下一代平台。该公司成立不到三年,首颗端侧AI芯片GΞLIX 1已进入量产准备,并推出个人AI中心Agent Box,瞄准端侧Agent计算需求。Acrab强调CPU与NPU协同、统一内存和Prefill性能,其自测显示在特定条件下Prefill速度达1416 To

正文结构化主题已通过公开置信门槛
量子位模型发布

Grok 4.6发布:性能反超对手,价格更低,Grok Bot同步上线

SpaceXAI发布Grok 4.6模型,在多项基准测试中超越GPT-5.6 Sol和Fable 5 Max,且价格更低。同时推出Grok Bot智能体产品,可自主操作工具并24小时运行。这些产品整合了Cursor的技术和SpaceXAI的算力,标志着马斯克在AI领域的战略布局。

正文结构化主题已通过公开置信门槛
THE DECODER商业

Fable 5 采用缓慢,企业前沿 AI 付费意愿或触顶

Anthropic 的最强模型 Fable 5 上市首月仅占其 API 代币销售量的 6%,收入占比 11.4%,远低于 OpenAI 的 GPT-5.6 Sol(代币占比 25%,收入占比 23%)。Ramp 经济学家认为,Fable 5 的高定价(每百万输入/输出 token 分别为 10 美元和 50 美元)触及了企业 AI 支出的天花板,性能提升难以

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Ready Cohorts:界定LLM智能体控制中的GPU机会与避免主机往返

该论文研究LLM智能体服务中的GPU控制门控问题,通过两个研究定义了可测量的GPU控制门:截止期限可行的队列供应和观测放置。研究分析了并发队列调度和端上路由与主机重新调度的对比,发现设备驻留路径在36种配置中全部更快,速度提升1.19倍至2.39倍。论文还提出了固定分区份额、精确离线份额等指标,并通过动态规划精确计算离线份额。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论开源

Qwen3.8开源首日适配9款芯片,智源FlagOS助力存量算力

阿里巴巴开源了超大规模MoE模型Qwen3.8-2.4T-A95B,智源FlagOS社区在发布首日即完成了该模型在9款AI芯片上的适配,包括平头哥、英伟达、华为昇腾等。FlagOS通过统一的系统软件栈和新增的INT8量化支持,解决了超大规模参数带来的系统优化问题,实现了多芯片的快速适配和精度对齐。此举旨在帮助云服务商和算力基础设施快速部署最新模型,并延长存量

正文结构化主题已通过公开置信门槛
量子位研究

Ilya首个模型曝光:SSI探索测试时训练,8月或亮相

据量子位报道,前OpenAI首席科学家Ilya Sutskever创办的SSI公司被曝正在开发基于测试时训练(TTT)的小型推理引擎,该模型能在推理过程中更新权重,实现持续学习。爆料称当前版本可能于8月向少数用户开放,且英伟达已与SSI达成战略合作并投资,算力将提升10倍。若属实,这将是SSI成立两年来的首个模型,可能改变AI训练范式。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10405 发布:移除 HIP 不安全数学优化以提升一致性

llama.cpp 发布 b10405 版本,主要变更是在 HIP 构建中移除 -funsafe-math-optimizations 编译选项,以避免浮点重关联导致的 RDNA3.5 上贪婪解码不一致问题,确保 HIP 构建符合 IEEE 标准。该版本同时提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,部分平