返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月24日周一 · 20 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

微软将AI治理从政策转向运行时执行

微软提出了一套AI治理架构,将治理从政策文档转向运行时执行、持续评估、可观测性和审计证据。该架构涵盖九个治理域和四个功能,并整合了Microsoft Foundry、Purview、Entra ID等产品。微软还发布了开源Agent治理工具包,为自主代理提供运行时安全能力。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10612 发布:禁用 WebGPU 测试并更新多平台二进制

llama.cpp 发布了 b10612 版本,主要变更包括禁用 WebGPU 的 DOTS3NOTE 架构测试,并提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。该版本还提供了 UI 包,并支持 openEuler

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10610 发布:优化 CUDA 与 Metal 设备命名

llama.cpp 发布 b10610 版本,主要更新为缩短 CUDA 和 Metal 后端中虚拟设备的命名,并优化了 Metal 设备描述在初始化时的构建。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.17.0 发布:新评估体验与 Anthropic 支持

Langfuse 发布 v4.17.0 版本,主要更新包括新的评估用户体验、从 trace 表和事件表创建标注队列、显示任意元数据、迁移 UI 默认显示、支持 Anthropic Messages 作为 Langfuse Assistant 的模型提供商,以及多项修复和优化。该版本还改进了 MCP 清理、评估器模型过滤和监控调度器,并移除了 Assistan

正文结构化主题已通过公开置信门槛
THE DECODER商业

汤森路透斥资4000万美元自建法律AI模型,基于阿里Qwen

汤森路透投资约4000万美元,基于阿里巴巴的Qwen开源模型构建了自有法律AI模型“Thomson”,并利用公司内部数据和领域专家进行训练。测试显示,Thomson在访问公司专属内容时能超越GPT-5.4等竞品,但在推理和编码方面表现较弱。公司计划将Thomson用于文档审查等高频任务,并发布小版本模型供非商业使用,以降低成本并保持独立性。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10608 发布:修复视频 moov atom 解析问题

llama.cpp 发布 b10608 版本,主要修复了视频处理中 moov atom 位于文件末尾时的解析问题,并处理了 SIGPIPE 信号及 Windows 下的管道中断情况。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYC

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10606 发布:修复 ggml clamp 并更新分配器

llama.cpp 发布 b10606 版本,主要修复了 ggml clamp 函数并更新了 ggml-alloc。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持多种硬件后端。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

燧原科技启动科创板发行,募资60亿推进AI芯片产业化

燧原科技于8月24日启动科创板发行,股票代码688801,拟募资60亿元用于第五、六代AI芯片研发及产业化等项目。公司自研四代架构、五款云端AI芯片,2023-2025年营收复合增长率达81.32%,2026年上半年营收11.2亿元,预计2026年或2027年实现盈利。此次上市有望加速国产算力产业链发展。

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Cerebras 发布 CS-4 加速器,性能翻倍

Cerebras 发布了 CS-4 AI 加速器,基于 5nm WSE-3 芯片,通过提升时钟速度和增强冷却,性能达到 CS-3 的两倍。单个机架可容纳三个晶圆,每个用户每秒可处理 4400 个 token,据称比 Nvidia GPU 快 30 倍。CS-4 采用模块化 'Backpack' 设计,并通过 AMD 和 AWS Trainium 等合作伙伴实

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10605 发布:优化 mamba2 投影层性能

llama.cpp 发布 b10605 版本,主要更新是优化了 mamba2 架构中的投影层,通过展平输入/输出投影以使用 GEMM 而非 GEMV,从而提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 多款 Claude 模型出现错误率升高,现已解决

Anthropic 报告其多个 Claude 模型(包括 Claude Opus 5、Fable 5、Mythos 5 和 Opus 4.8)出现错误率升高的问题,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。问题从太平洋时间晚上 9:50 开始,持续至次日凌晨 00:36,现已解决。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10604 发布,新增 DeepSeek 4 张量并行支持

llama.cpp 发布 b10604 版本,主要新增对 DeepSeek 4 的 tensor 并行支持,包括共享专家延迟 allreduce 等优化。该版本提供多平台二进制文件,涵盖 macOS、Linux、Windows、Android 等,并支持多种硬件后端。

正文结构化主题已通过公开置信门槛
量子位产品发布

中诚华隆发布HL200推理芯片及万卡超节点集群

中诚华隆在北京发布HL200推理芯片及超节点智算集群方案,实现从单芯片到万卡集群的体系化突破。HL200支持FP4/FP8超低精度推理,能效比达5.12 TFLOPS/W,兼容主流技术栈,并在DeepSeek V4等模型测试中性能领先。公司同时与多家企业达成战略合作,推动国产推理算力生态建设。

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里视频大模型Wan3.0正式上线,获评稳定真实有质感

阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,该模型在生成时长、文档输入、真实世界还原等方面全面升级,单次可生成30秒视频,并支持多种文档格式。行业评价其“稳定、真实、有质感”,已进入企业生产流程,用于短剧、影视、广告等场景。即日起用户可在多个平台体验,阿里云百炼和千问AI平台提供限时7折优惠。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-27B PrismaSCOUT 量化版发布:NVFP4+BF16 混合精度,体积缩小 11%

Hugging Face 上发布了 Qwen3.6-27B 的 PrismaSCOUT 量化版本,采用 NVFP4+BF16 混合精度,大小为 20.17 GB,比之前的 5.5 bpp 版本小 11%。该版本通过 PrismaSCOUT 算法基于端到端 KL 散度选择位分配,而非逐层代理指标,旨在减少量化漂移。实测平均 KL 为 0.0779,相比其 BF

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Meta 部署安全实践:持续变更安全的健康检查

Meta 在 arXiv 发表论文,介绍其部署时健康检查基础设施 Service Health Checker (SHC),用于在数千个异构服务的持续部署中平衡发布速度与可靠性。SHC 通过模板化指标查询、阈值和工作流谓词,与分层和分阶段发布集成,在回归时自动回滚。论文还讨论了规模化运营中出现的噪声、告警疲劳、漂移和未覆盖回归等问题,以及应对措施和未来方向,

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

超越原始转录:基于LLM的数字孪生的结构化人物提取

本研究探讨了基于LLM的数字孪生中人物信息结构化的影响,提出固定BDE结构在同类任务上优于原始转录,但在异构任务上效果不佳。为此,作者提出自动结构发现流程,在13个多样化子研究中恢复性能,表明关键限制在于信息组织方式而非信息量。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

BF1:用于高效长上下文 Transformer 的因果二进稀疏注意力改造

BF1 是一种确定性的块对齐二进稀疏注意力机制,结合局部邻域、全局首块和对数间隔历史块,实现 O(n log n) 交互和 O(log n) 通信深度。在 NVIDIA RTX PRO 6000 Blackwell GPU 上,BF1 在 32K 上下文下实现每层 10.91 倍加速,并将 Qwen3-0.6B 模型的首 token 时间降低 15.3%。在

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

RISE:面向世界动作模型的自适应想象框架

RISE 提出了一种自适应想象框架,通过选择性展开(Selective Rollout)动态决定世界动作模型(WAM)的推理深度,以平衡规划性能与计算成本。该方法在 NAVSIM 和 nuScenes 数据集上取得了最优规划性能,并减少了不必要的展开。此外,研究团队构建了反事实数据集 CounterDrive,以增强安全关键场景的未来动态预测。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

huihui-ai 发布 Qwen3.8-27B 无审查版本

huihui-ai 发布了基于 Qwen3.8-27B 的 uncensored 版本模型,通过 abliteration 技术移除模型的拒绝机制,仅对第 18 至 51 层进行消融,以保留更多原始性能。该模型支持通过 Hugging Face transformers 库和 Ollama 使用,旨在提供无审查的对话体验。