返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月10日周一 · 1 条
正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源API 更新

Vercel AI SDK 修复 OpenAI 兼容提供商 token 计数异常

Vercel AI SDK 发布 @ai-sdk/openai-compatible@3.0.28 补丁更新,修复了当提供商报告的 reasoning tokens 大于 completion tokens 时 outputTokens.text 可能为负的问题。该问题在 Baseten 服务推理模型因长度限制中断推理时出现。修复后 text 值被限制在 0

8月9日周日 · 11 条
正文结构化主题已通过公开置信门槛
Interconnects AI观点

黑客攻击的教训:AI对齐与安全之思

本文探讨了近期前沿模型(如OpenAI的GPT-5.6)被用于网络攻击的事件,分析了AI安全与对齐问题。作者认为当前科技公司和政府的激励机制不适合快速技术变革,呼吁提高透明度并加强监管。文章还讨论了模型持久性、用户意图假设等特性如何影响安全性,并指出AI行业对未来12-24个月的挑战准备不足。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10333 发布:修复 SpaceMiT 后端 Q5 0 调度问题

llama.cpp 发布 b10333 版本,主要修复了 SpaceMiT 后端中缺失的 Q5 0 调度问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

DeepBeepMeep 发布 WanGP:低显存开源视频生成工具

DeepBeepMeep 发布了 WanGP,一个开源视频生成工具,支持 Wan 2.2 等模型,最低仅需 6GB 显存,兼容旧 GPU,并提供 Web 界面、Lora 支持等功能。该工具旨在降低视频生成门槛,使更多用户能够使用高质量开源模型。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10332 发布:移除 HIP ROCWMMA FATTN CI 配置

llama.cpp 发布 b10332 版本,主要更新为移除 GGML HIP ROCWMMA FATTN 相关 CI 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
THE DECODER研究

谷歌DiffusionGemma:无需从头训练即可构建文本扩散模型

谷歌DeepMind发布了DiffusionGemma的技术报告,该模型基于Gemma-4-26B-A4B改造而成,无需从头训练,采用文本扩散方法并行生成256个token,在H100上达到每秒1500 token的速度。通过两阶段训练(重建和SD·RL)平衡质量与速度,在推理基准上平均提升10分,但绝对性能仍低于自回归模型,且存在重复循环和多用户吞吐量下降

正文结构化主题已通过公开置信门槛
量子位研究

GPT-5.6与Fable 5联手破解25年MIMO检测难题

微软研究院首席研究员Dimitris Papailiopoulos借助GPT-5.6和Claude Fable 5,证明了一个两步算法能在多项式时间内精确命中MIMO检测的最大似然阈值,解决了悬置25年的数学难题。该算法结合LMMSE取整和贪心逐位翻转,复杂度为O(N³),论文已通过作者逐行验证。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

摩尔线程上半年营收17.36亿元超去年全年,商业化提速

国产GPU公司摩尔线程发布2026年半年度报告,上半年营收17.36亿元,同比增长147.42%,已超2025年全年,亏损大幅收窄。公司研发投入持续增加,旗舰产品MTT S5000实现规模化量产,夸娥智算集群在多城市部署,并完成多个大模型训练项目。公司构建了云边端全场景算力布局,MUSA生态兼容CUDA,开发者超80万。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.97.0-rc.1 发布:镜像签名验证与多项修复

LiteLLM 发布了 v1.97.0-rc.1 版本,该版本所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。此版本包含多项修复和功能更新,涉及 Azure Sentinel、Bedrock、Anthropic 适配器、代理、路由、UI 等,并增加了用户预算应用于团队密钥、自动路由器复杂度分层跟踪等功能。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10331 发布:修复 get info 隔离工作目录报告

llama.cpp 发布 b10331 版本,主要修复了 server 端 get info 接口在配置了工具运行时但未指定工作目录时,错误地报告服务器进程工作目录的问题。现在该接口会向隔离环境查询其工作目录,仅当工具在主机上运行时才保留进程目录。此修复由 Xuan-Son Nguyen 贡献。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10330 发布:CUDA 融合 rms norm 与 rope 操作

llama.cpp 发布 b10330 版本,主要更新是在 CUDA 后端中融合了 rms norm、mul 和 rope 操作,并添加了相关测试和内存范围检查。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10329 发布:优化工作目录控件显示逻辑

llama.cpp 发布 b10329 版本,主要改进是服务器和 WebUI 仅在工具实际读取工作目录时才显示工作目录控件。工具现在在 /tools 列表中声明是否解析路径并基于工作目录运行,WebUI 仅在至少一个此类工具被服务且启用时显示相关控件。

8月8日周六 · 8 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10327 发布:修复 CUDA 量化 cpy 内核线程块计数

llama.cpp 发布 b10327 版本,主要修复了 CUDA 下量化 cpy 内核启动时线程/块数量计算错误的问题,并增加了不均匀块数量的测试用例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.27.0 发布:新增 Snowflake Cortex 支持与多项修复

PydanticAI 发布 v2.27.0 版本,新增对 Snowflake Cortex 的支持,包括 SnowflakeModel 和 SnowflakeProvider,并添加了 xai agent count 配置项。同时修复了多个与 OTel 序列化、消息压缩和 Temporal 负载限制相关的 bug,并改进了与 Vercel AI 和 AG-U

正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.17 发布:支持 Kimi K3 与 MiniMax-H3,多项性能优化

SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10322 发布:SYCL 优化 SSM CONV 性能提升

llama.cpp 发布 b10322 版本,主要更新为 SYCL 后端对 SSM CONV 窗口加载进行合并优化,在 Arc Pro B70 上性能提升约 1.85 倍,并在 Qwen3.5 27B 模型上带来约 2% 的预填充速度提升。该版本同时提供了多平台预编译二进制文件下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10321 修复 Metal 归一化计算错误

llama.cpp 发布 b10321 版本,修复了 Metal 后端中 NORM/RMS NORM 操作在行长度非 simdgroup 倍数时计算错误的问题。该问题导致部分行求和结果偏小,进而影响均值和方差计算。修复通过向上取整线程组大小至完整 simdgroup 数解决,并新增了相关测试用例。修复后,M3 Pro 上的测试通过率从 25/50 和 26/

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10319 发布:修复 mtmd 像素处理问题

llama.cpp 发布 b10319 版本,主要修复了 mtmd 模块中 longest edge 忽略最小/最大像素的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
THE DECODER商业

AMD 收购 Taalas,将 AI 模型直接嵌入芯片

AMD 收购了加拿大 AI 初创公司 Taalas,该公司将 AI 模型直接嵌入芯片,实现极速推理。其演示芯片运行 Llama 3.1-8B 时每秒处理超 1.6 万 token,远超竞品。AMD 计划将该技术整合进其加速器路线图,与 Instinct GPU 一起提供系统级解决方案。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.2 量化模型发布:混合精度专家与融合 MoE 优化

Hugging Face 上发布了 brandonmusic/GLM-5.2-EXL3-TR3v4-3.5bpw-MTP78 模型,基于 zai-org/GLM-5.2,采用 trellis 量化与混合精度专家,支持 MTP-78。该模型在 4x RTX PRO 6000 Blackwell 上实现了 KLD 0.061282(fp8 KV)和 0.0695