返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月25日周五 · 20 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布8

samai-8b M8 终版 GGUF 发布:agent 能力增强

开发者 tchbcb 在 Hugging Face 发布 samai-8b 的 M8 终版 GGUF 量化权重,基于 Qwen/Qwen3.5-9B 通过 QLoRA 蒸馏增强 agent 执行能力。在 60 题 agent 评测中总分从 M7 的 86.7 提升至 96.7,多工具编排与负向直答显著改善,knight15 能力回归保持满分。同盘位对比中,该

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp b11173 发布:修复 Metal 图捕获

llama.cpp 发布 b11173 版本,主要修复 Metal 后端的图捕获(graph capture)逻辑:当图没有节点时提前返回,移除 capture compute 的冗余重置,在捕获错误信息中提示 METAL CAPTURE ENABLED=1,并向 ggml metal op init 传入 capture compute == 0 以仅在捕

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp b11172:优化 Metal 稀疏 Flash Attention

llama.cpp 发布 b11172 版本,主要针对 Metal 后端优化稀疏 Flash Attention(sparse FA)并做代码清理,包括将稀疏 FA 索引缓存到共享内存、简化共享内存大小计算以及展开稀疏索引加载。该版本同时提供 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp 发布 b11171:同步 ggml 0.25.3 并修复 ubsan 错误

llama.cpp 发布 b11171 版本,主要同步了 ggml 子模块更新,将 ggml 版本提升至 0.25.3,并修复了 ggml graph nbytes 中的 ubsan 错误。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制文件,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp 发布 b11169:修复 token id 解析数值截断

llama.cpp 发布 b11169 版本,主要修复了 llama-grammar 中 token id 解析时的数值截断问题(#29382)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源研究3

Cerebras 优化 AI 个人助理:任务耗时从 7 分钟降至 22 秒

Cerebras 在博客中测试了多款消费级 AI 个人助理在预订晚餐等日常任务上的表现,发现现有助手耗时 4 至 7 分钟以上。他们用 Qwen 3.8 27B 模型在 Cerebras 上运行、以 Pi 作为 agent harness,并通过并行检查、加速推理和保存网站操作技能等优化,将任务完成时间缩短至 22 秒,比现有助手快 19 倍。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp b11168:Hexagon 动态量化器改进

llama.cpp 发布 b11168 版本,主要针对 Hexagon NPU 后端进行动态量化器改进。改动包括修复 Q8 0 N=1 MUL MAT 的精度问题、解决寄存器溢出、在所有动态量化路径中改用 DMA,并清理了过时的 run quant task 与相关非 DMA 激活逻辑。该更新由高通与 Hugging Face 的贡献者共同完成,旨在提升骁龙

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp b11167:Hexagon 后端支持 I32 CPY 与 CONT

llama.cpp 发布 b11167 版本,主要变更为 Hexagon 后端新增对 I32 类型 CPY 和 CONT 操作的支持(PR #29379)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVIN

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp b11166:CUDA 新增 CONV 2D DW 的 F16 内核支持

llama.cpp 发布 b11166 版本,主要变更是为 CUDA 后端新增 CONV 2D DW 算子的 F16 内核支持(PR #29064)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,包含 CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布6

Oruk AI 发布 25 语言语音识别模型 Orukeet

Oruk AI 联合斯坦福、剑桥等机构发布 Orukeet,一个基于 NVIDIA Parakeet TDT 0.6B v3 微调的 25 语言语音识别模型。该方法将编码器一半的时序深度可分离滤波器替换为 12,288 个拟合后冻结的 Gabor 核,仅训练其余参数。在 74 个测试划分中的 61 个上超过 Parakeet,LibriSpeech test

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp 发布 b11165 版本

llama.cpp 发布 b11165 版本,主要变更是测试相关的 flush status(#28352)。该版本为 macOS/iOS、Linux、Android、Windows、openEuler 等多平台提供预编译二进制包,覆盖 CPU、CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL、Snapdragon 等多种后端。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源产品发布5

OpenAI 称 GPT-6 Astra Pro 错误率升高后已恢复

OpenAI 状态页面显示 GPT-6 Astra Pro 出现错误率升高,影响部分用户。官方已定位问题并实施缓解措施,随后进入监控阶段,最终确认所有受影响服务已完全恢复。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布6

Fastino 发布 GLiNER2.5 Base 统一信息抽取模型

Fastino 在 Hugging Face 发布 GLiNER2.5 Base(fastino/gliner2.5-base-v1),一个基于 DeBERTa-v3-base 的 194M 参数英文信息抽取模型。该模型采用边界架构,可在单一 schema 下统一完成命名实体识别、文本分类、结构化记录解析、关系抽取和跨度属性打分,并支持 CPU、CUDA、M

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

Fastino 发布 GLiNER2 统一信息抽取模型

Fastino AI 在 Hugging Face 发布 GLiNER2 大模型(fastino/gliner2-large-v1),将命名实体识别、文本分类、结构化数据抽取和关系抽取统一到一个 205M 参数模型中。该模型支持 CPU 推理、本地运行无需外部 API,采用 Apache-2.0 许可,并提供 pip 安装与多任务 schema 组合用法。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp b11163 发布:新增 llama batch ext 批处理 API

llama.cpp 发布 b11163 版本,核心变更是新增 llama batch ext API(PR #24669),支持在同一个 batch 中同时处理 token、embedding 和 state,并引入 llama embd、llama batch ext add embd、llama batch ext set embd state 等接口,

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布5

Langfuse v4.45.2 发布:新增批量推理遥测与多项修复

Langfuse 发布 v4.45.2 版本,主要新增 AI Gateway 按项目批量推理遥测及瞬时失败重试功能,并修复了元数据键冲突、批量导出错误提示、OpenAPI 类型定义、会话指标栏布局和 SSO 发现错误等问题。此外还包含多项重构与性能优化,如移除 recharts 依赖、统一游标分页、提升评分索引粒度等。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布3

PrismML 将微型 LLM 带入高通芯片智能眼镜

由加州理工学院研究人员创立、UC Berkeley 的 Ion Stoica 担任顾问的 AI 实验室 PrismML,为搭载高通 Snapdragon 芯片的智能眼镜开发了其微型语言模型版本。在高通 Snapdragon 峰会上,高通展示了 PrismML 的 1-bit Bonsai LLM,可在基于 Snapdragon AR1 Gen 1 平台的 A

正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源API 更新4

Vercel AI SDK 发布 ai@7.0.114 补丁更新

Vercel AI SDK 发布 ai@7.0.114 补丁版本,主要修复了 ai 包中按遥测允许列表过滤 tracing-channel 上下文的问题,并在提示词校验代码中澄清 allowSystemInMessages 允许所有系统消息(包括指令文本)。同时更新了依赖 @ai-sdk/gateway 至 4.0.92。

正文结构化主题已通过公开置信门槛
智东西商业2

DeepSeek被曝冲刺5000亿元估值,年化营收达67亿元

据The Information报道,DeepSeek年化营收运行率已达10亿美元(约67.13亿元人民币),较数月前不足5亿美元翻倍以上,由创始人梁文锋在投资者会议披露。DeepSeek正敲定新一轮500亿元人民币融资,目标估值5000亿元人民币,并同步筹备科创板IPO。其收入几乎全部来自API调用,涨价后客户未流失,但公司仍将超70%算力投入新模型训练,

正文结构化主题已通过公开置信门槛
智东西模型发布1

爱诗科技发布实时世界模型PixVerse R2,登X趋势榜第二

爱诗科技(AIsphere)发布实时世界模型PixVerse R2,9月22日上线当天登上X趋势榜第二。用户可在其生成的世界中通过WASD移动、用自然语言改变场景与剧情,实现从“看视频”到“进入世界”的交互。技术上,R2通过Omni Causal AR扩展世界建模能力,并用Real-Time Acceleration将能力带入实时运行区间,探索实时世界模型的

另有 1 家信源报道