返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月20日周日 · 14 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

阶跃发布 Step 5 Preview,跻身 AA 榜单全球开源前三

阶跃星辰于9月20日发布新一代旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作与金融等场景,提升真实世界 Agentic 任务表现。该模型在全球权威榜单 Artificial Analysis Intelligence Index 中跻身全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8,并计划于 10

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Comfy-Org 发布适配 ComfyUI 的 Qwen3-VL 重打包模型

Comfy-Org 在 Hugging Face 上发布了 Qwen3-VL 的重新打包版本,将 Qwen/Qwen3-VL-4B-Instruct 和 Qwen/Qwen3-VL-8B-Instruct 转换为适配 ComfyUI 的单文件模型。该仓库提供 bf16、fp8 scaled、int8 convrot 和 nvfp4 等多种量化格式,用户需将文

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

DeepBeepMeep 发布 Wan2.1 单文件模型,适配 WanGP 低显存视频生成

DeepBeepMeep 在 Hugging Face 上发布了 Wan2.1 视频生成模型的单文件版本,基于 Wan-AI/Wan2.1-T2V-1.3B,用于配合其开源项目 WanGP 使用。WanGP 支持 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV 等视频生成模型,主打低显存需求(最低 6GB 即可

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11057 新增 Ling 3.0 专用解析器

llama.cpp 发布 b11057 版本,新增针对 Ling 3.0(Bailing V3)的专用聊天解析器。由于 Ling 3.0 Flash 模板在生成提示中预先打开 think 块,模型不会输出起始 标签,且工具调用可能出现在 之前,导致原有自动解析器将工具调用误判为 reasoning content,客户端收到空 content 且无 tool

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Swift-Qwen3.8-27B 去审查版 GGUF 量化模型发布

Hugging Face 用户 ajgazin 发布了 Swift-Qwen3.8-27B-Uncensored-Dynamic-MTP-GGUF,这是对已去审查(abliterated)的 Swift-Qwen3.8-27B 模型进行 GGUF 量化的版本。该模型采用 Unsloth Dynamic 3.0 量化布局,包含 MTP 头以支持 llama.c

正文结构化主题已通过公开置信门槛
MinerU Releases一手来源开源

MinerU 4.0.4 发布:修复 VLM 显存与日志问题

MinerU 发布 4.0.4 版本,主要修复 VLM 引擎在高显存设备上的 GPU 显存利用率逻辑,并降低推理性能、模型加载等日志级别。API server 的 --log-level 参数现在仅作用于服务端日志,WebUI 修复了超长文件名的幂等处理问题。依赖方面要求 mineru-vl-utils 最低版本提升至 2.0.5,以修复 lmdeploy

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 与 OpenAI 推出 GPT-5.6 Sol Ultrafast 模式

Cerebras 与 OpenAI 联合发布 Ultrafast Mode 服务层级,首先在 OpenAI API 中上线并由 Cerebras 提供算力支持,目前面向少数客户限量预览。该模式驱动 GPT-5.6 Sol,输出速度最高达每秒 750 tokens,且不牺牲质量。Cerebras 称在 Humanity's Last Exam 基准上,Ultr

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 在 Hot Chips 详解 CS-4 架构并预览 CS-5、CS-6 路线图

Cerebras 在 Hot Chips 2026 大会上深入介绍了 CS-4 加速器的系统架构,包括 Nexus 机架级平台、晶圆级引擎的供电与冷却设计,并预览了 CS-5 和 CS-6 路线图。CS-5 计划于 2027 年推出,目标在开源模型上实现每用户每秒 1 万输出 token,在万亿参数级前沿模型上实现每秒 5000 token 和每兆瓦每秒 3

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 以最高 750 token/秒服务 GPT-5.6 Sol

Cerebras 宣布为 OpenAI 的 GPT-5.6 Sol 提供 Ultrafast 模式,输出速度最高达每秒 750 个 token。该服务运行在 Cerebras WSE-3 晶圆级芯片上,模型架构、权重、精度、上下文配置和推理设置与标准 OpenAI 端点完全一致,未做蒸馏或量化。Cerebras 称在 GDP-Val 任务上完成速度比标准端点

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 发布 CS-4:号称业界最快 AI 加速器

Cerebras 发布第四代 AI 加速系统 CS-4,由三个 Wafer Scale Engine 3 Turbo 处理器构成,采用全新 Nexus 机架级平台架构。官方称其推理速度最高可达 GPU 系统的 30 倍,在超过 10 万亿参数模型上实现每秒 1000+ token,并原生支持分离式推理,可与 AMD Helios、AWS Trainium 等

正文结构化主题已通过公开置信门槛
智东西产品发布

华为发布灵衢互联架构与昇腾960超节点,构建Agentic AI算力底座

华为在2026年全联接大会上发布灵衢(UnifiedBus)统一互联总线协议,以及昇腾960芯片、昇腾960超节点、OceanStor M900 AI记忆存储等AI基础设施新品。灵衢将CPU、NPU、DPU、内存、存储等统一互联,使10万卡集群的MFU从约20%提升至35%,单集群可支持100万颗AI处理器。华为同时推进CANN开源与Agent开发生态合作,

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11055:hexagon 后端新增 GEGLU QUICK 支持

llama.cpp 发布 b11055 版本,主要变更为在 hexagon 后端新增对 GEGLU QUICK 的支持(PR #29114)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11054:Hexagon 后端启用 TOP K 算子支持

llama.cpp 发布 b11054 版本,主要变更为在 Hexagon 后端启用对 TOP K 算子的支持,包括单行 TOP K 线程化、提升基于 VTCM 的尺寸上限、修复 TOP K mdev 行分区、优化大行选择,并更新了相关文档。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译包。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

Hugging Face 开源 Reef:面向持续自我改进智能体的推理基础设施

Hugging Face 开源了 Reef 基础设施,旨在让智能体(harness + 模型)能够从经验中持续自我进化。Reef 以推理为核心,提供标准 OpenAI 格式推理端点,并将推理轨迹、执行结果和用户反馈存储为结构化经验流,支持模型权重与 harness(提示、记忆、技能、工具、编排逻辑)的联合更新。其目标是让开源社区更容易实验持续自我改进,并获得

9月19日周六 · 6 条
正文结构化主题已通过公开置信门槛
Interconnects AI观点

我对递归自我改进(RSI)的立场

Interconnects AI 作者撰文阐述其对递归自我改进(RSI)的立场。作者认为,当前 AI 安全担忧更多源于前沿实验室(尤其 OpenAI 和 Anthropic)大规模使用数千并发智能体所带来的文化焦虑,而非真正的 RSI 突破;他提出「有损自我改进」替代情景,指出可自动化研究范围有限、并行智能体收益递减、资源瓶颈与政治因素制约进展。文章还引用了

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11053 发布:改进 server 启动日志

llama.cpp 发布 b11053 版本,主要改进了 server 的启动日志信息。更新后每个模型在日志中会显示来源标签(preset/models dir/cache),替代原先难以理解的星号标记,并在“Loaded cached model presets”日志中显示 Hugging Face hub 缓存路径,同时新增 hf cache::get

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11052:json-schema 支持正则转义连字符

llama.cpp 发布 b11052 版本,主要变更是其 json-schema 功能现在接受正则表达式模式中的转义连字符(PR #29127)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
量子位产品发布

Qwen 3.8 27B实测:一句Prompt秒生成网页,但后端缺失

量子位实测了Qwen 3.8 27B模型,该模型能通过一句Prompt在几分钟内生成完整网页工具,包括数据分析工具和仿12306抢票页面。工程师Alok结合Cerebras硬件实现了1950 token/s的生成速度,可秒级生成Google首页和YouTube界面。但实测发现生成的网页仅为前端外壳,无法接入真实后端、支付和实时数据,且Cerebras加速方案

正文结构化主题已通过公开置信门槛
THE DECODER研究

Google DeepMind 推出 Dream-RSI:让 AI 智能体通过“做梦”回放改进搜索策略

Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录来测试新的搜索策略,而无需重复昂贵的实时计算,从而让 AI 智能体更高效地解决困难搜索任务。该方法只改变搜索策略、不改动底层模型,在 Gemini 3.1 Pro 和 Gemini 3.7 Flash 上测试八项任务,平均运行时间和尝试次数均下降,并在部分 G

正文结构化主题已通过公开置信门槛
智东西产品发布

实测Wildcat Lake轻薄本:Agent办事、AI修图、语音操控电脑

英特尔推出第三代酷睿处理器Wildcat Lake,采用Intel 18A制程和双芯片封装,内置17TOPS算力的NPU,首次将AI功能下放到4000 6000元价位段轻薄本。英特尔同时展示Firefly萤火虫计划参考设计,通过拥抱手机产业链、优化零部件和标准化集成来降低成本。作者在搭载该处理器的机械革命无界14 S上实测了WorkBuddy、像素蛋糕、Ow