返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月21日周一 · 10 条
正文结构化主题已通过公开置信门槛
量子位模型发布

阶跃发布 Step 5 Preview:600B MoE 架构,Agent 能力实测

阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,采用 MoE 架构,600B 总参数、激活参数仅 27B,支持 1M 上下文,在 Artificial Analysis 评测中取得 44 分,位列全球开源模型 Top 2。作者实测其 Agent 能力,用其操作 Blender 建模、制作 3D 游戏和 2D 小游戏,发现模型能自主补充 Prom

正文结构化主题已通过公开置信门槛
量子位商业

沙利文报告:商汤大装置居中国Neocloud市场第一

弗若斯特沙利文联合头豹研究院发布《中国全栈AI云服务市场报告 2026H1》,报告显示商汤大装置以近50%的市场份额位居中国Neocloud市场第一。报告将全栈AI云厂商分为综合云计算厂商与Neocloud两类,并指出2026年是Agentic AI元年,Agentic AI对算力要求较传统大模型提升10倍以上。商汤大装置强调端到端系统化能力、算电协同、国产

正文结构化主题已通过公开置信门槛
量子位商业

IDC评估中国AI算力管理平台:范式综合评分第一,四项维度满分

IDC发布《中国AI算力管理平台技术能力评估,2026》,对多家主流AI算力管理平台厂商进行评估,范式综合评分位列第一,并在算力资源管理、算力运维、技术架构、交付服务四个维度获满分。报告指出AI基础设施正从基础算力平台演进为企业智能化转型的核心IT基础设施,评估覆盖六大维度。范式以不绑定芯片厂商的统一管理软件为核心,已适配十余家主流芯片,并披露某政策性银行通

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

DeepBeepMeep发布MiniMax H3模型及WanGP视频生成工具

DeepBeepMeep发布了MiniMax H3图像模型,这些模型与WanGP工具配合使用。WanGP是一个开源视频生成工具,支持多种模型,具有低VRAM需求、支持旧GPU、快速生成和Web界面等特点。该工具还提供Loras支持、队列系统和Discord社区支持。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11065:为 Gemma 4 调优 CUDA Flash Attention

llama.cpp 发布 b11065 版本,主要变更为针对 Gemma 4 在 Ampere 及更新架构 GPU 上调整 Flash Attention(FA)的 CUDA 实现(PR #29152)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulk

正文结构化主题已通过公开置信门槛
智东西商业

中国最大独立Token工厂硅基流动再融资,年内累计近29亿

AI基础设施企业硅基流动(SiliconFlow)宣布完成B+轮二期和C轮融资,投资方包括中国互联网投资基金、国新基金、中国移动链长基金等,2026年度累计融资金额近29亿元。融资将用于推理引擎、异构算力调度、模型与芯片适配等核心技术研发,强化Token供应平台能力并加快全球市场拓展。该公司成立于2023年,按2025年Token年吞吐量计是中国最大的独立生

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Ling-3.0-tiny 的 GGUF 量化版本发布

开发者 bloomer010 在 Hugging Face 上发布了 inclusionAI/Ling-3.0-tiny 的 GGUF 量化版本,直接从 BF16 safetensors 转换而来,覆盖从 BF16 到 Q1 0 的多种量化档位。该模型为 7.9B 总参数、1.3B 激活参数的 MoE 架构,含 18 层 KDA 与 6 层 MLA,支持 1

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Ling-3.0-flash GGUF 量化版发布,支持 llama.cpp 与投机解码

Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash 的 GGUF 量化版本,该模型为 124B 总参数、5.1B 激活参数的混合 KDA + gated MLA、512 专家 MoE 架构。这些文件是 bailingmoe3 架构的参考转换,已合并进 llama.cpp PR #26608,并内

正文结构化主题已通过公开置信门槛
MinerU Releases一手来源开源

MinerU 4.0.5 发布:表格模型支持 CUDA ONNX

MinerU 发布 4.0.5 版本,为表格模型新增可选 CUDA ONNX session,在可用时自动启用并加入推理阶段计时;同时统一 ONNX session 线程配置并支持环境变量回退,更新物化素材图片命名规范并改进图片分辨率处理,且将 docvortex 最低版本要求提升至 0.4.20。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

阿里开源 Qwen-Image-2.1:70 亿参数图像模型称超越闭源

阿里巴巴 Qwen AI 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,其视觉生成组件仅 70 亿参数,团队称在自家基准上超过多数闭源模型,但独立评测尚未出炉。该模型可在 3090 等消费级 GPU 上运行,原生支持 RGBA 透明图像生成与编辑,最多可同时处理十张参考图,并通过架构调整与 KV 缓存复用加速推理。模型已在 Hugging

9月20日周日 · 10 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11064:Metal 支持 dsv4 hc pre 任意 hc

llama.cpp 发布 b11064 版本,主要修复 Metal 后端 dsv4 hc pre 算子的问题:此前该算子通过 constexpr 将 hc 硬编码为 4,导致其他 hc 值被 supports op 拒绝并回退到 CPU。本次改动将 n hc 作为函数常量(FC DSV4 HC)传入,并为不同 n hc 生成流水线变体,同时新增 hc = 1

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 无审查消融版 GGUF 发布

Hugging Face 上发布了一个名为 Qwen3.8-27B RVN Heretic Abliterated Uncensored 的 GGUF 模型,它基于 Qwen3.8-27B,并在 trohrbaugh 的 ARA 消融版本上额外进行两轮全权重 ARA 处理,将有害提示拒绝率从 3/100 降至 0–1/100,同时保持极低的行为损伤(KL≈0

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11063:修复 AST 非法 UTF-8 处理

llama.cpp 发布 b11063 版本,主要更新是在 common/peg 中处理 AST 里的非法 UTF-8 序列,并按照 Unicode 建议返回最大子部分(maximal subpart),同时移除了 strict 参数。该版本同步提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vu

正文结构化主题已通过公开置信门槛
THE DECODER研究

Runway 研究实时 AI 视频生成:边描述边直播

Runway 公布其实时视频生成研究,用户可在描述过程中直接流式生成视频,而非输入提示词后等待。该方案基于其首个通用世界模型 GWM-1(构建于 Gen-4.5 之上),逐帧生成并接受镜头运动、机器人指令或音频作为控制。Runway 认为实时生成可缩短等待时间、降低 GPU 成本,并将计算负载从训练转向使用;同时指出视频模型逐帧累积误差是核心难题,其通过用自

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ESPnet 发布 OWSM-CTC v4 1B 开源语音基础模型

ESPnet 团队发布 OWSM-CTC v4 1B 语音基础模型,基于分层多任务自条件 CTC 的纯编码器架构,在 32 万小时公开音频上训练三个 epoch,支持多语言语音识别、任意语言对语音翻译和语种识别。该模型完全开源,代码、权重和训练日志均已公开,其配套论文获得 INTERSPEECH 2025 最佳学生论文奖。模型提供批量推理、长音频解码和 CT

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering开源

Google 发布 Kotlin 版 ADK 1.0,功能对齐 Python 并支持端侧 AI

Google 发布面向 Kotlin 的 Agent Development Kit(ADK)1.0,这是一个可用于生产环境的 AI 智能体开发框架,覆盖 Kotlin、Android 与 JVM/服务端应用,并在功能上与 Python、Java 版 ADK 对齐。该版本新增 Android 专属能力,支持端侧与混合 AI,包括 LiteRT-LM、ML K

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11062:CUDA 为 qwen4 启用稀疏 flash attention

llama.cpp 发布 b11062 版本,主要变更是为 qwen4 在 CUDA 后端启用稀疏 flash attention(sparse fa),对应 PR #28770。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,包含 CUDA 12/13、Vulkan、ROCm

正文结构化主题已通过公开置信门槛
量子位开源

APUS开源国内首批Jev跨平台复现,国产模型实现秒级决策

中国AI企业APUS旗下AI实验室于9月19日公布全球最早一批针对Jev的独立开源复现成果,并封装为开箱即用的Agent Skill「fast-browser-use」,支持macOS、Linux、Windows,可在无GPU的Mac和PC上纯本地离线运行,代码以MIT协议开放。该项目复现了Jev跳过自回归解码、单Token Logits直接打分与KV-Ca

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

XHToken 发布 Spark-X2.5-4B-GGUF 本地部署模型

XHToken 在 Hugging Face 发布 Spark-X2.5-4B-GGUF 量化模型,基于 Spark-X2.5-4B,采用混合注意力架构,原生支持最长 1M token 上下文和 200 多种语言,面向对话、写作、翻译、推理、编程、工具调用与智能体工作流。该 GGUF 版本支持 llama.cpp、Ollama、LM Studio 和 Uns

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11060:修复 mamba 时间步投影连续性

llama.cpp 发布 b11060 版本,主要修复了 mamba 实现中时间步投影输入的内存连续性问题,并在归一化后跳过不必要的连续拷贝。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译二进制包。