精选

2026年9月27日 周日 · 今天值得看的 AI 动态

7807
已入库内容
131
活跃信源
7306
已 AI 结构化
44019
检索分块

当前热点

完整榜单 →
  1. 1DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中41 热度
  2. 2Qwen3-4B-Base 模型卡上线 Hugging Face40 热度
  3. 3CrowdGPT 发布社区分布式模型 Crowd-v124 热度
  4. 4audio.cpp 发布多款语音模型 GGUF 量化包24 热度
  5. 5Qwen3.6-35B无审查Genesis版GGUF发布24 热度
9月27日周日 · 4 条
Hugging Face New and Trending Models一手来源✦ 精选开源22

Yue2-3B 音乐生成模型 GGUF 权重发布,适配 audio.cpp

Hugging Face 上发布了 audio-cpp/Yue2-3B-GGUF 仓库,提供适配 audio.cpp 推理框架的 Yue2-3B 音乐生成模型 GGUF 权重,包含 BF16、Q8 0、Q4 0 三种量化版本及配套 VAE 权重。该仓库在 0.8.1 版本中加入 LoRA 支持,并附带多种条件生成(直接生成、完整规划、旋律条件、乐谱条件)的示

推荐理由该仓库把 Yue2-3B 音乐生成模型转成 audio.cpp 原生 GGUF,提供 BF16、Q8_0、Q4_0 三档量化及配套 VAE,并附四种条件生成的示例音频与命令行,方便本地跑音乐生成的人按显存选档。但性能数据仅来自 RTX 5090 单卡、单个长音频样例,其他硬件与曲目下的实时率和音质差异尚未验证。

llama.cpp Releases一手来源✦ 精选开源23

llama.cpp b11203:CUDA FWHT 新增 F16 输入支持

llama.cpp 发布 b11203 版本,主要变更为 CUDA 后端的 FWHT(快速沃尔什-哈达玛变换)内核新增 F16 输入支持。该改动将源数据类型改为模板参数,使内核可直接读取 F16 源而无需先转换为 F32 副本,原有 F32 路径保持不变。同时引入共享谓词 ggml cuda op mul mat use fwht,统一 supports o

推荐理由CUDA 后端的 FWHT 内核现在可直接读取 F16 源,省去先转 F32 副本这一步,对在 NVIDIA 卡上跑含 Hadamard 变换算子的用户可减少一次转换开销,F32 路径不受影响。同时 supports_op 与调度共用同一谓词,堵住了此前类型检查通过、形状断言才报错的缺口。不过验证仅在 A10 上跑通 1297 项 MUL_MAT,其他架构与真实推理场景的收益尚未给出。

llama.cpp Releases一手来源✦ 精选开源19

llama.cpp 发布 b11201:回滚统一 KV 自动适配上下文长度改动

llama.cpp 发布 b11201 版本,主要变更是回滚了此前合并的 PR #28849(统一 KV 缓存下自动适配最大上下文长度的改动),恢复原提交 b04d4e5 之前的行为。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVIN

推荐理由该版本回滚了统一 KV 缓存下自动适配最大上下文长度的改动,恢复原提交之前的行为,此前遇到上下文长度被自动改动问题的用户升级后可回到旧表现。但发布说明只给出回滚提交号,未解释回滚原因,也未说明该行为后续是否会以其他方式重新引入。

llama.cpp Releases一手来源✦ 精选开源21

llama.cpp 发布 b11202:修复 Windows 下 wake fd 警告

llama.cpp 发布 b11202 版本,主要修复了 Windows 平台上 server 的 wake fd 警告问题,由 Adrien Gallouët 提交。该版本同时提供 macOS、Linux、Windows、Android 等多平台及多种后端(CUDA、Vulkan、ROCm、SYCL、OpenVINO 等)的预编译二进制包。

推荐理由这个版本只改了一处:修复 Windows 上 server 的 wake_fd 警告,由 Adrien Gallouët 提交,对在 Windows 跑 llama.cpp server 并受该警告困扰的用户可直接升级。但发布说明未提及该警告是否影响实际功能,也未给出验证方式,其他平台用户升级收益有限。

9月26日周六 · 5 条
llama.cpp Releases一手来源✦ 精选开源15

llama.cpp b11195:为 k-quants 引入分块 mul mat 加速

llama.cpp 发布 b11195 版本,为 ggml-cpu 后端引入针对 k-quants 的 tiled mul mat 实现。该方法将量化权重解包为最大 256x256 的 int8 分块,再通过微内核计算 16x16 分块后写出结果,在大矩阵乘法上带来 3-6 倍加速,但在 GEMV 场景下性能下降约 80%。同时包含 ARM/Windows

推荐理由该版本为 ggml-cpu 后端的 k-quants 引入分块 mul_mat,把量化权重解包成最大 256x256 的 int8 分块再走微内核,大矩阵乘法提速 3-6 倍,对在 CPU 上跑量化模型做批量预填充的用户直接有效。但 GEMV 场景性能反而下降约 80%,且 4096x64 乘 64x4096 才打平,单条推理这类小批量负载可能得不偿失。

Hugging Face Blog一手来源✦ 精选开源15

Hugging Face 将人形机器人接入 LeRobot

Hugging Face 博客介绍如何将人形机器人接入 LeRobot 全栈开源机器人学习库,以 Unitree G1 为平台,采用 OpenHLM 方案:π0.5 策略根据语言、相机观测和机器人状态预测 SONIC 潜在运动 token,再由运行在 G1 上的快速全身控制器解码为 29 自由度动作。团队通过 VR 遥操作采集约 100 条、71 分钟的全身

推荐理由该方案把 G1 的全身遥操作数据转成 SONIC 潜动作再训练 π0.5,让双足机器人不必直接输出关节目标也能做抓放,对想复现人形 loco-manipulation 的团队可直接照搬流程,硬件改装件也已开源。但演示数据仅约 100 条、71 分钟,且抓放罐头属单一任务,策略在更多任务和扰动下的泛化尚未验证。

Hugging Face New and Trending Models一手来源✦ 精选开源12

CodeRankEmbed 的 bf16 量化版内置三层注意力调度

Hugging Face 用户 handwoven8588 发布了 CodeRankEmbed-flash-attn,这是对 nomic-ai/CodeRankEmbed 的 bf16 量化版本,权重未重新训练。该仓库在自定义 modeling 文件中内置三层注意力调度(torch varlen、flash attn、eager),用 O(N) 非填充路径替

推荐理由这个 bf16 量化版把 CodeRankEmbed 原本只支持 eager 注意力的路径换成三层调度,大 batch 下峰值显存从约 1145 MiB 降到 875 MiB,对跑代码检索、受限于显存而不敢开大 batch 的人直接可用。但余弦相似度 0.9999 的实测数据未说明测试集规模与硬件条件,且 torch_varlen 路径要求 torch 2.10.0 以上,旧环境只能退回 flash_attn 或 eager。

Hugging Face New and Trending Models一手来源✦ 精选开源12

Ling-3.0-flash-VL 多模态模型 GGUF 量化版发布

Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash-VL 的 GGUF 量化版本,基于 llama.cpp 运行。该模型为 124B 总参数、每 token 仅激活 5.5B 的 MoE 多模态模型,支持图像和视频输入,原生 128K 上下文,可通过 YaRN 扩展至 256K。llama.cp

推荐理由该 GGUF 量化版让 124B 总参、每 token 仅激活 5.5B 的多模态模型能在本地 llama.cpp 上跑图像与视频输入,且已并入主线 b11190+,无需自编译分支;从 36.5GB 的 IQ2_XS 到 249GB 的 BF16 多档规格,方便按显存取舍。但正文只给出 DSpark 投机解码约 1.63 倍的实测提速,未提供各量化档相对 BF16 的质量评测,压缩后的实际表现仍需自行验证。

Google ADK Python Releases一手来源✦ 精选开源9

Google ADK Python v2.10.0 发布:技能生命周期与评估指标增强

Google ADK Python 发布 v2.10.0,引入实验性的技能生命周期管理(含 EPHEMERAL 生命周期、活跃技能上限与 unload skill 工具),新增 MongoDB 向量与混合搜索工具集,并为 Agent 评估加入时长、token 消耗和模型调用次数等效率指标。同时增强对 OpenAI 推理模型的参数自动适配与推理 token 上

推荐理由v2.10.0 为 Agent 评估加入时长、token 消耗与模型调用次数指标,让已用 ADK 跑评测的团队能直接量化单次执行成本;技能生命周期与 MongoDB 向量检索工具集则需手动开启。但技能生命周期仍标注为实验性、默认关闭,且发布说明未给出这些指标的准确度验证。

9月25日周五 · 1 条
llama.cpp Releases一手来源✦ 精选开源7

llama.cpp b11178:修复 MUSA/MTT S5000 算子失败与构建问题

llama.cpp 发布 b11178 版本,集中修复 MUSA 后端(摩尔线程 MTT S5000 / PH1)的多个问题。改动包括:让 MUSA 使用 16 字节拷贝、启用 CUB 路径、采用上游代码路径、移除多余编译期守卫、在 PH1 上禁用 MMQ 路径,并修复 fused TOPK MOE 内核在 MUSA 上的死锁。修复后 27B 模型困惑度从

推荐理由这次修复让摩尔线程 MTT S5000 上的 MUSA 后端从不可用变为可用:27B 模型困惑度由 nan 恢复为有限值,测试套件 22237 个用例零失败,ARGSORT 与 TOP_K 支持度提升至 CUDA 水平。但所有数据均来自单张 S5000 与 MUSA SDK 5.2.0,其他摩尔线程型号及旧版工具链是否同样受益尚未验证。

9月22日周二 · 1 条
vLLM Releases一手来源✦ 精选开源

vLLM 发布 v0.30.0:新增多模型支持与性能优化

vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K

推荐理由这个版本把 Fast Start 权重缓存扩展到 FP4 检查点和多节点 TP,重启引擎时可直接经 CUDA IPC 映射显存中的量化权重,对频繁重启推理服务的团队能省下重复加载时间;但发布说明未给出缓存命中率或端到端启动耗时对比,实际收益需自行验证。

9月21日周一 · 2 条
Hugging Face New and Trending Models一手来源✦ 精选开源

Ling-3.0-flash GGUF 量化版发布,支持 llama.cpp 与投机解码

Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash 的 GGUF 量化版本,该模型为 124B 总参数、5.1B 激活参数的混合 KDA + gated MLA、512 专家 MoE 架构。这些文件是 bailingmoe3 架构的参考转换,已合并进 llama.cpp PR #26608,并内

推荐理由这套 GGUF 量化把 124B 总参数、5.1B 激活的 Ling-3.0-flash 压到 24GB 显存可跑,并内置 MTP 块与逐层 SwiGLU clamp 元数据,无需额外 drafter 文件,对想在本地跑 MoE 大模型和 agentic 工具调用的用户直接可用。但正文只给出 DSpark 草稿接受率 0.29/0.26,未提供与 BF16 原版的端到端吞吐或质量对比,实际加速与精度损失仍需自行验证。

llama.cpp Releases一手来源✦ 精选开源

llama.cpp b11070:Hexagon 后端 DMA 与 64 位映射重构

llama.cpp 发布 b11070 版本,主要针对 Hexagon 后端进行大规模重构,重写缓冲区和 DMA 处理以支持 64 位映射。改动涵盖二进制算子、softmax、GDN、矩阵乘法等内核的 DMA 化,并新增检查脚本与开发者文档。同时提供 macOS、iOS、Linux(含 CUDA、ROCm、Vulkan、SYCL 等)及 Android 多平

推荐理由这次重构把 Hexagon 后端的缓冲区与 DMA 处理改为支持 64 位映射,并把 softmax、GDN、矩阵乘法等内核迁移到 DMA 路径,对在高通 Hexagon 上跑大模型的开发者意味着更大模型和更少内存搬运限制。但改动集中在 Hexagon 后端,其他平台不受影响,且发布说明未给出重构前后的性能对比数据。

9月20日周日 · 4 条
llama.cpp Releases一手来源✦ 精选开源

llama.cpp b11059:Metal FWHT 内核新增 F16 输入支持

llama.cpp 发布 b11059 版本,主要更新 Metal 后端:为 FWHT(快速沃尔什-哈达玛变换)内核新增 F16 输入支持,使内核可直接读取 F16 源数据而无需先转换为 F32。同时将 FWHT 的 supports op 与调度条件统一到 ggml metal use fwht 谓词,避免两者不一致导致管线为空而中止,并采用无分支 but

推荐理由该版本让 Metal 后端的 FWHT 内核直接读取 F16 源数据,省去先转 F32 的拷贝,并统一 supports_op 与调度条件,修掉了此前 Hadamard 提示下管线为空而中止的崩溃。3.0% 的提升仅在 M5 Pro、block 512 与 65536 行的特定形状下测得,官方也承认在现有性能套件的形状上差异被 1.6us 启动开销淹没,其他 Apple 芯片与真实推理场景的收益尚未验证。

llama.cpp Releases一手来源✦ 精选开源

llama.cpp b11057 新增 Ling 3.0 专用解析器

llama.cpp 发布 b11057 版本,新增针对 Ling 3.0(Bailing V3)的专用聊天解析器。由于 Ling 3.0 Flash 模板在生成提示中预先打开 think 块,模型不会输出起始 标签,且工具调用可能出现在 之前,导致原有自动解析器将工具调用误判为 reasoning content,客户端收到空 content 且无 tool

推荐理由Ling 3.0 Flash 模板预开 think 块,导致工具调用被旧解析器误判为 reasoning_content,客户端拿到空 content 且无 tool_calls,agent 循环直接中断。新解析器在 think 结束标签或 tool_call 起始处终止推理,并补上聊天模板与多项测试。不过解析器检测依赖该系列独有的 role 标记,其他模板是否适用未在说明中验证。

llama.cpp Releases一手来源✦ 精选开源

llama.cpp b11064:Metal 支持 dsv4 hc pre 任意 hc

llama.cpp 发布 b11064 版本,主要修复 Metal 后端 dsv4 hc pre 算子的问题:此前该算子通过 constexpr 将 hc 硬编码为 4,导致其他 hc 值被 supports op 拒绝并回退到 CPU。本次改动将 n hc 作为函数常量(FC DSV4 HC)传入,并为不同 n hc 生成流水线变体,同时新增 hc = 1

推荐理由此前 dsv4_hc_pre 在 Metal 后端把 hc 硬编码为 4,其他取值会被 supports_op 拒绝并回退 CPU,Kimi-K3 这类 hc 随层数增长的模型因此无法走 GPU。本次改为以函数常量传入 n_hc 并按值生成流水线变体,同时补了 hc=1、2、3、5、8、65 的测试用例。不过改动只涉及 Metal 后端,其他后端是否同样受限、以及实际推理速度提升多少,发布说明均未给出。

DeepSeek Harness Repository Activity一手来源✦ 精选开源

DeepSeek 开源插件化 agent harness 项目 dsh

DeepSeek AI 开源了名为 DeepSeek Harness(dsh)的 agent harness,采用「一切皆插件」架构,基于 Cordis 构建。项目目前处于开发者预览阶段,官方警告将出现破坏兼容性的变更,用户可通过 npm 的 npx 命令或源码方式运行 Web UI。项目以 MIT 协议开源,并提供文档、Discord 社区与 GitHub

推荐理由DeepSeek 把 agent harness 做成「一切皆插件」架构并基于 Cordis 构建,对想按需拼装 agent 能力的开发者来说,可以直接用 npx 起 Web UI 或从源码改插件。但项目明确处于开发者预览阶段,官方警告会有破坏兼容性的变更,且未给出任何评测数据,现在接入需自行承担返工成本。