返回主题地图

开源生态

技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月10日周四 · 20 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Qwen3.5-2B 网络安全模型发布 GGUF 量化版

Hugging Face 用户 reaperdoesntknow 发布了 Qwen3.5-2B-CyberSec 的 GGUF 量化版本,便于在 llama.cpp 兼容运行时(含 Ollama)本地推理。该模型基于 unsloth/Qwen3.5-2B,并使用 Trendyol 网络安全指令微调数据集训练。发布方明确说明未提供基准测试或安全评估结果,并提示

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Qwen3.5-0.8B Cyber GGUF 量化模型发布

Hugging Face 用户 reaperdoesntknow 发布了基于 Qwen/Qwen3.5-0.8B 的 GGUF 量化模型仓库 Qwen3.5-0.8-Cyber-GGUF,提供从 BF16 到 Q2 K L 的多档量化版本,面向本地推理与资源受限场景。仓库还包含一个 BF16 mmproj 多模态投影文件,但作者明确表示未验证端到端多模态路径

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Deepseek 发布 V4.1-Flash,大幅降低 AI 智能体内存需求

Deepseek 发布新模型 V4.1-Flash,通过大幅压缩 KV 缓存降低长文本处理成本:快速 GPU 内存中的缓存仅需前代 V4-Flash 约四分之一,永久卸载部分降至约八分之一,相比 V1 每 token 全局 KV 缓存缩小 437 倍。模型采用输入/输出计算拆分,读取输入时每 token 仅激活 80 亿参数、生成时激活 160 亿,并将主

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10893:提高 Add fusion 测试容差

llama.cpp 发布 b10893 版本,主要变更是提高 Add fusion 测试的容差(#28691)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。

正文结构化主题已通过公开置信门槛
THE DECODER商业

英伟达与Palantir合作以AI运行供应链,首用英伟达自身百万零件业务

英伟达与Palantir宣布合作,用AI运行供应链,首个部署目标是英伟达自身覆盖数百万零件、数千供应商的全球供应链。Palantir将开源Nemotron模型集成到Foundry平台,供企业用自有运营数据微调,英伟达cuOpt负责场景规划与优化,系统可更早发现瓶颈、加速物料分配并评估替代方案,决策结果反哺模型持续改进。制造、制药、能源企业可通过Soverei

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10892:移除测试中 SYCL 特殊处理

llama.cpp 发布 b10892 版本,主要变更是从 test-backend-ops.cpp 中移除 SYCL 的特殊处理逻辑(PR #28688)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CU

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10891:PowerVR Vulkan 反量化回退共享内存归约

llama.cpp 发布 b10891 版本,针对 PowerVR GPU 的 Vulkan 后端修复了一个严重问题:Imagination 专有 Vulkan 编译器对使用仅子组归约(要求子组大小 =16)的反量化 mul mat vec 着色器返回 VK ERROR UNKNOWN,导致 k-quants、i-quants、TQ2 0、MXFP4、NVF

正文结构化主题已通过公开置信门槛
RAGFlow Releases一手来源开源

RAGFlow v0.27.2 发布:重构 Agentic RAG 检索框架

RAGFlow 发布 v0.27.2 版本,重构了 Agentic RAG 检索框架,显著提升推理速度与基准测试表现。新增知识编译运行时设置、知识编译流水线限流、Sitemap 数据源、WebDAV 自定义 CA 证书、MonkeyOCRv2 与自托管 PaddleOCR-VL 解析支持,以及 Sofya 搜索工具等。同时新增 Hubris 和 llmman

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

FunAudioLLM 发布 Fun-ASR-Nano 的 Transformers 原生版本

FunAudioLLM 在 Hugging Face 发布 Fun-ASR-Nano-2512-hf,这是 Fun-ASR-Nano 端到端语音识别模型的 Transformers 原生兼容版本,基于数千万小时真实语音训练,支持中文、英文、日文,中文覆盖 7 种方言组和 26 种地区口音。该版本无需克隆仓库或 trust remote code,可直接用 T

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10889 发布:索引器不再分配未使用的 V cache

llama.cpp 发布 b10889 版本,主要改动是内存优化:在索引器场景下不再分配 V cache,因为该缓存实际未被使用(PR #28330,由 Stanisław Szymczyk 参与)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10888:Vulkan 后端新增命令缓冲区调试标签

llama.cpp 发布 b10888 版本,主要变更是为 Vulkan 后端添加命令缓冲区(command-buffer)调试标签,以便 GPU 性能分析工具(profiler)识别和追踪。该改动由 gabby-zy 等人贡献,并借助 Claude Code 协助完成。同时该版本照例提供 macOS、Linux、Windows、Android 等多平台预编

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

moonshine-streaming-medium 的 GGUF 量化版发布

Hugging Face 用户 handy-computer 发布了 UsefulSensors/moonshine-streaming-medium 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型是 245M 参数的编码器-解码器英语流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,在 LibriSpeech t

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

moonshine-streaming-small 发布 transcribe.cpp GGUF 量化版

handy-computer 在 Hugging Face 上发布了 moonshine-streaming-small 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型源自 UsefulSensors 的 123M 参数流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,LibriSpeech test-clean

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA parakeet-unified-en-0.6b 的 GGUF 量化版发布

Hugging Face 用户 handy-computer 发布了 NVIDIA parakeet-unified-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的 FastConformer 编码器加 RNN-T 解码器的英文语音识别模型,支持离线与缓冲流式两种模式。量化版本在 Libri

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

NVIDIA 流式语音识别模型 nemotron-speech 发布 GGUF 量化版

Hugging Face 用户 handy-computer 发布了 NVIDIA nemotron-speech-streaming-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的缓存感知流式 FastConformer-RNNT 英文语音识别模型,支持离线与流式两种模式,并提供 F32

正文结构化主题已通过公开置信门槛
THE DECODER商业

美国头部 AI 支出企业 8 月人均成本下降近 10%

Ramp 发布的 2026 年 9 月 AI Index 显示,美国 AI 支出最高的企业 8 月人均 AI 支出中位数下降 9.7% 至 7205 美元。Ramp 首席经济学家 Ara Kharazian 认为部分下降源于 8 月工程师休假等季节性因素,同时代币价格下跌和向更便宜模型的迁移也在压低支出。每百万代币有效价格自 2026 年 3 月峰值已下跌

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10887:s390x 增加 q4 0 repack 支持

llama.cpp 发布 b10887 版本,主要变更为在 ggml-cpu 的 s390x 架构上为 q4 0 量化格式增加 repack 支持,并清理了相关注释。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、Op

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10886:s390x 新增 Q1 0 向量 intrinsic 支持

llama.cpp 发布 b10886 版本,主要变更为在 ggml-cpu 的 s390x 架构上新增 Q1 0 向量内积(ggml vec dot q1 0 q8 0)的 intrinsic 支持,由 IBM 的 Aaron Teo 提交并同步更新了 Q1 0 的支持文档。该版本同时提供 macOS、iOS、Linux、Android、Windows 等

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10885 发布:修复 Granite 系列模型参数计数

llama.cpp 发布 b10885 版本,主要修复了 Granite 系列模型的参数计数问题,包括补充 active experts 缺失的 A 前缀、修正代码对齐并移除未使用的 40 block 分支。该提交由 IBM 的 Aaron Teo 完成,同时该版本照例提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制

正文结构化主题已通过公开置信门槛
量子位开源

蚂蚁灵波开源1.3B世界模型轻量版,单卡可实时跑

蚂蚁灵波开源了世界模型 LingBot-World 2.0 的轻量版,参数规模仅 1.3B,面向消费级单卡 GPU,可在本地实现实时世界生成。该版本并非由 14B 主模型裁剪而来,而是沿 Causal Pretrain、MoBA 注意力掩码、一致性蒸馏与 DMD 蒸馏的训练路线自然得到,并同时开放 Causal Pretrain 与双向 Teacher 上游