Qwen3.5-2B 网络安全模型发布 GGUF 量化版
Hugging Face 用户 reaperdoesntknow 发布了 Qwen3.5-2B-CyberSec 的 GGUF 量化版本,便于在 llama.cpp 兼容运行时(含 Ollama)本地推理。该模型基于 unsloth/Qwen3.5-2B,并使用 Trendyol 网络安全指令微调数据集训练。发布方明确说明未提供基准测试或安全评估结果,并提示
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 用户 reaperdoesntknow 发布了 Qwen3.5-2B-CyberSec 的 GGUF 量化版本,便于在 llama.cpp 兼容运行时(含 Ollama)本地推理。该模型基于 unsloth/Qwen3.5-2B,并使用 Trendyol 网络安全指令微调数据集训练。发布方明确说明未提供基准测试或安全评估结果,并提示
Hugging Face 用户 reaperdoesntknow 发布了基于 Qwen/Qwen3.5-0.8B 的 GGUF 量化模型仓库 Qwen3.5-0.8-Cyber-GGUF,提供从 BF16 到 Q2 K L 的多档量化版本,面向本地推理与资源受限场景。仓库还包含一个 BF16 mmproj 多模态投影文件,但作者明确表示未验证端到端多模态路径
Deepseek 发布新模型 V4.1-Flash,通过大幅压缩 KV 缓存降低长文本处理成本:快速 GPU 内存中的缓存仅需前代 V4-Flash 约四分之一,永久卸载部分降至约八分之一,相比 V1 每 token 全局 KV 缓存缩小 437 倍。模型采用输入/输出计算拆分,读取输入时每 token 仅激活 80 亿参数、生成时激活 160 亿,并将主
另有 1 家信源报道
llama.cpp 发布 b10893 版本,主要变更是提高 Add fusion 测试的容差(#28691)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。
英伟达与Palantir宣布合作,用AI运行供应链,首个部署目标是英伟达自身覆盖数百万零件、数千供应商的全球供应链。Palantir将开源Nemotron模型集成到Foundry平台,供企业用自有运营数据微调,英伟达cuOpt负责场景规划与优化,系统可更早发现瓶颈、加速物料分配并评估替代方案,决策结果反哺模型持续改进。制造、制药、能源企业可通过Soverei
llama.cpp 发布 b10892 版本,主要变更是从 test-backend-ops.cpp 中移除 SYCL 的特殊处理逻辑(PR #28688)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CU
llama.cpp 发布 b10891 版本,针对 PowerVR GPU 的 Vulkan 后端修复了一个严重问题:Imagination 专有 Vulkan 编译器对使用仅子组归约(要求子组大小 =16)的反量化 mul mat vec 着色器返回 VK ERROR UNKNOWN,导致 k-quants、i-quants、TQ2 0、MXFP4、NVF
RAGFlow 发布 v0.27.2 版本,重构了 Agentic RAG 检索框架,显著提升推理速度与基准测试表现。新增知识编译运行时设置、知识编译流水线限流、Sitemap 数据源、WebDAV 自定义 CA 证书、MonkeyOCRv2 与自托管 PaddleOCR-VL 解析支持,以及 Sofya 搜索工具等。同时新增 Hubris 和 llmman
FunAudioLLM 在 Hugging Face 发布 Fun-ASR-Nano-2512-hf,这是 Fun-ASR-Nano 端到端语音识别模型的 Transformers 原生兼容版本,基于数千万小时真实语音训练,支持中文、英文、日文,中文覆盖 7 种方言组和 26 种地区口音。该版本无需克隆仓库或 trust remote code,可直接用 T
llama.cpp 发布 b10889 版本,主要改动是内存优化:在索引器场景下不再分配 V cache,因为该缓存实际未被使用(PR #28330,由 Stanisław Szymczyk 参与)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope
llama.cpp 发布 b10888 版本,主要变更是为 Vulkan 后端添加命令缓冲区(command-buffer)调试标签,以便 GPU 性能分析工具(profiler)识别和追踪。该改动由 gabby-zy 等人贡献,并借助 Claude Code 协助完成。同时该版本照例提供 macOS、Linux、Windows、Android 等多平台预编
Hugging Face 用户 handy-computer 发布了 UsefulSensors/moonshine-streaming-medium 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型是 245M 参数的编码器-解码器英语流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,在 LibriSpeech t
handy-computer 在 Hugging Face 上发布了 moonshine-streaming-small 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型源自 UsefulSensors 的 123M 参数流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,LibriSpeech test-clean
Hugging Face 用户 handy-computer 发布了 NVIDIA parakeet-unified-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的 FastConformer 编码器加 RNN-T 解码器的英文语音识别模型,支持离线与缓冲流式两种模式。量化版本在 Libri
Hugging Face 用户 handy-computer 发布了 NVIDIA nemotron-speech-streaming-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的缓存感知流式 FastConformer-RNNT 英文语音识别模型,支持离线与流式两种模式,并提供 F32
Ramp 发布的 2026 年 9 月 AI Index 显示,美国 AI 支出最高的企业 8 月人均 AI 支出中位数下降 9.7% 至 7205 美元。Ramp 首席经济学家 Ara Kharazian 认为部分下降源于 8 月工程师休假等季节性因素,同时代币价格下跌和向更便宜模型的迁移也在压低支出。每百万代币有效价格自 2026 年 3 月峰值已下跌
llama.cpp 发布 b10887 版本,主要变更为在 ggml-cpu 的 s390x 架构上为 q4 0 量化格式增加 repack 支持,并清理了相关注释。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、Op
llama.cpp 发布 b10886 版本,主要变更为在 ggml-cpu 的 s390x 架构上新增 Q1 0 向量内积(ggml vec dot q1 0 q8 0)的 intrinsic 支持,由 IBM 的 Aaron Teo 提交并同步更新了 Q1 0 的支持文档。该版本同时提供 macOS、iOS、Linux、Android、Windows 等
llama.cpp 发布 b10885 版本,主要修复了 Granite 系列模型的参数计数问题,包括补充 active experts 缺失的 A 前缀、修正代码对齐并移除未使用的 40 block 分支。该提交由 IBM 的 Aaron Teo 完成,同时该版本照例提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制
蚂蚁灵波开源了世界模型 LingBot-World 2.0 的轻量版,参数规模仅 1.3B,面向消费级单卡 GPU,可在本地实现实时世界生成。该版本并非由 14B 主模型裁剪而来,而是沿 Causal Pretrain、MoBA 注意力掩码、一致性蒸馏与 DMD 蒸馏的训练路线自然得到,并同时开放 Causal Pretrain 与双向 Teacher 上游