ZeroDigest 发布 Qwen3.8-27B 架构感知量化系列,支持多 token 预测
ZeroDigest 实验室发布了基于 Qwen3.8-27B 的架构感知量化模型系列 Qwen3.8-27B-YMQ-MTP-GGUF,使用自定义 YMQ-Compiler v2.0 进行混合精度量化,支持多 token 预测(MTP)和高上下文优化。该系列提供从 XXS 到 XL 多个预设,针对不同 VRAM 容量优化,并公布了 WikiText-2 困
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
ZeroDigest 实验室发布了基于 Qwen3.8-27B 的架构感知量化模型系列 Qwen3.8-27B-YMQ-MTP-GGUF,使用自定义 YMQ-Compiler v2.0 进行混合精度量化,支持多 token 预测(MTP)和高上下文优化。该系列提供从 XXS 到 XL 多个预设,针对不同 VRAM 容量优化,并公布了 WikiText-2 困
ZeroDigest 实验室发布了基于 Qwen3.8-27B-Uncensored 的 GGUF 量化模型系列,采用其自研的 YMQ-Compiler v2.0 框架进行架构感知的混合精度量化,支持多 token 预测(MTP)推测引擎。该系列提供从 XXS-Pro 到 XL 的多个预设档位,覆盖 9.3GB 至 17GB 以上的显存需求,针对代码生成和智
llama.cpp 发布 b10763 版本,默认启用 preserve reasoning 聊天模板参数,并记录其有效状态。该参数可通过 --reasoning-preserve / --no-reasoning-preserve 显式控制,若未指定则默认开启,服务器会记录有效状态并给出相应警告。同时,通过 --chat-template-kwargs 设
llama.cpp 发布 b10762 版本,主要更新是支持 DeepSeek-V4-Flash-Vision-Exp 模型,包括处理最小/最大 token 数、使用 GGML ROPE TYPE VISION 等。该版本提供了多平台预编译二进制文件,涵盖 macOS、Linux、Windows、Android 等。
在Hot Chips 2026大会上,谷歌披露了第八代TPU技术细节,包括面向推理的TPU 8i和面向训练的TPU 8t。TPU 8i配备288GB HBM和384MB SRAM,采用Boardfly拓扑降低延迟;TPU 8t通过Virgo网络和光交换支持超大规模训练,能效达前代2倍。谷歌还利用AI优化芯片设计,并强调软件兼容性。
NVIDIA 技术博客发布系列文章第三篇,探讨通过投机解码加速 LLM 推理同时保持准确性。文章提出五条指南,用于在帕累托前沿选择草稿长度和机制,并分析了草稿长度对 GEMM 计算强度、注意力内核利用率及 KV 缓存压力的影响。
FuriosaAI 发布了 Solar-Open-100B-NVFP4A16,这是对 Upstage 的 Solar-Open-100B 模型进行 NVFP4A16 量化后的版本,并提供了在 FuriosaAI RNGD 硬件上运行的 Furiosa Executable Bundle。该模型支持推理和工具调用,可通过 Furiosa-LLM 服务器以 Op
OpenAI 将其即将推出的 Astra 模型评为首个具有“严重”网络攻击能力的系统,同时声称这是其构建的最安全模型。内部测试显示 Astra 在漏洞利用基准上表现优异,并发现了两个零日漏洞。为应对风险,OpenAI 计划推出新的安全措施,包括监控模型的思维链,但该技术可能因模型内部推理的不可见性而存在局限。
另有 1 家信源报道
Swiggy 开发了内部预测客户终身价值(pLTV)模型,用于在客户首次下单前估算其长期价值,以优化广告竞价。该模型使用超过350个特征和简单的多层感知机架构,通过引入辅助任务将参数减少63%,同时提高了准确性。在生产中,Swiggy 将该信号用于 Google 的 tROAS 竞价,并进行了与第三方平台的 A/B 测试,结果显示其模型在留存率和总订单价值上
Langfuse 发布 v3.225.7 版本,包含多项修复和安全改进。主要修复了 OTel 原型链污染、blob 存储键冲突、ClickHouse 时间戳插入等问题,并增强了 API 密钥管理、JWT 会话时长和日志脱敏等安全措施。这些更新旨在提升系统稳定性和安全性。
VnimanieAI 发布了 Qwen3.8-Flash-Next 的 INT4 量化版本,这是该模型首个公开的 INT4 量化,可在消费级 Ampere GPU(如 RTX 3090)上运行,而官方 FP8 版本不支持这些 GPU。量化采用 W4A16 格式,模型大小从 335GB 降至 168GB,通过 vLLM 部署,支持专家并行和 MTP 推测解码。
燧原科技于9月2日开启科创板新股申购,发行价142.18元/股,腾讯、小米、兆易创新等参与战略配售。公司聚焦云端AI芯片,营收快速增长,预计募集资金61.19亿元用于新一代AI芯片研发。此次IPO将助力其产品规模化销售,满足AI算力需求。
llama.cpp 发布 b10760 版本,主要修复了 Qwen3-TTS-0.6B 模型在 mtmd 架构下的两个问题:一是将代码预测器的 proj in 权重设为可选加载,二是将 ffn down 层保持为 F32 精度,避免因 F16 溢出导致 NaN。该版本提供了多平台二进制文件,包括 macOS、Linux、Windows、Android 等。
mradermacher 发布了 DeepSeek-Coder-V2-Lite-Instruct-abliterated 模型的 GGUF 量化版本,该模型基于 criscar22 的 abliterated 版本。提供了从 Q2 K 到 Q8 0 的多种量化格式,并推荐 Q4 K M 和 Q8 0 等。这些量化文件便于在本地部署,降低了运行门槛。
llama.cpp 发布 b10759 版本,主要修复了 ggml 中 KleidiAI 缓冲区类型初始化在调度时的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。
智元机器人在2026年世界人形机器人运动会上获得46枚奖牌,其中18枚金牌,所有参赛机器人均为量产机。其灵巧手OmniHand包揽了8个灵巧手专项比赛中的7块金牌,精灵G2在场景赛中获得6块金牌。智元的技术核心为“三智一体”架构,并已在工厂实现大规模部署,任务成功率达99.99%。
llama.cpp 发布 b10757 版本,主要改进是 Vulkan 后端对 IQ3 S 矩阵向量乘法在大批量( 4)场景下的处理效率,当 n=8 时性能提升 5 倍。该版本同时提供了适用于多个平台和硬件加速器的预编译二进制文件。
CrashOverrideX 团队发布了 Quillan-Ronin v5.4.0-oni,一个面向消费级硬件的多模态分层网络混合专家模型,采用 BitNet 1.58-bit 三元量化、33 专家 MoE 和 9 向量语义棱镜等架构。该模型基于多个基础模型合并而成,支持文本、图像、音频和视频,并具备代理执行能力。模型目前处于训练暂停状态,最新检查点损失较高
阿里 FunASR 发布 v1.4.13 版本,主要修复了 ONNX 运行时错误、NumPy 2 ABI 不匹配等问题,并新增了对 n8n OpenAI 音频转录的支持以及 Qwen3-ASR 的离线 vLLM 示例。该版本还提供了多平台的 llama.cpp/GGUF 运行时预编译二进制文件,方便用户快速部署语音识别模型。
llama.cpp 发布 b10754 版本,主要修复了 OpenCL 后端在 Adreno 图像内核中的越界读取问题,包括对 q4 K 解码 GEMV 的取行进行钳制,以及强制 KQ/KQV GEMM 的平铺契约。该版本提供了适用于多种平台和硬件的二进制文件,如 macOS、Linux、Windows、Android 等。