moonshine-streaming-medium 的 GGUF 量化版发布
Hugging Face 用户 handy-computer 发布了 UsefulSensors/moonshine-streaming-medium 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型是 245M 参数的编码器-解码器英语流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,在 LibriSpeech t
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 用户 handy-computer 发布了 UsefulSensors/moonshine-streaming-medium 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型是 245M 参数的编码器-解码器英语流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,在 LibriSpeech t
handy-computer 在 Hugging Face 上发布了 moonshine-streaming-small 的 GGUF 量化版本,用于 transcribe.cpp 推理框架。该模型源自 UsefulSensors 的 123M 参数流式语音识别模型,提供 F32、F16、Q8 0 三种量化格式,LibriSpeech test-clean
Hugging Face 用户 handy-computer 发布了 NVIDIA parakeet-unified-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的 FastConformer 编码器加 RNN-T 解码器的英文语音识别模型,支持离线与缓冲流式两种模式。量化版本在 Libri
Hugging Face 用户 handy-computer 发布了 NVIDIA nemotron-speech-streaming-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的缓存感知流式 FastConformer-RNNT 英文语音识别模型,支持离线与流式两种模式,并提供 F32
Ramp 发布的 2026 年 9 月 AI Index 显示,美国 AI 支出最高的企业 8 月人均 AI 支出中位数下降 9.7% 至 7205 美元。Ramp 首席经济学家 Ara Kharazian 认为部分下降源于 8 月工程师休假等季节性因素,同时代币价格下跌和向更便宜模型的迁移也在压低支出。每百万代币有效价格自 2026 年 3 月峰值已下跌
腾讯云 AI 团队在开发者社区介绍其文档智能教育产品线,将作业批改链路拆为切题、识别、批改、回显四步,并封装为试题批改 Agent 与作文批改 Agent,覆盖 K12 全学科及中英文手写作文,输出正误、得分、知识点与错误坐标等结果。作文批改走异步接口(SubmitMarkEssayAgentJob),默认并发限制 2 次/分钟,底座为千亿参数多模态大模型与
llama.cpp 发布 b10887 版本,主要变更为在 ggml-cpu 的 s390x 架构上为 q4 0 量化格式增加 repack 支持,并清理了相关注释。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、Op
llama.cpp 发布 b10886 版本,主要变更为在 ggml-cpu 的 s390x 架构上新增 Q1 0 向量内积(ggml vec dot q1 0 q8 0)的 intrinsic 支持,由 IBM 的 Aaron Teo 提交并同步更新了 Q1 0 的支持文档。该版本同时提供 macOS、iOS、Linux、Android、Windows 等
阿里巴巴集团旗下高德于9月10日正式发布全球首个3D原生城市世界模型ABot-Earth 0.7,采用3D原生技术路径,可端到端一次性生成3DGS格式的城市场景,覆盖超过196个国家和地区。该模型仅需10分钟即可在消费级GPU上生成公里级3D城市场景,效率比传统模式提升1000倍,支持从星球到街景的全尺寸连续生成与实时交互。高德称其核心价值是让数字地球成为空
llama.cpp 发布 b10885 版本,主要修复了 Granite 系列模型的参数计数问题,包括补充 active experts 缺失的 A 前缀、修正代码对齐并移除未使用的 40 block 分支。该提交由 IBM 的 Aaron Teo 完成,同时该版本照例提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制
蚂蚁灵波开源了世界模型 LingBot-World 2.0 的轻量版,参数规模仅 1.3B,面向消费级单卡 GPU,可在本地实现实时世界生成。该版本并非由 14B 主模型裁剪而来,而是沿 Causal Pretrain、MoBA 注意力掩码、一致性蒸馏与 DMD 蒸馏的训练路线自然得到,并同时开放 Causal Pretrain 与双向 Teacher 上游
OpenAI发布新一代生图模型ChatGPT Images 2.5,主打生成更快、细节更好、改图更可控。相比Images 2.0,生成延迟最多降低50%,新增xhigh和max质量档位,并支持在图片上直接批注修改、用草图作为参考图以及多轮编辑一致性。面向开发者同步推出GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst两个AP
另有 2 家信源报道
DeepSeek 正式发布 DeepSeek-V4.1-Flash 模型,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,并公布了 GPQA Diamond、HLE、Codeforces 等多项基准成绩。该模型已同步上线 DeepSeek API,调用模型名改为 deepseek-flash,旧版 V4 Flash 与 V4 Flash
另有 1 家信源报道
OneBit AI 发布技术研究报告,将后训练三值化(ternarization)流水线从 Qwen3-4B 扩展到 Qwen3-8B,采用 KOTMS 旋转、E2M-ATQ 自适应三值化和 GPTQ 式误差补偿的权重-only A16 配置。8B 模型在三语料困惑度比为 1.361,八项零样本任务平均准确率 64.6%(FP16 为 72.4%),机会校正
该论文研究动态稀疏专家混合(SMoE)推理中减少激活专家数量带来的分布偏移问题。作者发现减少激活专家会持续增大SMoE输出的RMS尺度和方差,导致表示不匹配,进而造成下游性能下降,而这一损失不仅源于专家容量减少。为此提出层间分布对齐(LDA),一种无需重训练的轻量级推理时校正方法,利用逐层校准统计量对齐降路由表示与默认配置,在多个SMoE大模型和基准上恢复了
该论文提出 Constrained Hybrid Decoding (CHyD),一种面向推测式检索增强生成(speculative RAG)的「忠实优先」解码范式。传统推测解码以推理效率为目标,而 CHyD 在模型进入抽取模式时施加硬解码约束,将生成限制为检索文档中连续且逐字存在的片段,从而保证输出中任何引用片段都逐字来自上下文。作者在多种抽象式、抽取式和
该论文提出 X-CoSD,一种面向设备端小模型与服务器大模型词表不一致场景的协作式推测解码框架。现有 CoSD 方法假设双方共享词表,且残差重采样需要交换词表上的概率分布,导致通信开销大。X-CoSD 通过混合重采样(HR)仅在公共词表区域传输分布,并进一步提出 X-CoSD-E,由服务器只发送替换候选及其概率供设备本地验证。论文证明两者均保持服务器 LLM
研究者提出 LiteRAG,一种基于图的检索增强生成方法,用查询条件驱动的算法探索和推理链上下文构建替代检索时昂贵的 LLM 控制。在 DistComp 多跳检索基准上,LiteRAG 取得最高整体质量(0.798),相比 GraphRAG Global 和 DRIFT 将单查询延迟降低超过 100 倍、成本降低超过 99%;在 UltraDomain 上与
该论文提出 Osprey,一种目标无关的预训练方法,用于提升推测解码中草稿模型的泛化能力。现有草稿模型通常针对单一目标模型训练,工作负载变化时接受率会急剧下降。Osprey 利用现成预训练小语言模型,通过剪枝、目标无关的下一词预训练、词汇对齐、零初始化 QKV 扩展和蒸馏,实现跨目标模型迁移。实验显示,单个预训练 Osprey 骨干在 Qwen3-8B、Ll
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-VL-4B-Thinking 仓库,将 Qwen 的 40 亿参数稠密视觉语言模型 Qwen3-VL-4B-Thinking 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LL