GLM-5.3-Flash W4A16 INT4 量化版发布,体积减70%
canada-quant 发布了 GLM-5.3-Flash 的 W4A16(INT4)量化版本,仅对 36,288 个路由专家 GEMM 做 GPTQ 对称 INT4 量化,注意力、路由、共享专家、嵌入、视觉塔和 MTP 头保持 BF16。模型体积从约 599 GiB 降至 177.7 GiB(-70%),可在 H100、H200、RTX PRO 6000
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
canada-quant 发布了 GLM-5.3-Flash 的 W4A16(INT4)量化版本,仅对 36,288 个路由专家 GEMM 做 GPTQ 对称 INT4 量化,注意力、路由、共享专家、嵌入、视觉塔和 MTP 头保持 BF16。模型体积从约 599 GiB 降至 177.7 GiB(-70%),可在 H100、H200、RTX PRO 6000
llama.cpp 发布 b11178 版本,集中修复 MUSA 后端(摩尔线程 MTT S5000 / PH1)的多个问题。改动包括:让 MUSA 使用 16 字节拷贝、启用 CUB 路径、采用上游代码路径、移除多余编译期守卫、在 PH1 上禁用 MMQ 路径,并修复 fused TOPK MOE 内核在 MUSA 上的死锁。修复后 27B 模型困惑度从
雷峰网AI科技评论梳理了梁文锋过去三年署名的11篇论文,涵盖DeepSeek LLM、DeepSeekMoE、DeepSeek-V2、DeepSeek-Coder-V2、DeepSeek-V3、DeepSeek-R1、NSA、mHC、DSpark及最新DSec等。文章称这些论文分别从数据配比、MoE架构、MLA注意力、代码能力、低成本训练、纯强化学习推理、硬
Anthropic 与 Akamai Technologies 签署了一份为期七年、价值 116 亿美元的云服务协议,并获得最多相当于 Akamai 5% 股份的认股权证。消息公布后 Akamai 股价盘后上涨 22%。此前 Anthropic 上月刚与 Nscale 达成 450 亿美元算力承诺,据报道其 11 个月内累计算力交易额已达 5170 亿美元。
另有 1 家信源报道
Mastra 发布 1.71.0 版本,为可观测性存储引入能力协商机制,服务器通过新接口暴露存储支持的可观测性 API,客户端可据此发现兼容端点而无需升级存储。同时新增 trace 聚合规划 API、工具参数完成即执行的流式优化、Discord 集成与沙箱凭证物化,以及 MongoDB 向量自动嵌入功能。此外包含一处破坏性变更,移除了 playground-
Langfuse 发布 v4.45.4 版本,包含两项改动:刷新助手内置的 Langfuse 技能,以及在 CI 密钥替换前跳过 Azure LLM 连接测试。该版本为常规维护性更新,未涉及新功能或重大变更。
n8n 发布 2.40.7 版本,主要修复了核心模块的一个问题:将项目级 span 属性传播到节点级 span。该修复涉及 PR #39457,属于可观测性/追踪相关的缺陷修正,不涉及新功能。
AgentionAI 在 Hugging Face 发布 Qwen3.8-27B 的 Agention Precision GGUF 量化包,基于 Qwen/Qwen3.8-27B 量化,采用非均匀分配与低损失纠错编码,兼容标准 llama.cpp 无需分支或额外参数,并包含视觉投影器和 MTP 草稿头。作者称在相同文件大小、速度和显存下,各档位量化相比 U
Viggle 在 Hugging Face 上发布了 Qwen-Image-2.1-viggle-turbo v0.2.1,这是基于 Qwen/Qwen-Image-2.1 的少步蒸馏 LoRA 适配器,采用分布匹配蒸馏(DMD)训练。它支持文生图和指令驱动编辑,仅需 6 次 transformer 前向(而非基座的 40 步)且无需无分类器引导,端到端约快
PydanticAI 发布 v2.50.0,引入 DecisionModel 基类以支持 Decisions 协议的路由决策,并调整了 ModelSelectionContext 的消息与提示结构。该版本新增 Gemini 3.8 Live 实时模型支持、OpenAI service tier 暴露及 RunContext.in durable contex
作者在 Hugging Face 发布了一个基于 MiniMax H3 的武打动作风格 LoRA(wushu action),使用 924 段精选武打片段、以全量 int8-convrot DiT 加 bf16 Qwen3-VL 文本编码器训练 1000 步,主打 ComfyUI 即插即用。作者表示该版本表现仍未达预期,计划继续整理素材并训练包含更多运动动作
西安交通大学利物浦大学的研究者提出 PTC-Bias,一个基于音素级时间竞争的两阶段上下文偏置框架,用于语音大模型(SpeechLLM)的稀有词识别。预填充阶段通过 PTC Retrieval 做帧同步音素解码与候选发音时间竞争,生成紧凑的偏置词候选表及对应语音区间;解码后 PTC Correction 在同一区间内对候选词与不匹配转写片段做二次局部竞争,实
该论文提出 OneTrans-V2,用单个 Transformer 统一工业推荐系统中的召回、粗排和精排三个阶段。它只编码一次用户行为序列作为共享上下文,各阶段保留自身候选特征与计算,并通过联合训练实现精排到粗排的模型内知识蒸馏。模型采用稀疏 MoE 扩展共享骨干、P-style 参数化稳定训练,并引入 DCGR 与 SNT。部署于大规模工业推荐系统后,GM
研究团队使用无第三方运行时依赖的 Zig 机器学习栈 numbat,从随机初始化预训练了 124.4M 参数的 GPT-2,在 9.91B token 网络文本上训练,并与 llm.c 的公开结果对比。其留出交叉熵为 3.2588(参考 3.29),HellaSwag 为 0.3053(参考 0.299),吞吐达 43,374 tokens/秒,高于 PyT
该论文提出 X-Rec,一种基于流匹配(flow matching)的生成式检索方法,直接在连续物品嵌入空间建模推荐分布,以规避 U2I 表达力不足和 SID-AR 量化误差、低吞吐的问题。X-Rec 引入锚点条件、黎曼流匹配和延迟交互扩散 Transformer 三项设计。在流式基准上,X-Rec 显著优于 U2I 基线,检索质量与 SID-AR 相当,推
该论文提出 Seek,一个无需训练的迭代式知识检索框架,通过在测试时多轮交互语料库来克服单次检索的局限。每轮由 LLM 生成伪段落扩展查询、检索器获取新候选、专用评估器给出分级相关性判断并指导后续轮次。在 TREC Deep Learning 上 Seek 匹配训练过的重排序器并提升 Recall@100;在 BRIGHT 上 Qwen2.5-7B 相对 B
RedHatAI 发布了 Qwen3.8-27B-NVFP4,这是对 Qwen/Qwen3.8-27B 的混合精度量化版本,采用 FP4/FP8 方案,MLP 投影量化为 FP4,注意力投影和最终 MLP 层量化为 FP8,KV 缓存量化为 FP8,语言模型头保持全精度。该模型使用 LLM Compressor 结合 AWQ 与 GPTQ 在 perfect
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认使用 MLX 运行器来运行受支持的模型架构。用户可通过 ollama pull 和 ollama run 命令直接使用,例如 qwen3.8。在 RC 阶段,团队将继续测试并启用更多模型。
llama.cpp 发布 b11175 版本,主要变更为在 Hexagon 后端新增 q5 k 量化类型支持(PR #29123)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。此次更新提升了高
llama.cpp 发布 b11174 版本,主要变更是为 Hexagon 后端在连续 dim1 的 CONCAT 操作中引入 DMA,并针对 DMA64 更新了 CONCAT DMA 实现。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROC