llama.cpp 发布 b10926:优雅处理不支持的 tq1 0 量化
llama.cpp 发布 b10926 版本,主要变更是由贡献者 syscl 提交的补丁,使程序能够优雅地处理不支持的 tq1 0 量化格式(PR #28681)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVIN
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1716 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10926 版本,主要变更是由贡献者 syscl 提交的补丁,使程序能够优雅地处理不支持的 tq1 0 量化格式(PR #28681)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVIN
llama.cpp 发布 b10924 版本,修复了 server 中 router 子进程状态命令的解析问题。由于子进程状态命令写在 stdout、日志写在 stderr 且共用同一管道,日志的尾部颜色重置转义序列会粘在下一条命令前,导致行前缀检查失败、命令被当作日志行转发,使已完成的下载卡在 downloading 状态。修复方式是在命令前加换行符,确保
llama.cpp 发布 b10923 版本,主要修复了 OpenCL 后端导致程序中止的若干 bug(PR #27630)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。
llama.cpp 发布 b10922 版本,主要变更是为 OpenCL 后端新增了一个 A8 Q4 K 非 MoE 二值化 GEMM 内核 kernel gemm noshuffle q4 k f32 32b trans ila a8 bin,并修复了布局兼容性、重命名了二值内核选择辅助函数。该提交由高通工程师 Li He 参与贡献,同时发布了覆盖 mac
llama.cpp 发布 b10921 版本,主要修复 WebGPU 后端张量绑定对齐问题:将绑定偏移回退到与张量距离为整数个块的位置,使块量化视图在着色器中获得有效的元素偏移。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。
llama.cpp 发布 b10920 版本,主要新增 Hexagon 后端对多设备模型切分(row-split)的支持,由高通工程师参与贡献。该更新涵盖融合算子工作切分、多设备状态管理、fence 与同步机制、内存缓冲处理以及 ALLREDUCE 错误处理等大量修复与重构,并同步更新了开发者文档。此举使 llama.cpp 能在多设备场景下更高效地分配推理
DeepSeek 发布开源旗舰模型 V4.1-Flash,采用全新的因果编码器-解码器架构,总参数 763B,输入/prefill 激活 8B、输出/decode 激活 16B,支持 1M 上下文与文本+图像输入,MIT 许可。Artificial Analysis 测得其在智能指数上以 40 分超过 V4 Pro 0813,定价为每百万输入 token 0
llama.cpp 发布 b10919 版本,主要更新是将 ggml-webgpu 后端升级到较新版本的 Dawn,并移除了模块扫描。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
Hugging Face 用户 nerkyor 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-EfficientThink-Uncensored,采用 SFT 和 SimPO 训练,并集成 DFlash2 推测解码。该模型提供 GGUF 多级量化(Q2 至 Q8)及 NVFP4 量化版本,附带 GPQA、MMLU、LCB 基准测试分
Simon Willison 的博客引用 Mohamed Moustafa 的观点,指出 OpenRouter 虽以自动故障转移和成本优化为卖点,但不同后端提供商使用不同的服务软件、优化和设置,导致同一端点上的模型行为不一致,部分提供商甚至不支持视觉模型的视觉能力,推理强度选项的处理方式也存在差异。用户可通过 provider.only 选项控制路由,并用
AgentionAI 在 Hugging Face 发布了 Qwen/Qwen3.8-Flash-Next 的 Agention Precision (AP) GGUF 量化版本,兼容主线 llama.cpp,无需 fork。该系列提供从 AP-Q5 K XL 到 AP-IQ2 S 共 7 个量化档位,按每 GiB 显存精度优化,并给出各档位的 KL 散度与
DSPy 发布 3.4.0b1 首个 beta 版本,将语言模型执行迁移到共享引擎接口,新增本地 CPython 解释器 LocalInterpreter,并为实验性 ReActV2 加入异步执行支持。该版本还引入 GEPA 自定义 Flex 代码提案,并修复评估、流式传输和示例采样相关缺陷。官方强调这是预发布版本,API 和行为在稳定版前可能变化,3.4
llama.cpp 发布 b10917 版本,修复了此前在 MSVC 下为 llama-server 启用预编译头(PCH)时引入的构建问题,该修复跳过 MSVC 场景下的 PCH。此次发布同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
Vercel AI SDK 发布 @ai-sdk/xai@4.0.58 补丁版本,修复了不支持批量请求类型被错误接受的问题,并新增批量图像生成请求支持。同时修复了 DeepSeek 在空工具调用增量下推理流丢失的问题,并更新了 @ai-sdk/provider 与 @ai-sdk/provider-utils 依赖。
CMSManhattan 在 Hugging Face 发布 JiRack Ultra 1B 模型,这是一个约 1.5B 参数、面向 CPU 推理优化的三元(BitNet 风格)模型,基于重新设计的 DeepSeek R1 架构,并提供 GGUF 量化版本。模型更新了分词器,新增 Routing、Tool call 和 Robotics 标签,支持通过 Ll
Together AI 发布博客,系统梳理开源 AI 技术栈,将其拆解为模型、推理、网关与路由、Harness、工具(Skills 与 MCP)五个相互独立的层次。文章指出开源模型质量已接近闭源模型,开发者无需自行训练模型或购置 GPU 即可迁移,并强调分层解耦让开发者能快速切换新模型。文中以 Kimi K3(1.8T 总参数、104B 激活参数)和 GLM
AWS Machine Learning Blog 发布一篇技术文章,介绍一个开源基准测试工具 openai-on-aws/benchmarks-openai,用于在 Amazon Bedrock 上对比 OpenAI 模型(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol)与 OpenAI API 上两个高性价比模型(gpt-5
LangChain 发布 langchain-core 1.6.3 版本。该版本新增功能:允许基于网关响应覆盖模型名称和提供商的追踪元数据;同时补充了针对已废弃 .text() 访问路径的测试,并清理了 FileCallbackHandler. write 与 ChatGeneration.set text 文档中过时的 Args/Raises 条目。此次更
RunningHub 开源了 MiniMax H3 视频生成加速方案 H3 Lightning,通过 RH 后训练加速模型将生成步数从 50 步压缩至 9 步,并叠加 SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行优化,在 4 张 RTX 6000D 上把 5 秒视频生成耗时从 348.8
另有 1 家信源报道
NVIDIA 推出 Personal AI Router(PAIR)测试版,可将局域网内多台电脑的推理能力聚合,自动把 AI 请求分发到各节点,主要面向本地多智能体工作负载。PAIR 通过代理接收请求、识别引擎与模型需求并选择合适节点执行,兼容 Ollama 和 LM Studio,无需改动现有架构。NVIDIA 演示显示,结合 RTX Spark、DGX