llama.cpp b10434 发布:支持 reasoning effort 传递
llama.cpp 发布 b10434 版本,主要更新是在聊天功能中传递 reasoning effort 参数,并将其存储到 common chat templates inputs 中,供 Jinja 模板使用,同时支持模型特定的翻译。该版本还修复了服务器端从请求体读取 reasoning effort 的问题,并提供了多平台(macOS、Linux、W
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1723 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10434 版本,主要更新是在聊天功能中传递 reasoning effort 参数,并将其存储到 common chat templates inputs 中,供 Jinja 模板使用,同时支持模型特定的翻译。该版本还修复了服务器端从请求体读取 reasoning effort 的问题,并提供了多平台(macOS、Linux、W
geceff 在 Hugging Face 上发布了 Wan2.2 自定义 GGUF 模型仓库,针对 NVIDIA Tesla T4 等显存受限环境优化,提供量化模型、LoRA、文本编码器和 VAE。仓库包含高/低噪声量化模型及集成 SVI 和一致人脸功能的 FP8 模型,并给出了 ComfyUI 推荐参数和不同硬件的使用建议。
llama.cpp 发布 b10433 版本,主要同步了 ggml 底层代码。该版本提供了涵盖 macOS、Linux、Windows、Android 及 openEuler 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。部分平台构建(如 macOS KleidiAI、Ubuntu RO
llama.cpp 发布 b10431 版本,主要更新为 ggml ssm scan 支持循环状态回滚(recurrent state rollback),并支持 K 1 的情况,覆盖 CPU 和 CUDA 后端。该功能有助于提升状态空间模型(如 Nemotron)在推理时的效率。
魔搭 ms-swift 发布 v4.5.0 版本,新增对 Qwen3.8、NVIDIA Nemotron 3.5 Lightning 和 Meta Muse Glimmer 等模型的支持,并改进推理、训练和 RLHF 功能。该版本还修复了多个 bug,并支持 OpenAI 和 Anthropic 消息处理器。
AWS 展示了如何将 SageMaker AI 上的 OpenAI 兼容端点与 Bedrock AgentCore 运行时结合,构建多智能体工作流。该架构通过 Bedrock AgentCore 容器连接编排器(Claude Haiku 4.5)、预算智能体(Claude Sonnet 4.6)和财务分析智能体(Qwen 3.5 9B),实现成本优化、数据驻
阿里巴巴正式开源Qwen3.8-27B模型,该模型为原生多模态稠密模型,支持262K原生上下文,可通过YaRN技术扩展至1M tokens,在编程和办公场景性能大幅提升,并新增reasoning effort功能。模型以Apache 2.0协议开放权重,所有人可免费下载、部署和商用。目前千问已累计开源460余个模型,全球下载量超30亿次。
另有 1 家信源报道
Hugging Face 2026年夏季报告显示,开放模型数量持续增长,但下载分布极不均衡。中国实验室在超大模型发布上领先,而美国硬件公司如AMD和NVIDIA成为开源模型发布主力。下载量与点赞量反映不同价值,前沿模型受关注但小模型被广泛使用。
阿里千问于8月14日晚正式开源Qwen3.8系列模型,其中Qwen3.8-27B为原生多模态稠密模型,仅270亿参数,性能超越Qwen3.7-Plus,在编程和办公场景表现出色,支持消费级显卡量化部署,采用Apache2.0协议。此前旗舰模型Qwen3.8-Max也已开源权重。阿里累计开源460余个模型,Qwen全球下载量超30亿次,衍生模型超30万个,稳居
法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现更快的AI推理速度,其技术预览在Hacker News上引起关注,并获得了200个商业线索。Kog计划在9月前将首个大型模型推理速度提升10倍,以吸引投资并推动业务发展。
OpenAI 推出 GPT-5.6 Sol 的“Ultrafast”模式预览,通过 Cerebras 硬件实现每秒 750 个输出 token,速度提升 14 倍。该服务初期仅通过 API 向特定客户提供,并计划逐步扩大。OpenAI 旨在将小模型的速度与大模型的推理能力结合,应用于事件响应、金融、客服、电商和研究等场景,同时通过分层定价将速度作为盈利杠杆。
Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,支持本地运行,兼容 stablediffusion.cpp 和 Unsloth 平台。该模型能生成带原生立体声音频的视频,最长 15 秒、24 FPS、32 kHz 音频。提供两种去噪器变体(fl2va 和 ref2va)及多种量化等级,并附有使用示例和许可证说明。
llama.cpp 发布 b10430 版本,主要更新是允许虚拟 iGPU 设备(PR #26953)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台(如 macOS KleidiAI、Ubuntu R
llama.cpp 发布 b10429 版本,主要更新是允许在 llama decode() 期间访问 /metrics 和 /slots 端点,通过重构 server queue 的 worker 逻辑,在 yield to queue 中调用 llama decode 并处理 process mtmd chunk。该版本提供了多平台预编译二进制文件,包括
joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本(curve 形式),基于 MiniMax 的剪枝检查点构建,体积比原版小约 40%,Q8 0 版本可适配 24GB 显存。该版本通过分解 adaln 调制矩阵实现压缩,在 ComfyUI 0.30.0 及以上版本中运行,并提供了与原始版本的渲染对比数据。
joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本,支持在 ComfyUI 中运行,并提供 fl2va 和 ref2va 两种模型。该版本解决了 ComfyUI-GGUF 的架构识别问题,并提供了多种量化选项以适应不同显存。此外,还提供了剪枝版本的替代方案,并解释了 K-quants 不可用的原因。
太初元碁承办国家级“AI+教育”大赛中的“AI+加速卡模型适配赛道”,面向全国开发者招募,提供免费国产算力资源和算子开发Agent工具,要求参赛者完成模型在自研加速卡上的适配优化。该赛道旨在推动国产算力生态落地和AI人才培养,报名截止至2026年10月15日。
llama.cpp 发布 b10428 版本,主要更新是清理了示例文档和测试中的个人主目录路径,替换为通用占位符。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。部分平台构建(如 KleidiAI、ROCm、openEuler)被标记为禁用。
llama.cpp 发布 b10427 版本,主要更新为在 SYCL 后端融合了 q4 K 密集 FFN 的 mul mat(gate)、mul mat(up) 和 GLU 操作。在 Arc Pro B70 上,qwen2.5-3B 和 gemma-2-2b 的推理速度分别提升 2.8% 和 2.0%,批处理场景下最高提升 12.4%。该版本同时提供了多平台
Langfuse 发布 v4.11.0 版本,包含多项功能改进和修复。主要新增功能包括:在 trace 中如实展示超过加载上限的观测数据、暴露迁移观测证据、为应用内代理增加后台会话活动提示和 toast 卡片、为通过第三方提供商集成的旧 SDK 项目引入强制 v3 体验、使 Markdown 渲染字符限制可配置、在会话中显示现有标注计数,并在 v4 迁移侧边