llama.cpp b10742 发布:为 A18 Pro 添加 fa-vec 调优
llama.cpp 发布 b10742 版本,主要更新是为 A18 Pro 芯片(MacBook Neo)添加 fa-vec 调优。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10742 版本,主要更新是为 A18 Pro 芯片(MacBook Neo)添加 fa-vec 调优。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10741 版本,主要修复了在调用 n layer() 之前加载 hparams.n layer nextn 的问题,并移除了重复加载。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、CUDA 等。
Empirik 是一家由 Sequoia Capital 孵化的初创公司,专注于利用 AI 预测基础设施故障,于周二宣布获得 2100 万美元种子轮融资,投资方包括 Sequoia、Canapi 和 Alumni Ventures。该公司的产品通过跟踪系统变更并推断其潜在影响,帮助 DevOps 和 SRE 团队预防中断。Empirik 已拥有包括 S&P
LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 GGUF 版本,采用其自研的 Genesis 算法对张量进行噪声修复,声称能提升模型稳定性和指令遵循能力。该模型融合了 Hermes 微调数据,支持多语言和视觉任务,并提供了量化脚本和推荐配置。
llama.cpp 发布 b10740 版本,主要修复了 Metal 后端因缺少 autoreleasepool 导致的内存泄漏问题,并进行了变量重命名和警告修复。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持多种硬件加速后端。
NVIDIA 技术博客发布了一篇关于 AI 推理 GPU 规模规划与 TCO 优化的实用指南。文章提出了一个框架,帮助组织根据实际工作负载(如用例、令牌模式、延迟目标、并发度、缓存命中率等)来选择合适的 GPU 资源,避免过度配置。文中介绍了核心-弹性(core-and-flex)容量策略,并讨论了量化、剪枝和蒸馏等模型优化技术,以在提升性能的同时降低总拥有
llama.cpp 发布 b10738 版本,主要更新为支持 SYCL 后端将主机固定内存的最大分配限制在 2GB 以内。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端如 CUDA、Vulkan、ROCm 等。
ISTA-DASLab 发布了 Qwen3.8-27B 的 GSQ-RCO GGUF 量化版本,提供四种非均匀量化文件及视觉投影器,支持多模态使用。这些量化通过 GSQ 和 RCO 方法实现,在保持任务无损的同时显著减小模型体积,并兼容 llama.cpp、Ollama 和 LM Studio。
llama.cpp 发布 b10737 版本,主要针对 qwen4exp 架构进行修复,包括序列并行、块位置键控、多模态输入、CUDA 中止等问题,并新增了序列状态保存/恢复的测试。该版本还禁用了 qwen4exp 的 -sm tensor 支持,并提供了 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10736 版本,主要修复了 test-llama-archs 测试的日志详细度问题,并提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
MiniMax联合fal推出视频生成模型H3 Max,生成5秒768p视频仅需不到3秒,吞吐量约为原版H3的35倍,并在Artificial Analysis和Design Arena榜单上获得图生视频第一。基于该模型,开发者们创建了实时AI直播和AI版短视频应用,实现了视频的实时生成与无缝衔接。H3 Max的开源生态已形成,衍生模型超300个,全球下载量达
MoziAI团队发布了MoziAI-35B-V3.8,一个基于Ornith-1.5-35B-A3B的开源多模态AI模型,支持本地部署,大小仅15.9GB。该模型集成了动态七维思考框架、Agent LOOP迭代机制、MoziSmartBit混合量化算法,并针对金融领域优化,支持免费商用。
Langfuse 发布 v4.27.0 版本,新增多项功能,包括为追踪 IO 解析器添加功能开关、自托管 API 规范渲染器、缓存输入令牌和成本、MCP 评估器测试工具、多模态输入支持,以及为 Claude 在 OpenAI Responses 网关后添加提示缓存断点。同时修复了多个问题,如输出令牌截断、分析导出 URL 检查、提示版本指标维度等。
Baekpica 发布了 Qwen3.8-Flash-Next 的混合量化 GGUF 模型,采用 SSD-PLE 技术将 51.2B 参数的预测性潜在嵌入表移至 SSD,以 BF16 存储,从而将显存预算分配给 128.8B 参数的计算主干。在单个 NVIDIA DGX Spark 上,Q5 变体实现了 606.4 tok/s 的中位冷预填充速度和 28.3
llama.cpp 发布 b10733 版本,主要更新为将 CI 中的 ccache-action 升级至 v1.2.24。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
雷峰网发布万字长文,拆解DeepSeek V4 Pro与Harness框架。文章通过实测发现,V4 Pro在Terminal Bench等agentic任务上大幅提升,但相比Flash性价比不高,且其1M上下文是通过YaRN外推实现,但实测未衰减。DeepSeek通过缓存优化和定价策略控制成本,并开源Harness框架,强调后训练成为旗舰模型升级主战场。
LMDeploy 发布 v0.17.0 版本,集成了 DeepEPv2,支持 Kimi K2.6 和 mooncake store,并优化了 GLM-5.2 服务性能。该版本还引入了服务端 fan-out、PDL 分页注意力、FP8 MoE 优化等改进,并修复了多个 bug。
lukaskremla 发布了 Qwen3.8-27B 的 3-bit MLX 量化版本,该版本移除了视觉塔,仅保留文本生成能力。模型基于 Qwen/Qwen3.8-27B,使用 mlx-lm 0.31.2 转换,支持长上下文、多语言、推理和工具使用等功能。
lukaskremla 发布了 Qwen3.8-27B 的 2-bit MLX 量化版本,该版本移除了视觉塔,仅保留文本生成能力。模型基于 Qwen/Qwen3.8-27B,使用 mlx-lm 0.31.2 转换,采用 2-bit 权重量化(RTN,group-size-64),支持长上下文、多语言、推理和工具使用。用户可单独下载 MTP 头,另有支持视觉的
Stability AI 发布了 Stable Audio 3 Optimized,这是一系列针对特定硬件加速优化的实验性检查点,基于潜在扩散模型,支持可变长度音频生成和编辑。模型在 H200 GPU 上生成音频不到 2 秒,在 MacBook Pro M4 上仅需几秒,并提供了 TFLite/LiteRT 优化 CPU 运行时。该模型使用 T5Gemma