llama.cpp b10318 发布:同步 ggml 并更新多平台二进制
llama.cpp 发布 b10318 版本,主要同步了 ggml 更新,并提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。该版本还包含 UI 组件,但部分平台(如 macOS KleidiAI、openEuler)的构建
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10318 版本,主要同步了 ggml 更新,并提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。该版本还包含 UI 组件,但部分平台(如 macOS KleidiAI、openEuler)的构建
llama.cpp 发布 b10313 版本,主要更新为在 server 的路由器中新增 LRU 调度器,以优化请求排队和流式处理。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
TReNDS中心(佐治亚州立大学、佐治亚理工学院和埃默里大学的联合中心)在AWS上构建了一个自动化根因分析系统,结合Amazon CloudWatch订阅过滤器、AWS Lambda、Strands Agents SDK和Amazon Bedrock,实时检测错误、丰富日志上下文并生成AI驱动的根因分析。该系统通过让基础模型读取日志和源代码来加速故障排查,将
llama.cpp 发布 b10312 版本,主要更新是服务器路由器不再驱逐繁忙模型(PR #26567),并提供了适用于 macOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制文件。该版本还包含对 KleidiAI 和 openEuler 构建的禁用说明。
llama.cpp 现已支持多种小型 OCR 模型,可在低端设备(如 4GB VRAM 的 GPU 或 CPU)上运行。文章介绍了如何使用 llama-cli 和 llama-server 运行这些模型,并通过 REST API 集成到应用中。支持的模型包括 GLM-OCR、Deepseek-OCR 等,并提供了提示词格式、量化选择及减少幻觉的建议。
llama.cpp 发布 b10311 版本,修复了 Qwen3-TTS 生成时文本流重复输入的问题。该问题源于非流式预填充与流式覆盖层不匹配,导致模型在生成时重复读取文本。修复后,覆盖层改为与预填充匹配的单个 tts pad 行。
llama.cpp 发布 b10310 版本,主要修复了 aarch64 架构下 HWCAP 回退逻辑和 fp16 变体检测问题,要求 HWCAP ASIMDHP 支持 fp16 CPU 变体,并重命名 has fp16 va 为 has fp16。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,并支持多
Hugging Face 博客发布了一篇关于静态检索模型 Lattice 的文章。作者 ErikKaum 训练了 lattice-retrieval 模型,在 660M 精选查询/文档对上训练,BEIR 基准上 NDCG@10 达到 0.4749,优于参考模型。该模型仅 8MB,可在 8 核 M2 MacBook Air 上 7 分 26 秒嵌入整个英文维基
llama.cpp 发布 b10308 版本,主要修复了 Windows MSYS2 UCRT64 环境下 GCC 16.1.0 导致的崩溃问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Cloudflare 宣布将 AI Gateway 和 Workers AI 统一为一个 AI 控制平面,用户可通过单一入口(Workers binding 或 REST API)访问所有模型提供商,并获得可观测性、日志、计费和安全功能。新功能包括自动创建默认网关、使用 AI Gateway 积分支付 Workers AI 费用,以及未来将推出的模型优先路由
llama.cpp 发布 b10305 版本,主要更新是在 SYCL 后端支持 DeepSeek V4 的多个算子(LIGHTNING INDEXER、DSV4 HC COMB、DSV4 HC POST、DSV4 HC PRE),并更新了 ops.md 文档。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler
llama.cpp 发布 b10303 版本,主要修复了 SYCL 后端在 Intel Arc 770 上使用 FLASH ATTN EXT 时的错误。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端,如 CUDA、Vulkan、ROCm、OpenVINO 等。
Hugging Face 发布了 Carbon-3B,一个 3B 参数的生成式 DNA 基础模型,专注于真核生物,支持 32,768 个 6-mer 令牌(约 197k 碱基对)的上下文,并可扩展至 65,536 令牌。该模型在序列恢复、变异效应预测和基序扰动任务上可与 Evo2-7B 竞争,同时推理速度更快。Carbon 系列还包括 Carbon-8B 和
llama.cpp 发布 b10301 版本,主要修复了 CUDA 相关的未使用变量和函数警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO、SYCL 等。
本文提出持续学习正从参数中心化向系统级适应转变,通过When、How、Where三个维度分析这一演进。论文系统梳理了代表性方法,并讨论了该范式转变带来的挑战与未来方向。
OpenAI 更新了 ChatGPT 中的 GPT-5.6 模型,为 Plus 和 Pro 用户提供更专注的 GPT-5.6 Sol 及响应深度滑块,而免费用户将默认使用较小的 GPT-5.6 Luna,并获无限文本聊天。OpenAI 称新模型在事实准确性上显著提升,但免费用户无法访问前沿推理模型,引发质量差距担忧。
llama.cpp 发布 b10299 版本,修复了 Metal 后端中 kernel lightning indexer 因 MSL 矩阵类型缺少默认构造函数而导致的编译错误,改用 POD 数组并转换指针解决。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
rzgar 发布了 MiniMax H3 的 FP8 量化版本,包括 MXFP8、FP16attn 和 FP8 E4M3FN 等多种变体,并提供了文件下载。该模型支持图像到视频和音频生成,量化后文件大小从 47.6GB 降至 21GB,同时保留了关键张量的原始精度以保证质量。作者还提供了 ComfyUI 文本增强节点和超分辨率模型,以改善生成效果。
AMD 收购了 AI 芯片初创公司 Taalas,后者专注于定制 ASIC 技术。Meta 发布了 Muse Spark 1.2 模型,在基准测试中表现优异,并声称在多项 STEM 奥赛中达到金牌水平。OpenAI 统一了 ChatGPT 的模型,推出 GPT-5.6 Sol 和 Luna,并发布了 Agent Plugins 标准和 Codex 安全审查功
该研究提出了一种将工业推荐系统中的研究代理轨迹转化为可审计实验记录的方法,通过证据验证和声明限定确保结果可靠。实验表明,最终轮次常不如早期最佳结果,但完整流程生成的候选方案在在线测试中优于基线。