llama.cpp b10229 发布:修复 OpenCL 引用计数问题
llama.cpp 发布 b10229 版本,主要修复了 OpenCL 后端中 ggml backend opencl init() 未正确递增 ref count 的 bug,该问题会导致程序结束时 profiling 数据无法刷新写入。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10229 版本,主要修复了 OpenCL 后端中 ggml backend opencl init() 未正确递增 ref count 的 bug,该问题会导致程序结束时 profiling 数据无法刷新写入。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布了 b10228 版本,主要更新是支持 DeepSeek V4 的 MTP(多 token 预测)和 DSpark 特性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。
Meta AI 研究人员提出了一种双智能体记忆系统,通过一个独立的记忆智能体监控任务进度,并在适当时机向主智能体发送提醒,以解决长任务中的行为状态衰减问题。该系统在 Terminal-Bench 2.0 和 tau2-Bench 基准测试中显著提升了任务完成率,并优于现有记忆系统。
Together AI 博客介绍了分布感知投机解码(DAS)框架,用于加速强化学习(RL)后训练中的 rollout 阶段,最高可提速 50% 且不改变模型输出。DAS 通过自适应后缀树草稿模型和长度感知调度策略,解决了长尾生成导致的 GPU 利用率低和同步瓶颈问题。实验表明,在数学推理和代码生成任务上,DAS 分别实现了超过 50% 和约 25% 的 ro
llama.cpp 发布 b10227 版本,主要新增了 Qwen3 专用解析器,支持带标签的思维工具解析、工具调用省略及 Qwen3-Coder 的注释处理。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等后端。
Mistral AI 与 NVIDIA 合作发布了 12B 参数的 Mistral NeMo 模型,支持 128k 上下文窗口,在推理、世界知识和编码方面达到同类最佳水平。该模型采用 Apache 2.0 许可,支持 FP8 推理,并引入新分词器 Tekken,在多语言压缩效率上显著提升。Mistral NeMo 已可通过 HuggingFace、Mistr
xAI 宣布将改进后的 Grok-2 模型免费开放给所有 𝕏 平台用户,新模型速度提升三倍,并增强了准确性、指令遵循和多语言能力。同时,xAI 推出了 Grok 按钮、Aurora 图像生成模型等新功能,并更新了企业 API,新增 grok-2-1212 和 grok-2-vision-1212 模型,降低了 API 价格。
llama.cpp 发布 b10225 版本,主要更新为仅在需要时加载 MiMo V2 MTP 张量,以优化内存使用。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm 等多种后端。
llama.cpp 发布 b10226 版本,主要修复了 SYCL 后端对集成 GPU(iGPU)的分类问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm、OpenVINO 等。
llama.cpp 发布 b10224 版本,主要更新为 ggml-webgpu 添加对 f16 repeat 操作的支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
网易有道宣布旗下AI Agent产品矩阵已完成DeepSeek-V4-Flash正式版的全面接入,覆盖LobsterAI、有道词典、有道翻译、Hi Echo等产品。此次升级基于DeepSeek-V4-Flash-0731模型,该模型与预览版结构一致,但通过后训练优化显著提升了Agent能力。升级后,LobsterAI运行更经济,翻译和口语产品功能更精准,Th
llama.cpp 发布 b10223 版本,主要修复了部分 CI 错误。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
SpaceXAI 与 Anthropic 签署协议,提供其超级计算机 Colossus 1 的访问权限。Colossus 1 拥有超过 22 万块 NVIDIA GPU,用于 AI 训练和推理。Anthropic 将利用该算力提升 Claude Pro 和 Max 订阅服务,并有意合作开发轨道 AI 计算能力。
Mistral AI 为其 AI 助手 Le Chat 推出多项新功能,包括 Deep Research 预览模式、基于 Voxtral 模型的语音模式、由 Magistral 推理模型驱动的多语言推理、Projects 上下文文件夹,以及与 Black Forest Labs 合作的图像编辑功能。这些功能旨在提升用户的深度研究、自然交互和上下文管理体验,用
Mistral AI 发布了其大语言模型的首个全生命周期环境影响评估,与 Carbone 4 和 ADEME 合作完成,并经过同行评审。报告披露了训练 Mistral Large 2 的碳排放、耗水量和资源消耗,以及 Le Chat 每次推理的边际影响。该公司呼吁行业采用标准化环境报告,并提出了减少 AI 环境足迹的杠杆,如提高透明度和优化模型使用。
Together AI 宣布推出基于 NVIDIA Blackwell 平台的 GPU 集群,并配套优化的 AI 加速软件栈 Together Kernel Collection。该集群在训练 70B 参数模型时速度比 H100 快 90%,达到每节点每秒 15,200 tokens。Together AI 利用 ThunderKittens 框架开发了自定
Together AI 推出了自适应学习投机系统 ATLAS,这是首个无需手动调优即可自动提升推理性能的投机解码系统。ATLAS 结合静态和自适应投机器,根据实时流量动态调整,在 DeepSeek-V3.1 上达到 500 TPS,在 Kimi-K2 上达到 460 TPS,比标准解码快 2.65 倍。该系统旨在解决静态投机器在多变工作负载下性能下降的问题,
Together AI 发布了 FlashAttention-3,通过利用 Hopper GPU 的异步特性(如 WGMMA、TMA 和 FP8 低精度)来加速注意力计算,相比 FlashAttention-2 在 FP16 下速度提升 1.5-2 倍,达到 740 TFLOPS(H100 理论峰值的 75%),FP8 下接近 1.2 PFLOPS。该技术提
Together AI 宣布成为 MiniMax M3 的首选云合作伙伴,将在其公开发布后托管该开放权重模型。Together AI 的推理和内核团队通过多项优化,如 KV-Block-Major 稀疏注意力内核、MSA 的分页注意力集成等,实现了 81-125% 的吞吐量提升。MiniMax M3 支持 1M 上下文窗口和原生多模态,其稀疏注意力机制显著加
Together AI 与 Y Combinator 宣布合作,为 YC 投资组合中的 AI 初创公司提供首个专用 GPU 集群,以解决计算资源获取难和成本高的问题。该集群支持短期灵活使用和长期优惠价格,初创公司可通过自助门户直接管理 GPU。目前集群已满负荷运行,双方计划未来扩展集群规模。