llama.cpp b10516 发布:修复 Vulkan 空指针问题
llama.cpp 发布 b10516 版本,主要修复了 Vulkan 后端中 ggml vk queue command pools cleanup 函数的空指针检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、OpenVINO 等。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10516 版本,主要修复了 Vulkan 后端中 ggml vk queue command pools cleanup 函数的空指针检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、OpenVINO 等。
llama.cpp 发布 b10514 版本,新增对 GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 模型架构的转换与推理支持,包括滑动窗口注意力模式、逐层 RoPE 判定及 MoE 参数处理。该更新由 IBM 的 Gabe Goodhart 主导,并借助 AI 辅助编码工具完成。此版本增强了 llama.c
llama.cpp 发布 b10509 版本,新增 ggml rope set offset 操作,并支持 Metal、CUDA、Vulkan 后端。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
软件公司 Software Mansion 在 Hugging Face 上发布了用于 React Native ExecuTorch 库的 CLIP ViT-B/32 图像编码器模型,以 .pte 格式提供,支持 xnnpack 后端。该模型基于 OpenAI 的 clip-vit-base-patch32,导出时使用 ExecuTorch 1.1.0,不
Zetta是一个闭环具身智能框架,通过在线演化基于代码的运行时批评者和恢复技能,在保持基础策略冻结的同时,以动作频率治理物理执行。在LIBERO-Pro和RoboCasa基准上分别达到90.8%和93.6%的成功率,推理速度提升11.1倍,且技能可零样本迁移,展现出机器人"顿悟时刻"。该研究为可靠物理智能的扩展提供了新路径。
该论文将经典委托-代理框架扩展至LLM代理选择技术与努力水平(如token预算)的场景,建模了凹性饱和生产函数,推导了最优线性合约,并基于MATH和MMLUPro基准校准模型,证明简单线性合约能有效激励技术感知的委托。
该研究通过医学资源分配场景,发现大语言模型在推理时是否包含先前响应会显著影响其行为,且不同模型间概率变化方向可能相反。研究强调部署环境中的上下文工程对模型决策的重要性,并指出单次评估可能掩盖多轮任务中的潜在风险。
该研究针对混合PDE参数学习中的算子误设问题,提出了一种无需参考模型的检验工具,能从单次拟合中区分算子错误与参数不可辨识。实验表明,误设估计器在域内误差低于噪声,但系数偏差大,且容量无关,多种架构收敛到相同的伪真值。该工具在正确设定下保持沉默,在误设下高概率拒绝,为可部署测试提供了分离两种失败的能力。
llama.cpp 发布了 b10507 版本,主要更新是添加了 mtmd bitmap set mergeable 功能(PR #27348)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。部分平台的构建(如 macOS KleidiAI、U
llama.cpp 发布 b10506 版本,主要更新是在 Metal 后端使用打包类型对 q8 0 进行反量化,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。部分平台构建(如 KleidiAI、ROCm、openEuler)因兼容性问题被禁用。
llama.cpp 发布 b10505 版本,为 server 新增 dedup-cache-models 预设选项(PR #27346),用于模型缓存去重。该版本提供了覆盖 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL
NVIDIA 技术博客介绍了如何使用 AI 编码代理开发 Holoscan 应用,通过 CLI、技能和代理实现实时内窥镜工具分割应用。开发流程采用工程师指导的迭代方式,代理使用 Codex 和 GPT-5.6 完成代码实现,并复用 MONAI 模型。该方法提高了开发效率,并强调了将复杂目标分解为可验证迭代的重要性。
Silicon Data 是一家帮助华尔街为 AI 计算定价的初创公司,近期完成了 3000 万美元 A 轮融资。该公司旨在成为 GPU 租赁的参考价格和指数,并计划于 10 月 5 日在 CME 推出计算期货交易,尚待监管批准。在 TechCrunch 的 Equity 播客中,研究主管 Steve Hou 讨论了 AI 建设现状,认为数据表明行业并非如悲
Ollama 发布了 v0.32.15 版本,主要新增了模型元数据缓存功能,以减少每次请求的开销。该版本还包含新贡献者 gaugarg-nv 的首次贡献。
Langfuse 发布 v4.15.0 版本,主要改进包括:改进沙盒工具渲染、时间线紧凑模式、为开源版提供应用内代理基础、在分析事件中添加用户 ID。同时修复了多个问题,如会话回放内容掩码、工具竞态条件、RBAC 权限等。
Unsloth 发布了基于 Qwen3.8-27B 的 GGUF 量化模型,采用 Dynamic V3.0 技术,宣称在精度和量化性能上优于其他量化方案。Qwen3.8-27B 是 Qwen 系列最新开源模型,具备原生视觉语言理解、灵活思考控制、长上下文(262K 原生,可扩展至 1M)和增强的智能体执行能力。该模型支持在 Unsloth Desktop 中
NVIDIA 发布 Cosmos 3 Edge,一个 4B 参数的 omni-model,可在 Jetson Thor 上实现设备端机器人控制。该模型基于 Cosmos 3 系列预训练,通过后训练生成机器人操作策略,在 Jetson AGX Thor T5000 上推理延迟约 1.53 秒,闭环任务成功率 22.9%。教程提供完整后训练流程,使用 DROID
中国允许英伟达H200芯片小批量进入大陆,字节跳动和腾讯各获得约1万颗,以帮助国内AI企业追赶美国。H200比英伟达最先进芯片落后至少两代,因美国出口管制无法购买更先进的。中国还支持华为等本土制造商,但国内AI公司在推理能力上仍落后于美国,且需求激增导致部分公司如Moonshot不得不拒绝客户。
Liquid AI 发布了 LFM2.5-2.6B 模型的 GGUF 量化版本,该模型专为端侧部署设计,基于 LFM2 架构并经过扩展预训练和强化学习。模型支持多种语言,可通过 llama.cpp 运行,提供了命令行使用示例。
Liquid AI 发布了 LFM2.5-1.2B-Instruct 模型的 GGUF 量化版本,专为端侧设备部署设计。该模型基于 LFM2 架构,经过扩展预训练和强化学习,支持多种语言,并可通过 llama.cpp 运行。