llama.cpp b10903 发布:修复 Vulkan argsort 竞态与越界
llama.cpp 发布 b10903 版本,修复了 Vulkan 后端 argsort 中的竞态条件和越界访问问题(PR #28705),其中越界访问可能解释 CI 中的失败。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10903 版本,修复了 Vulkan 后端 argsort 中的竞态条件和越界访问问题(PR #28705),其中越界访问可能解释 CI 中的失败。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10902 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 矩阵乘法的二进制内核支持(PR #28268)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
LiteLLM 发布 v1.102.0-dev.2 开发版本,该版本所有 Docker 镜像均使用 cosign 签名,并提供了基于固定 commit hash 和 release tag 两种验证方式。本次更新包含大量修复与功能改进,涉及 MCP 代理日志与授权、消费追踪、流式响应构建、Azure AI 定价、护栏策略、路由 TTFT 百分位、hosted
RunningHub 针对 MiniMax 开源视频模型 H3 推出 H3 Lightning 加速方案,通过 RH 后训练加速模型(50 步降至 4-9 步)、SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行,在 4 张 RTX 6000D 上把 5 秒视频生成从 348.8 秒压缩到 2
另有 1 家信源报道
Farid Zakaria 发布了 trynix.dev,这是一个基于 qemu-wasm 的 x86 64 Linux 虚拟机,完全在浏览器中通过 WebAssembly 运行,可启动过去 13 年间的任意 Nix 包,并支持 URL 寻址。他还构建了 trynix-preview,一个 GitHub Action,能在 PR 上评论链接,让用户直接在浏览
llama.cpp 发布 b10901 版本,主要变更是 Vulkan 后端在上下文空闲时,ggml backend vk cpy tensor async 改用 CPU 写入方式。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA
OpenAI 发布 openai-agents-js v0.18.0,主要变更包括 Docker 文件 API 迁移至容器内运行、UnixLocalSandboxClient 新增可选的 fileIOProtection 文件保护选项,以及 imageGenerationTool() 支持 action 参数(generate/edit/auto)。此外还修
Google 发布 ADK Python v2.9.0,重点提升智能体韧性并扩展生态集成。新版本引入 FallbackModel 实现主模型出错时自动故障转移,新增 LiveKit runner 支持语音与电话智能体,并支持从 YAML 声明式配置加载 ADK 2.0 图工作流。此外,该版本兼容 MCP SDK 2.x(默认仍解析 1.x),并包含工作流节点
Hugging Face 用户 peculiar-ragdoll 发布了 Tiel-Coder-35B-A3B-GGUF,这是对 ornith-ai/Ornith-1.5-35B-A3B 进行动态 imatrix 量化并内置 Sharp 聊天模板的 GGUF 版本,面向 agentic coding 与多轮对话。在 SWE-bench-Live 上 25 题
llama.cpp 发布 b10900 版本,主要变更是 Vulkan 后端使用 add alloc dep 以在 prefill 阶段启用 topk moe 融合(PR #28422)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、C
llama.cpp 发布 b10897 版本,主要更新是将 Windows ARM64 平台的 CUDA 13.4 构建从 Developer Preview 归档迁移到 13.4.1 GA 可再发行组件。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、OpenV
OpenAI 发布官方 Node SDK v7.14.0 版本,新增 Live API 支持。该版本同时包含多项依赖更新与修复,涉及 joi、next、sharp 等开发与生态测试依赖的版本升级。
蚂蚁灵波开源三款世界模型:LingBot-World 2.0 Small(1.3B)、Bidirectional(双向Teacher模型)和Causal Pretrain(因果预训练基座模型)。其中1.3B版本面向消费级单卡GPU,可实时生成,便于个人开发者和高校实验室本地复现;双向Teacher模型提供高质量蒸馏源,因果预训练模型面向后训练、评测与场景适配
LiteLLM 发布 v1.100.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过固定 commit hash 或 release tag 验证镜像签名的命令。该版本主要包含若干 backport 修复,涉及 router 重试逻辑以及撤销 spend attribution 相关改动。
Hugging Face 用户 peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF-MTP,这是基于 Qwen3.6-35B-A3B 的 4-bit GGUF 量化模型,保留了标准量化中被丢弃的多 token 预测(MTP/nextn)张量,并内置改进的聊天模板与强制系统提示。该模型面向推理、多轮对话和 agenti
Quarkus LangChain4j 发布 1.14.0.CR3 版本,主要包含依赖升级、Bedrock 可配置提示缓存 TTL 支持、MCP 扩展脱离 LangChain4j 的 Jackson 类型 API、SSE 订阅器空值防护等改动,并回滚了 agentic Dev UI 监控填充 Topology 和 Executions 的功能。新贡献者 @a
llama.cpp 发布 b10896 版本,修复了在使用 DFlash 推测解码与视觉模型(mtmd)配合时无法解码图像 chunk 的问题。修复方式是停止将图像 token 复制给 drafter,并将 M-RoPE 跳过逻辑限制为仅图像,允许音频正常通过。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制。
Ampixa 在 Hugging Face 发布 sanoTTS,一个参数规模 294k 至 2.27M 的微型神经语音合成模型家族,可在约 3 美元的 ESP32-S3 微控制器上实时运行,也可通过 WASM 在浏览器中运行。该系列覆盖 6 种语言共 11 个音色,采用 GPL-3.0 开源许可,并提供 Python 与 JavaScript 包。其意义在
llama.cpp 发布 b10894 版本,主要改动是清理旧模型代码中已失效的 switch 分支(#28669),移除早期重构时复制粘贴、现已不可能触发的条件判断,仅保留 llama model bert::graph::graph 的共享逻辑。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖
开发者 brandonmusic 在 Hugging Face 发布了 GLM-5.3-Flash 的 EXL3/TR3 4bpw 量化检查点,基于 zai-org/GLM-5.3-Flash-BF16,面向 SM120 双 GPU 环境。该版本提供多模态 DFlash2、纯文本 DFlash2 和纯文本 MTP3 三种 vLLM 服务配置,并附带可复现的