llama.cpp b11191 修复 Windows Unicode 路径目录创建问题
llama.cpp 发布 b11191 版本,主要修复了 common 和 rpc 模块中 fs create directory with parents() 函数在 Windows 上处理部分 Unicode 路径时失效的问题。修改后,不带尾部路径分隔符的路径也会创建最后一级目录,与函数名语义一致;由于现有调用方均带尾部分隔符,因此不受影响。该提交由 A
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 699 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11191 版本,主要修复了 common 和 rpc 模块中 fs create directory with parents() 函数在 Windows 上处理部分 Unicode 路径时失效的问题。修改后,不带尾部路径分隔符的路径也会创建最后一级目录,与函数名语义一致;由于现有调用方均带尾部分隔符,因此不受影响。该提交由 A
Strands Agents SDK 发布 Python 版 v1.57.1,主要包含双向流式(bidi)快照捕获与恢复、CLI 快速上手与 /tools 命令、a2a client 工具、MCP TypeScript 客户端升级至 2.0 等新特性,并修复了会话护栏脱敏、工具调度历史记录、图调用收尾等问题。该版本还改进了 CLI 交互体验、补充了 harn
llama.cpp 发布 b11190 版本,修复了 LFM2 音频模型(lfm2a)的 mel 预处理器。原实现导致英语测试语句 4.5%、日语 6.5% 的贪心转录结果与参考实现不一致,日语中部分差异甚至改变整个词。修复采用 log(x + 2^-24) 替代对数下限截断、对称 Hann 窗,并将归一化 epsilon 加到标准差而非平方根内,仅 lfm
llama.cpp 发布 b11189 版本,主要变更是为 OpenCL 后端新增两个二进制 GEMM 内核(kernel gemm noshuffle q5 k f32 32b trans ila a8 bin 和 kernel gemm noshuffle q5 k q8 1 dp4a ila a8 bin),分别覆盖非 dp4a 与 dp4a 的 A8
llama.cpp 发布 b11188 版本,主要修复了旧版 GLSLC 编译器因不支持 cooperativeMatrix API 而导致的 Vulkan 构建问题。改动通过新增 GGML VULKAN COOPMAT GLSLC SUPPORT 宏检查、在创建前过滤不支持的 FA 两阶段内核,并将 Intel FA 着色器指针创建的锁保护移入 CM1 编
llama.cpp 发布 b11185 版本,主要变更是将共享的 Unicode 路径与字符串辅助函数提取到 common 模块(PR #29415),由 Adrien Gallouët 提交。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROC
Mem0 发布 Node SDK v3.3.1,主要修复配置、向量存储与打包问题。ConfigManager 不再向非 OpenAI 的 LLM 提供商注入 OpenAI 默认 baseURL 和 model,使 DeepSeek、xAI 等回退到自身默认值与环境变量。Turbopuffer 过滤器现支持全部操作符,欧氏距离搜索改用 1/(1+distanc
Mem0 发布 Python SDK v2.2.1,集中修复核心、LLM 与向量存储三方面的缺陷。核心层面,add() 不再把向量库拒绝的记录当作成功写入,全部失败时抛出 VectorStoreError,并恢复 Memory/AsyncMemory 的上下文管理器协议。LLM 层面修复 AWS Bedrock Anthropic 路径读取 Claude 推
llama.cpp 发布 b11183 版本,主要变更是将 Metal 后端的 flash attention(fa)kernel 按数据类型拆分为独立库,并附带一处注释小修正。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
Xinference 发布 v3.5.0,新增 AuK、Irodori TTS、YuE2、Spark-X2.5、Qwen-Image-2.1、MinerU2.5 等多种音频、图像与 LLM 模型支持,并加入模型请求日志、审计与可观测性功能。性能方面优化了 embedding/rerank 的 vLLM 批处理与 API 启动开销,同时修复了流式工具调用、客户
llama.cpp 发布 b11182 版本,核心变更是新增 llama prec policy 精度策略并引入模型驱动的 W4A4(4位权重/4位激活)推理路径(PR #24364),由 NVIDIA 工程师 ynankani 提交,Georgi Gerganov 等人参与评审。该改动涉及 ggml CUDA 后端 mmq.cu 的 MXFP4 调度调整,
llama.cpp 发布 b11181 版本,主要变更是提高 HIP 版本要求以支持 fp8,避免在 HIP 6.2 中缺少 hip fp8 e4m3 支持的问题。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11180 版本,主要修复了 RPC 后端中 get alloc size 缓存键未包含 nb 参数的问题,并将计算结果下限设为 ggml nbytes。该改动由 Georgi Gerganov 等人提交,旨在提升 RPC 内存分配计算的正确性。同时发布了覆盖 macOS、Linux、Windows、Android 等多平台及 C
LangChain 发布 langchain-fireworks 1.6.3 版本,主要修复了 Fireworks 集成中的两个问题:声明不支持原生 PDF 输入,以及在工具调用参数格式错误时保留原始内容作为诊断 JSON。此外还刷新了模型配置数据。
ggml-org 在 Hugging Face 上发布了小米 MiMo-V2.6-Flash-RL 的 GGUF 量化版本,支持通过 llama.app 运行。该版本提供 MXFP4、Q2 K 等多种量化输出,并附带用于投机解码的 MTP 与 DFlash drafter sidecar,以及面向视觉和音频编码器的 Q8 0 mmproj。模型由 ggml-
Quarkus LangChain4j 发布 1.14.0 版本,包含多项修复与功能更新。主要变更包括新增 @McpClientAgent 注解支持、为 AgenticScope 自动注册序列化域对象、修复 A2A 代理发现和 MCP SSE 解析问题,并新增 Workload ModelAuthProvider 以支持 OpenAI 和 Anthropic
canada-quant 发布了 GLM-5.3-Flash 的 W4A16(INT4)量化版本,仅对 36,288 个路由专家 GEMM 做 GPTQ 对称 INT4 量化,注意力、路由、共享专家、嵌入、视觉塔和 MTP 头保持 BF16。模型体积从约 599 GiB 降至 177.7 GiB(-70%),可在 H100、H200、RTX PRO 6000
llama.cpp 发布 b11178 版本,集中修复 MUSA 后端(摩尔线程 MTT S5000 / PH1)的多个问题。改动包括:让 MUSA 使用 16 字节拷贝、启用 CUB 路径、采用上游代码路径、移除多余编译期守卫、在 PH1 上禁用 MMQ 路径,并修复 fused TOPK MOE 内核在 MUSA 上的死锁。修复后 27B 模型困惑度从
在2026年9月云栖大会上,阿里巴巴旗下平头哥发布新一代AI芯片真武V900,并宣布AI软件栈T-Head SAIL进一步开源,开放PyTorch适配、迁移工具、算子开发工具及计算加速库等项目。真武芯片已服务20多个行业650多家客户,蚂蚁、小红书、小鹏汽车等基于SAIL进行模型迁移与优化。此举旨在降低客户迁移成本、让开发者参与芯片性能优化,并推动大厂造芯从
另有 1 家信源报道
LangChain4j 发布 1.20.1 与 1.20.1-beta30 版本,本次更新允许被 @McpClientSupplier 注解的方法同时接收 supplier 参数,由 mariofusco 通过 PR #6505 提交。该改动提升了 MCP 客户端供应器在方法签名上的灵活性,属于框架层面的小版本迭代。