llama.cpp b10992:llama-bench 支持 --version 打印构建信息
llama.cpp 发布 b10992 版本,主要变更是为 llama-bench 增加 --version 参数以打印构建信息(PR #28971)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10992 版本,主要变更是为 llama-bench 增加 --version 参数以打印构建信息(PR #28971)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
曼彻斯特大学David Topping团队利用NVIDIA Earth-2系列开放AI模型(CorrDiff、StormCast)在英国国家AI超算Isambard-AI上训练出覆盖全英的空气质量预测模型,训练仅用两天,分辨率达2-3平方公里。该模型可预测未来污染情景,并能在DGX Spark桌面AI系统上运行推理和小规模训练,团队计划开源训练数据与工作流,
开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降
中关村学院与中关村人工智能研究院发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,面向数学推理与智能体搜索,从零训练并开源权重、数据、代码与日志。该模型采用混合注意力、FP8 Muon 优化器和 MDP 中期训练等高效方案,在 16K 预训练上实现 4.2 倍时间到损失加速。评测显示其在 7B 规模推理基准上领先,并在部分数学与智能体搜索任务上接近参数
另有 1 家信源报道
开发者 DavidAU 在 Hugging Face 发布 Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF,这是一个基于 Qwen3.5-9B 的多阶段微调与合并模型,提供常规与 MTP 两种 NEO IMATRIX GGUF 量化版本。模型宣称在 7 项基准上
LiteLLM 发布 v1.103.0-dev.1 开发版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于固定 commit hash 和 release tag 两种验证方式。该版本包含大量修复与功能更新,涉及 responses、proxy、MCP、日志、Bedrock、Anthropic 适配器、路由、认证、定价等多个模块。
llama.cpp 发布 b10991 版本,主要修复了 hexagon 后端缺失的 contiguous 快速路径,并为每次运行补回 hvx copy uu。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10990 版本,主要变更为 hex-cpy 在源和目标内存连续时使用 DMA 进行拷贝(PR #28906)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10989 版本,主要变更为在 HIP 后端为 ROCm 启用 AllReduce(PR #27825)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。此次更新提升了
Hugging Face 用户 esatapedico 发布了 DavidAU 的 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored 模型的六个 GGUF 量化版本,采用 NVFP4(W4A16,FP8 缩放,组大小 16)格式,面向 Blackwell sm 120 架构。六个文件共享字节完
Strands Agents SDK 发布 TypeScript 版本 v1.18.0,新增 BM25 搜索策略、TypeScript 版 web fetch 工具、双向流式(bidi)实时转录与音频输出、上下文策略预设与会话管理器集成,并自动使用会话 ID 作为 OpenAI prompt-cache 键。同时修复了结构化输出重试、Mistral 图像块保
Strands Agents SDK 发布 Python 版 v1.56.0,新增 Anthropic 服务端工具(如网页搜索)的非覆盖式接入、BM25 搜索策略、TypeScript 版 web fetch 工具,以及双向(bidi)音频转录渲染与生命周期钩子等能力。同时修复了结构化输出重试、Mistral 图像块保留、Bedrock Mantle 模型路
Hugging Face 上出现一个名为 joaosollatori/small-agentic-model-1.5B 的模型卡片,该模型基于 gpt2 微调,采用 MIT 许可证,使用 Transformers 5.0.0 与 PyTorch 2.10.0 训练。卡片由 Trainer 自动生成,训练数据集未说明,评估集损失为 3.1493,模型描述、预期
无问芯穹联合清华大学、上海交通大学正式开源具身端侧推理引擎APXInf,支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台。该引擎在Jetson Thor上将PI 0.5 FP8的端到端推理延迟从278ms降至26ms以内,达到46Hz推理频率,并采用Rust极简运行时与Python接口兼顾稳定性与易用性。APXInf作为RL
另有 1 家信源报道
Google ADK JavaScript 的 integrations 包发布 v2.1.0 版本,主要变更为同步 adk 版本,并将工作区依赖 @google/adk 从 ^2.0.0 升级到 ^2.1.0。该更新属于常规依赖维护,未涉及新功能或 API 变更。
Google 发布 ADK JavaScript 的 v2.1.0 版本,新增 Docker 沙箱代码执行器 ContainerCodeExecutor、Vertex AI RAG 记忆后端 VertexAiRagMemoryService、Chrome Prompt API 端侧模型 BaseLlm,以及自愈式错误恢复插件 ReflectAndRetryT
IBM 发布 Granite Time Series PatchTST-FM-r2 时间序列基础模型,采用约 3.85 亿参数、Conformer 架构,支持零样本预测、概率预测和缺失值填补。截至 2026 年 9 月 8 日,该模型在 GIFT-Eval 基准的可复现零样本模型中排名第二,并且是同类中唯一采用 Apache 2.0 与 OpenMDW 1.
Mozilla AI 在 Hugging Face 发布 llamafile v0.10 系列仓库,基于 v0.10.5 版本构建了多个预打包 llamafile。这些文件内置对 CPU、Mac Metal GPU 以及 Linux/Windows 上 CUDA+Vulkan 的支持,并附带 Bonsai、Qwen3.5/3.6、Ministral 3、ge
Mastra 发布更新,新增 Studio Workflow Builder 后端,可通过 workflowBuilder 选项启用编辑器自有的 agent 来编写持久化工作流定义,并暴露受权限控制的服务端端点。同时推出 @mastra/connect 包,将平台集成连接转为 agent 工具,由平台代理注入凭证并刷新令牌,应用无需处理密钥。此外还支持线程所
阿里 ModelScope 发布 v1.40.1 版本,新增 JAEC 原生推理流水线以及 FLA-TF-Locoformer、FLA-T-SepReformer 两个语音分离模型,并加入 Agent IDP 与 MCP/Studio OpenAPI 支持。同时修复了 vLLM Ascend 在 OpenEuler 和 x86 上的构建依赖问题,统一上传环境