llama.cpp b11062:CUDA 为 qwen4 启用稀疏 flash attention
llama.cpp 发布 b11062 版本,主要变更是为 qwen4 在 CUDA 后端启用稀疏 flash attention(sparse fa),对应 PR #28770。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,包含 CUDA 12/13、Vulkan、ROCm
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11062 版本,主要变更是为 qwen4 在 CUDA 后端启用稀疏 flash attention(sparse fa),对应 PR #28770。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,包含 CUDA 12/13、Vulkan、ROCm
中国AI企业APUS旗下AI实验室于9月19日公布全球最早一批针对Jev的独立开源复现成果,并封装为开箱即用的Agent Skill「fast-browser-use」,支持macOS、Linux、Windows,可在无GPU的Mac和PC上纯本地离线运行,代码以MIT协议开放。该项目复现了Jev跳过自回归解码、单Token Logits直接打分与KV-Ca
DeepSeek AI 开源了名为 DeepSeek Harness(dsh)的 agent harness,采用「一切皆插件」架构,基于 Cordis 构建。项目目前处于开发者预览阶段,官方警告将出现破坏兼容性的变更,用户可通过 npm 的 npx 命令或源码方式运行 Web UI。项目以 MIT 协议开源,并提供文档、Discord 社区与 GitHub
XHToken 在 Hugging Face 发布 Spark-X2.5-4B-GGUF 量化模型,基于 Spark-X2.5-4B,采用混合注意力架构,原生支持最长 1M token 上下文和 200 多种语言,面向对话、写作、翻译、推理、编程、工具调用与智能体工作流。该 GGUF 版本支持 llama.cpp、Ollama、LM Studio 和 Uns
llama.cpp 发布 b11060 版本,主要修复了 mamba 实现中时间步投影输入的内存连续性问题,并在归一化后跳过不必要的连续拷贝。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译二进制包。
阶跃星辰于9月20日发布新一代旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作与金融等场景,提升真实世界 Agentic 任务表现。该模型在全球权威榜单 Artificial Analysis Intelligence Index 中跻身全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8,并计划于 10
Comfy-Org 在 Hugging Face 上发布了 Qwen3-VL 的重新打包版本,将 Qwen/Qwen3-VL-4B-Instruct 和 Qwen/Qwen3-VL-8B-Instruct 转换为适配 ComfyUI 的单文件模型。该仓库提供 bf16、fp8 scaled、int8 convrot 和 nvfp4 等多种量化格式,用户需将文
DeepBeepMeep 在 Hugging Face 上发布了 Wan2.1 视频生成模型的单文件版本,基于 Wan-AI/Wan2.1-T2V-1.3B,用于配合其开源项目 WanGP 使用。WanGP 支持 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV 等视频生成模型,主打低显存需求(最低 6GB 即可
llama.cpp 发布 b11057 版本,新增针对 Ling 3.0(Bailing V3)的专用聊天解析器。由于 Ling 3.0 Flash 模板在生成提示中预先打开 think 块,模型不会输出起始 标签,且工具调用可能出现在 之前,导致原有自动解析器将工具调用误判为 reasoning content,客户端收到空 content 且无 tool
开发者 Dr. Zeon 在 Hugging Face 发布 Luck-Spark V-300-MoE,一个从零预训练的小型 Mixtral 风格 MoE 语言模型,总参数约 2.95 亿,含 4 个专家、top-2 路由、1024 上下文。模型在 Kaggle 双 T4 上训练,目标语料 50 亿 token,当前权重处于训练早期,可生成短文本但可能重复或
Hugging Face 用户 ajgazin 发布了 Swift-Qwen3.8-27B-Uncensored-Dynamic-MTP-GGUF,这是对已去审查(abliterated)的 Swift-Qwen3.8-27B 模型进行 GGUF 量化的版本。该模型采用 Unsloth Dynamic 3.0 量化布局,包含 MTP 头以支持 llama.c
Simon Willison 发布 datasette-auth-github 1.0 版本。他此前在 agent.datasette.io 演示站点上发现已认证会话持续时间过短,原因是插件设置 cookie 时缺少 Max-Age 参数,导致会话在浏览器关闭时即过期。他在 #80 中修复了该问题,并因插件已长期存在且同时兼容 Datasette 0.65.
MinerU 发布 4.0.4 版本,主要修复 VLM 引擎在高显存设备上的 GPU 显存利用率逻辑,并降低推理性能、模型加载等日志级别。API server 的 --log-level 参数现在仅作用于服务端日志,WebUI 修复了超长文件名的幂等处理问题。依赖方面要求 mineru-vl-utils 最低版本提升至 2.0.5,以修复 lmdeploy
华为在2026年全联接大会上发布灵衢(UnifiedBus)统一互联总线协议,以及昇腾960芯片、昇腾960超节点、OceanStor M900 AI记忆存储等AI基础设施新品。灵衢将CPU、NPU、DPU、内存、存储等统一互联,使10万卡集群的MFU从约20%提升至35%,单集群可支持100万颗AI处理器。华为同时推进CANN开源与Agent开发生态合作,
在华为全联接大会2026上,华为宣布昇腾已跨越生态拐点,CANN社区成为中国活跃度最高的开源社区,昇腾成为PyTorch官方支持的首个中国算力平台。华为计算首席战略官朱照生提出Agentic计算的五大变化,包括从单服务器到超节点、从进程到思程、从SIMD到SIMD+SIMT、从HiFloat8到HiFloat4、从人工算子编程到Agent编程调优,并宣布思程
llama.cpp 发布 b11055 版本,主要变更为在 hexagon 后端新增对 GEGLU QUICK 的支持(PR #29114)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11054 版本,主要变更为在 Hexagon 后端启用对 TOP K 算子的支持,包括单行 TOP K 线程化、提升基于 VTCM 的尺寸上限、修复 TOP K mdev 行分区、优化大行选择,并更新了相关文档。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译包。
Hugging Face 开源了 Reef 基础设施,旨在让智能体(harness + 模型)能够从经验中持续自我进化。Reef 以推理为核心,提供标准 OpenAI 格式推理端点,并将推理轨迹、执行结果和用户反馈存储为结构化经验流,支持模型权重与 harness(提示、记忆、技能、工具、编排逻辑)的联合更新。其目标是让开源社区更容易实验持续自我改进,并获得
Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可同时处理音频与视频并自主调用工具完成视频剪辑、短视频翻译、电影摘要等任务,上下文窗口达一百万 token。官方称其在音视频任务上接近 Gemini 3.8 Flash 的水平,但 API 定价更低:输入每百万 token 0.15 美元、输出 0.47 美元,音频输入每
llama.cpp 发布 b11053 版本,主要改进了 server 的启动日志信息。更新后每个模型在日志中会显示来源标签(preset/models dir/cache),替代原先难以理解的星号标记,并在“Loaded cached model presets”日志中显示 Hugging Face hub 缓存路径,同时新增 hf cache::get