poolside 发布 Laguna XS.2:33B MoE 本地智能体编程模型
poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Ver
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 699 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Ver
llama.cpp 发布 b11100 版本,主要修复了 chat 模块中 Muse Glimmer 工具调用(tool-call)首次解析错误的问题,并新增测试验证、精简匹配模式。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYC
llama.cpp 发布 b11099 版本,主要变更是在 release 工作流中同时构建 Snapdragon 目标,使 Hexagon NPU 二进制文件首次随正式发布页提供。此前 Snapdragon CI 构建仅用于 QDC 设备测试,NPU 二进制从未进入发布页。该版本同时提供 macOS、Linux、Android、Windows 等多平台预编
llama.cpp 发布 b11097 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 非 MoE 的 dp4a 二值化内核(PR #29055)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO
小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数(46),训练成本约 300 万美元。小米同时开源 RL 环境、训练配方与代码,并披露 RL 训练细节(130 小时、75B tokens、约 260 万美元)。此举被视为中国前沿实验室开源发布潮的一部分,也凸显
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K
LangChain 发布 langchain-openrouter 0.2.9 版本。该版本主要包含一次发布提交,以及大量模型配置数据(model profiles)的刷新,同时将依赖 anyio 从 4.13.0 升级到 4.14.2。整体属于常规维护性更新,未涉及新功能或重大变更。
该研究分析了19个使用Stale Bot的GitHub仓库中14,234个停滞的Pull Request(PR)和164,562条评审评论,并开发了基于LLM的投票分类器来按贡献类型分类。研究发现,功能增强和问题修复类PR占停滞贡献的77%以上;停滞主要源于沟通协调失败(如缺少互动、反馈延迟)以及技术障碍(如检查失败、配置问题、兼容性)。仅39.56%的贡献
PydanticAI 发布 v2.47.0 版本,主要包含兼容性调整、新功能与多项 bug 修复。兼容性方面,将 None 输出路由命名为 None 而非 NoneType,并在 UserPromptPart.content 非字符串或序列时抛出错误而非静默发送字典键。新功能方面,TypeSafeModel 新增支持三种字段类型。此外修复了 tuple 输出
在9月22日云栖大会上,阿里巴巴公布千问大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5计划扩展至5-10T参数;Qwen3.8-Max通过递归自我改进(RSI)在人类零参与下自主迭代超1个月、完成33轮迭代,Artificial Analysis得分从40升至45。阿里同时发布Qwen3.8-Flash、Qwen3.8-
在2026云栖大会上,阿里巴巴公布大模型最新进展:Qwen3.8-Max在编程与办公领域表现强劲并登顶多个榜单,基于下一代架构的Qwen4已投入训练,未来Qwen4.5、Qwen5参数将扩展至5到10万亿。阿里还发布Qwen-Image-3.1、Qwen-Audio-3.1、Wan3.0、HappyOyster 2.0 Preview等多模态模型,并披露大模
llama.cpp 发布 b11095 版本,主要新增针对高通 Hexagon 平台的 HMX 优化版 GATED DELTA NET(GDN)内核。该 PR 逐步实现了 HMX 支持、流水线化 HMX 与 DMA、HVX 多线程、向量化 expf 及尾部处理优化,并改进了 flash attention 内联 softmax 与 DMA 流水线,使 tok
llama.cpp 发布 b11094 版本,主要变更是将内置的 cpp-httplib 依赖更新至 0.57.1(由 Adrien Gallouët 提交,PR #29239)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、
llama.cpp 发布 b11093 版本,主要修复了 Metal 后端 flash attention 块预处理阶段的 mask 边界问题(PR #29220)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVI
Hugging Face 上发布了 m-a-p/SheetSage2 模型,可将音乐录音转写为可编辑的乐谱(ABC 格式)和带时间标注的 MIDI。该模型基于 MERT-v2-FullSong 构建,支持旋律、和弦、节拍、调性和结构提取,并可导出嵌入与 token 预测。用户可将转写结果传入 YuE2 用于翻唱生成,模型采用 cc-by-nc-4.0 许可。
llama.cpp 发布 b11090 版本,主要修复了 CUDA 后端在 sm 70(Volta 架构)上的 tile 编译错误。此前提交 1884824fd 引入的五参数 load ldmatrix 仅定义了 tile ,导致 Volta 的 tile 无法匹配;本次将 tile 形状泛化为 ,使非 swizzle 分支可转发到三参数加载器。该修复由 D
Hugging Face 用户 avar6 发布了基于 zai-org/GLM-5.3-Flash 的实验性 GGUF 量化模型,支持视觉功能,需配合 timkronos 的 llama.cpp 分支使用。量化从 bf16 safetensors 生成,提供 IQ2 XXS 至 Q3 XL 等多种精度方案,并持续更新 mmproj 与混合精度量化。作者表示
TypeSafe AI 发布 Jev,一种被称为「System One 模型」或「决策模型」的新型 LLM:输入文本,输出浮点数形式的分类、是/否判断、评分及置信度,而非文本。Jev 仅按输入 token 计费(每百万 token 0.042 美元),输出免费,速度极快,适合垃圾邮件检测、标签推荐、排序与搜索重排等分类任务。作者指出其黑盒性质带来偏见隐患,并
Strands Agents SDK 发布 harness-typescript v0.1.0,这是该 TypeScript 包的首个版本。该版本默认启用 opus 5 模型与高思考(high thinking)模式,并上线了重新设计的 Strands 官网。此外还修复了 ContextManager 实例接受问题与工具 schema 规范化时修改调用方对象
llama.cpp 发布 b11081 版本,主要更新了测试工具 test-llama-archs,使其张量数据标准差(stdev)可配置,并改进了帮助信息、用法示例和未知参数报错。同时调整了 test-recurrent-state-rollback 使用 NMSE 检查 logits 回滚,并禁用了部分无效测试。该版本继续提供覆盖 macOS、Linux