SGLang v0.5.20 发布:新增多款模型与性能优化
SGLang 发布 v0.5.20,包含来自 237 位贡献者的 713 个 PR。该版本新增 GLM-5.3-Flash、Hy4-Preview、Qwen3.8-Flash-Next、K2 Horizon、Nanbeige4.2 等自回归模型以及 SenseNova-U1.5-8B-MoT、FastH3、VDN-H3 等扩散模型支持。同时引入 RL rol
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
SGLang 发布 v0.5.20,包含来自 237 位贡献者的 713 个 PR。该版本新增 GLM-5.3-Flash、Hy4-Preview、Qwen3.8-Flash-Next、K2 Horizon、Nanbeige4.2 等自回归模型以及 SenseNova-U1.5-8B-MoT、FastH3、VDN-H3 等扩散模型支持。同时引入 RL rol
Moonshot AI 的 Kimi K3 模型在 Amazon Bedrock 上线,据 Moonshot AI 称这是其最强模型,也是首个达到 2.8 万亿参数的开源模型,具备原生视觉能力和 100 万 token 上下文窗口,相比 Kimi K2 扩展效率提升约 2.5 倍。Kimi K3 是 Bedrock 上首个支持显式提示缓存的开源权重模型,可降
本期 AINews 汇总了 2026 年 9 月 16-17 日 AI 动态:Anthropic 在 Claude Code 中推出 Projects,支持单次对话派生多个云端并行会话并跨线程传递上下文;Google 更新 Gemini 托管智能体,新增基于 Antigravity 的 harness 以及 Credentials API 和 Files A
AWS Machine Learning Blog 发布技术文章,介绍如何在 Amazon EKS 上结合 NVIDIA Resiliency Extension (NVRx) 实现容错的 PyTorch FSDP 分布式训练。方案通过异步检查点、进程内重启和 ft launcher 作业内重启三层机制,分别应对软故障、硬故障和节点丢失,并在 H100 GP
llama.cpp 发布 b10996 版本,主要变更是针对 qwen3-coder 在推理预算结束时强制输出 \n 标签。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制文件,包括 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等加速方案。
llama.cpp 发布 b10995 版本,主要变更是让 Vulkan 后端的 MUL MAT ID BN/2 尾部分支变为无条件启用,将 BN/2 设为默认并作为 BNover4 的禁用回退,同时移除该分支的启用门控;BN/4 分支仍由 enable smaller matrices 控制。该版本同时提供 macOS、Linux、Windows、Andr
llama.cpp 发布 b10993 版本,主要变更是为 hf-jobs 添加自托管的 WebGPU 和 Vulkan 后端,并调整 CPU 后端线程数。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制,支持 CUDA、ROCm、Vulkan、SYCL、OpenVINO 等多种加速后端。
llama.cpp 发布 b10992 版本,主要变更是为 llama-bench 增加 --version 参数以打印构建信息(PR #28971)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
llama.cpp 发布 b10991 版本,主要修复了 hexagon 后端缺失的 contiguous 快速路径,并为每次运行补回 hvx copy uu。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10990 版本,主要变更为 hex-cpy 在源和目标内存连续时使用 DMA 进行拷贝(PR #28906)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10989 版本,主要变更为在 HIP 后端为 ROCm 启用 AllReduce(PR #27825)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。此次更新提升了
Hugging Face 用户 esatapedico 发布了 DavidAU 的 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored 模型的六个 GGUF 量化版本,采用 NVFP4(W4A16,FP8 缩放,组大小 16)格式,面向 Blackwell sm 120 架构。六个文件共享字节完
Mozilla AI 在 Hugging Face 发布 llamafile v0.10 系列仓库,基于 v0.10.5 版本构建了多个预打包 llamafile。这些文件内置对 CPU、Mac Metal GPU 以及 Linux/Windows 上 CUDA+Vulkan 的支持,并附带 Bonsai、Qwen3.5/3.6、Ministral 3、ge
llama.cpp 发布 b10983 版本,主要变更是将 build arch graph() 的函数定义移动到 graph 和 graph 模板特化之后,以修复编译顺序问题。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10980 版本,主要变更是为 OpenCL 后端新增通用的 ssm scan 算子(PR #28881),并修复了空白字符问题。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows、openEuler 等多平台的预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多
llama.cpp 发布 b10976 版本,主要修复了 Android 平台的 CI 发布流程(#28936)。该版本继续为 macOS、iOS、Linux、Windows、Android 和 openEuler 等多平台提供预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
该研究对比了Complement Naive Bayes(CNB)与从27B到1T参数的多系列LLM在文本分类任务上的表现。结果显示LLM仅在无标注数据场景占优(Amazon Polarity上98.0%对88.2%),但存在数据污染风险;一旦有标注数据,CNB在AG News上达到89.1%,与零样本27B LLM持平并优于397B前沿模型,且CPU推理吞
XHToken 发布 Spark-X2.5-4B 与 Spark-X2.5-1.7B 两款紧凑型通用语言模型,采用混合注意力架构(1 层全注意力加 3 层滑动窗口注意力),原生支持最高 1M token 上下文与 200 多种语言。模型在华为昇腾集群上基于约 20 万亿 token 预训练,并通过大规模强化学习与 MOPD 后训练提升推理、编码与智能体能力。
Arm在Arm Everywhere China年度大会上发布Neoverse CSS N4平台,并展示Arm AGI CPU在中国生态的进展。Arm称AGI CPU在同等性能下TDP为300瓦,而x86方案通常为500瓦,可缓解数据中心电力与机架空间压力。同时Arm上线Arm AI Portal开发者平台,首批预优化模型包括通义千问、Google Gemm
英伟达、Palantir、Booz Allen Hamilton 等企业开始限制内部使用 Anthropic 的 AI 模型,担心员工将代码和知识产权等敏感信息输入外部模型后被模型提供商接触或学习,英伟达仅在低敏感任务中使用 Anthropic 的 Fable,敏感项目改用自家 Nemotron。生数科技发布 Vidu S2,支持实时视频换装换背景、720P