VOL. 2026-08-23 · 11 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-23 · PUBLISHED · 约 7 分钟
当日AI行业最突出的变化集中在模型推理效率与具身智能两大方向
当日AI行业最突出的变化集中在模型推理效率与具身智能两大方向。Ornith-1.5-9B及其GGUF量化版本通过内置推测解码头实现无损多token自推测解码,显著降低了编码任务的推理开销;同时,Ray 2.58.0引入KV缓存路由与token感知路由,LiteLLM连续发布镜像签名验证与多项功能更新,共同推动推理服务基础设施的精细化与安全化。在具身智能领域,银河通用人形机器人完成全球首次全自主网球对打,伽利略发布Galileo X陆行具身系统,两者分别从技能涌现与全地形移动能力上展示了机器人从实验室走向真实场景的突破。此外,llama.cpp在数日内连续发布多个修复版本,重点解决DeepseekV4多序列回滚与CUDA显存浪费问题,体现了开源推理栈在稳定性与资源效率上的持续打磨。
今日看点
2 个章节 · 11 条情报- 01模型发布Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化3
- 02产品发布Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持8
模型发布
MODEL RELEASE3 篇Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化
protoLabsAI 发布了 Ornith-1.5-9B 模型的 GGUF 量化版本,内置蒸馏 MTP 草稿头,支持 llama.cpp 的无损多 token 自推测解码,无需单独草稿模型。该版本针对不同硬件提供多种量化档位,其中 NVFP4 在 Blackwell 上速度最快(299 tok/s),IQ4_XS 适合 6GB 显存,但 IQ2_M 在长文本生成中易退化。模型还包含视觉投影器,支持图像输入,并提供了推荐的采样参数以避免重复生成。
Ornith-1.5-9B:端到端自我改进的轻量级编码模型
ornith-ai 发布了 Ornith-1.5-9B 模型,这是 Ornith-1.5 系列中最轻量的 9B 密集模型,通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成。该模型在编码基准测试中表现优异,如 SWE-bench Verified 得分 70.6,并支持移动端量化部署。
KernelBench-RLVR-120b 模型发布 GGUF 量化版本
mradermacher 发布了 KernelBench-RLVR-120b 模型的 GGUF 量化版本,该模型基于 Jarrodbarnes 的 KernelBench-RLVR-120b,专注于 GPU 内核代码生成,并通过 GRPO 强化学习在 KernelBench 数据集上训练。量化版本提供了多种精度的 GGUF 文件,方便用户在本地部署。
产品发布
PRODUCT RELEASE8 篇Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持
Ray 2.58.0 发布,重点包括 Ray Serve LLM 完成 KV 缓存和 token 感知路由,Ray Core 支持任务事件卸载,Ray Data 新增 Databricks Delta Lake 集成和 shuffle v2 后端,并推出实验性 Ray Sandbox 和 TPU 支持。这些改进提升了推理性能、数据处理效率和资源调度能力。
llama.cpp b10593 发布:修复 DeepseekV4 多序列回滚问题
llama.cpp 发布 b10593 版本,主要修复了 DeepseekV4 在多序列场景下的回滚问题,并进行了模型加载修复、缓存清理优化和图拓扑静态化等改进。该版本提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
llama.cpp b10594 发布:修复 CUDA 显存浪费问题
llama.cpp 发布 b10594 版本,主要修复了设备信息循环在非 TRACE 日志级别下仍会创建 GPU 上下文并导致 CUDA 后端分配 550 MB 显存的问题。该修复通过检查日志详细级别,在无输出时跳过设备循环,避免不必要的 GPU 资源占用。
LiteLLM v1.98.0 发布:镜像签名验证与多项功能更新
LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token 数、向量存储索引列表 API 等。
LiteLLM v1.99.0-rc.1 发布:镜像签名验证与多项修复
LiteLLM 发布 v1.99.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及 SCIM 组匹配、流式消息成本计算、Bedrock 响应头转发、spend 日志哈希、预算跟踪、路由响应体增强、guardrails 策略执行、Redis 集群超时处理等。
银河通用人形机器人网球首秀,突破具身智能AstraTennis时刻
银河通用在第二届世界人形机器人运动会上展示了全球首次全自主网球对打的人形机器人,其核心是名为银河星脑的具身大模型,实现了大脑、小脑和脑桥的一体化。公司还推出了AstraBrain Latent算法和银河星坊数据集,通过多智能体博弈实现技能涌现,并成功迁移到真实场景。这一突破展示了具身智能在真实对抗中的协同能力,为行业提供了可复用的范式。
llama.cpp b10589 发布:新增 CUDA POOL_1D 支持
llama.cpp 发布 b10589 版本,主要新增 CUDA 后端对 POOL_1D 操作的支持,并修复了 editorconfig 兼容性问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。
伽利略发布Galileo X陆行具身系统,打通机器人全地形移动能力
伽利略在世界机器人大会上发布了陆行具身系统Galileo X,该系统通过可变形态融合轮式、四轮足和越野底盘,具备高精度转运、长距离越野和复杂地形越障能力。其核心创新包括多构型可变平台、复合主动悬挂系统和360度无限旋转关节,并搭载多模态基座模型,旨在解决传统移动机器人场景割裂的痛点,为具身智能商业化提供通用移动底座。