VOL. 2026-08-23 · 11 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

当日AI行业焦点集中在模型推理效率与具身智能两大方向

当日AI行业焦点集中在模型推理效率与具身智能两大方向。轻量级编码模型Ornith-1.5-9B及其GGUF量化版本发布,通过内置推测解码头实现无损多token自推测解码,显著提升推理性能;同时,Ray 2.58.0引入KV缓存路由与token感知路由,llama.cpp连续发布多个版本修复显存浪费与多序列回滚问题,LiteLLM则强化镜像签名验证,共同推动推理基础设施的优化与安全。具身智能领域迎来突破,银河通用人形机器人实现全球首次全自主网球对打,伽利略发布Galileo X陆行具身系统打通全地形移动能力,标志着机器人在复杂环境中的自主决策与运动控制能力迈上新台阶。

今日看点

2 个章节 · 11 条情报
  1. 01
    模型发布Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化
    3
  2. 02
    产品发布Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持
    8
01

模型发布

MODEL RELEASE3 篇

Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化

protoLabsAI 发布了 Ornith-1.5-9B 模型的 GGUF 量化版本,内置蒸馏 MTP 草稿头,支持 llama.cpp 的无损多 token 自推测解码,无需单独草稿模型。该版本针对不同硬件提供多种量化档位,其中 NVFP4 在 Blackwell 上速度最快(299 tok/s),IQ4_XS 适合 6GB 显存,但 IQ2_M 在长文本生成中易退化。模型还包含视觉投影器,支持图像输入,并提供了推荐的采样参数以避免重复生成。

阅读原文 ↗

Ornith-1.5-9B:端到端自我改进的轻量级编码模型

ornith-ai 发布了 Ornith-1.5-9B 模型,这是 Ornith-1.5 系列中最轻量的 9B 密集模型,通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成。该模型在编码基准测试中表现优异,如 SWE-bench Verified 得分 70.6,并支持移动端量化部署。

阅读原文 ↗

KernelBench-RLVR-120b 模型发布 GGUF 量化版本

mradermacher 发布了 KernelBench-RLVR-120b 模型的 GGUF 量化版本,该模型基于 Jarrodbarnes 的 KernelBench-RLVR-120b,专注于 GPU 内核代码生成,并通过 GRPO 强化学习在 KernelBench 数据集上训练。量化版本提供了多种精度的 GGUF 文件,方便用户在本地部署。

阅读原文 ↗
02

产品发布

PRODUCT RELEASE8 篇

Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持

Ray 2.58.0 发布,重点包括 Ray Serve LLM 完成 KV 缓存和 token 感知路由,Ray Core 支持任务事件卸载,Ray Data 新增 Databricks Delta Lake 集成和 shuffle v2 后端,并推出实验性 Ray Sandbox 和 TPU 支持。这些改进提升了推理性能、数据处理效率和资源调度能力。

阅读原文 ↗

llama.cpp b10593 发布:修复 DeepseekV4 多序列回滚问题

llama.cpp 发布 b10593 版本,主要修复了 DeepseekV4 在多序列场景下的回滚问题,并进行了模型加载修复、缓存清理优化和图拓扑静态化等改进。该版本提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

阅读原文 ↗

llama.cpp b10594 发布:修复 CUDA 显存浪费问题

llama.cpp 发布 b10594 版本,主要修复了设备信息循环在非 TRACE 日志级别下仍会创建 GPU 上下文并导致 CUDA 后端分配 550 MB 显存的问题。该修复通过检查日志详细级别,在无输出时跳过设备循环,避免不必要的 GPU 资源占用。

阅读原文 ↗

LiteLLM v1.98.0 发布:镜像签名验证与多项功能更新

LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token 数、向量存储索引列表 API 等。

阅读原文 ↗

LiteLLM v1.99.0-rc.1 发布:镜像签名验证与多项修复

LiteLLM 发布 v1.99.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及 SCIM 组匹配、流式消息成本计算、Bedrock 响应头转发、spend 日志哈希、预算跟踪、路由响应体增强、guardrails 策略执行、Redis 集群超时处理等。

阅读原文 ↗

银河通用人形机器人网球首秀,突破具身智能AstraTennis时刻

银河通用在第二届世界人形机器人运动会上展示了全球首次全自主网球对打的人形机器人,其核心是名为银河星脑的具身大模型,实现了大脑、小脑和脑桥的一体化。公司还推出了AstraBrain Latent算法和银河星坊数据集,通过多智能体博弈实现技能涌现,并成功迁移到真实场景。这一突破展示了具身智能在真实对抗中的协同能力,为行业提供了可复用的范式。

阅读原文 ↗

llama.cpp b10589 发布:新增 CUDA POOL_1D 支持

llama.cpp 发布 b10589 版本,主要新增 CUDA 后端对 POOL_1D 操作的支持,并修复了 editorconfig 兼容性问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。

阅读原文 ↗

伽利略发布Galileo X陆行具身系统,打通机器人全地形移动能力

伽利略在世界机器人大会上发布了陆行具身系统Galileo X,该系统通过可变形态融合轮式、四轮足和越野底盘,具备高精度转运、长距离越野和复杂地形越障能力。其核心创新包括多构型可变平台、复合主动悬挂系统和360度无限旋转关节,并搭载多模态基座模型,旨在解决传统移动机器人场景割裂的痛点,为具身智能商业化提供通用移动底座。

阅读原文 ↗
11独立事件
9一手报道
6发布来源
≈7 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/24 23:32:39 · report-v3