VOL. 2026-08-21 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

今日AI领域最突出的变化是多个无审查或未审查模型的集中发布,包括LT…

今日AI领域最突出的变化是多个无审查或未审查模型的集中发布,包括LTX-2.3 22B量化版、Ektome-Qwen3.8-27B和Qwen3.8-27B-heretic-dflash,这些模型在保持或提升能力的同时,支持本地视频生成、长上下文和投机解码等特性。与此同时,基础设施和工具链的更新成为次要趋势,NVIDIA推出DSX MaxLPS以提升AI工厂能效,llama.cpp连续发布b10534和b10532版本优化CUDA和Metal后端的解码性能,FastGPT、Strands Agents SDK、Spring AI和Google ADK JS等开发工具也分别发布了新版本,增强了音频流、工具调用和沙盒等功能。此外,机器人基础模型GEN-1.5展示了通过少量演示即可学会新任务的one-shot学习能力,而微软的Skala 1.1则在科学计算领域提升了DFT模拟精度并集成到主流化学软件中。

今日看点

2 个章节 · 12 条情报
  1. 01
    模型发布LTX-2.3 22B uncensored 量化版发布:支持本地视频生成
    5
  2. 02
    产品发布NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能
    7
01

模型发布

MODEL RELEASE5 篇

LTX-2.3 22B uncensored 量化版发布:支持本地视频生成

ChrisColeTech 发布了 LTX-2.3 22B uncensored 模型的 GGUF/FP8/INT8 量化版本,提供六种量化格式及配套的文本编码器、VAE、蒸馏 LoRA 和空间放大模型,用于本地运行文本到视频和图像到视频生成。该仓库提供了详细的推荐参数(如 1024×576 分辨率、12 步采样)和实测性能数据(RTX 5090 上生成 5 秒视频约需 11 分钟),并强调蒸馏 LoRA 为必需组件。此发布旨在方便用户本地部署,但未包含重新训练,且许可证未知。

阅读原文 ↗

Ektome-Qwen3.8-27B:无审查模型发布,能力保持且支持长上下文

Zynerji 发布了基于 Qwen3.8-27B 的未审查模型 Ektome-Qwen3.8-27B-PristinelyUncensored,采用 Ektomē 技术去除拒绝行为,同时保持甚至略微提升模型能力(MMLU-val 从 0.812 升至 0.818,有害请求拒绝率从 100% 降至 0%)。该模型保留了完整的 MTP 头和视觉塔,并提供了多种量化版本,其中 HOMEUSER-16-24 版本可在 24GB 显卡上支持 262,144 token 的上下文。模型还支持多 token 预测(MTP)加速,在 GPTQ 版本上测得最高 63% 的加速。

阅读原文 ↗

Qwen3.8-27B-heretic-dflash:非官方 5 层 DFlash 投机解码草稿模型

jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLLM 和 SGLang 等推理框架。

阅读原文 ↗

机器人GPT-3时刻:GEN-1.5看3秒演示即学会新动作

Generalist AI 发布了机器人基础模型 GEN-1.5,该模型通过大规模物理数据预训练,实现了 one-shot learning,机器人仅需观看 3-12 秒的动作演示即可学会新任务,且无需梯度更新或微调。模型还能拼接不同演示、从模拟器迁移到真实世界,这些能力是自发涌现的,被视为机器人领域的 GPT-3 时刻。在 10 种任务测试中,零样本平均成功率为 59%,微调后可提升至 83%。

阅读原文 ↗

微软发布Skala 1.1:提升DFT精度并集成主流化学软件

微软研究院发布了深度学习密度泛函(DFT)模型 Skala 1.1,该版本训练数据量是前版的2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala 现已集成到 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,同时推出实时基准以跟踪性能。这些进展旨在使计算化学模拟更具预测性,并广泛应用于科学和工业流程。

阅读原文 ↗
02

产品发布

PRODUCT RELEASE7 篇

NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能

NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数据中心的功率利用率。

阅读原文 ↗

FastGPT v4.16.1 发布:沙盒镜像更新与工具 Schema 迁移

FastGPT 发布 v4.16.1 版本,主要更新包括:Agent Sandbox 镜像地址改为完整运行态镜像,并支持自定义 apt 源;MCP/HTTP 工具的 JSON Schema 统一为字符串存储,需按顺序执行迁移脚本;新增第三方发布渠道支持多模态文件、音频转录和引用,支持团队安装系统插件(进程模式)。此外,优化了 S3 key 命名、修复了多个工作流和插件相关问题。

阅读原文 ↗

Strands Agents SDK TypeScript v1.14.0 发布

Strands Agents SDK 发布了 TypeScript 版本的 v1.14.0 更新,包含多项新功能、修复和文档改进。主要新功能包括音频内容块、文件内存存储、上下文管理器卸载策略、工具上下文中的执行范围取消、代理作为工具委托、MCP 客户端 OAuth 认证以及 Anthropic 提示缓存支持。修复了多个与 Bedrock 缓存、多代理令牌计数、OpenAI 兼容性相关的问题。

阅读原文 ↗

llama.cpp b10534 发布:CUDA 解码交叉点优化

llama.cpp 发布 b10534 版本,主要更新为 CUDA 后端新增按硬件和量化类型调整的切换点,用于优化 mvq 到 MMQ 解码的交叉点。该更新引入了运行时环境变量 GGML_CUDA_MMVQ_MAX 来调整批量大小阈值,并针对 Blackwell、Ada 等硬件进行了调优,在 RTX 5090 上 Q4_K 密集解码在 B=8 时性能提升 23-41%。

阅读原文 ↗

llama.cpp b10532:Metal 后端 KV 反量化优化 Flash Attention

llama.cpp 发布 b10532 版本,在 Metal 后端为 flash attention 新增 KV 缓存反量化预处理,将 Q8_0、Q4_0、Q4_1、Q5_0、Q5_1 等量化 KV 反量化为 F16 后运行注意力内核,并优化了 MLA 模型中 V 为 K 视图时的冗余反量化。该版本在 M2 Ultra 上通过全部 4798 项测试,Qwen2.5-0.5B 的困惑度与 F16 KV 参考一致。

阅读原文 ↗

Spring AI 2.0.1 发布:新增音频流与工具调用限制支持

Spring AI 发布 2.0.1 版本,包含多项新功能和错误修复。新功能包括支持 OpenAI 音频流、可配置工具调用限制、Google GenAI 的 ToolChoice 支持、Google 图像生成支持等。错误修复涉及 Redis 聊天内存、PDF 文档读取、OpenAI 流关闭等问题。该版本还移除了弃用的 Mistral AI 聊天模型,并更新了升级说明。

阅读原文 ↗

Google ADK JS devtools v2.0.0 发布:移除 LLMAgentWrapper,新增 HITL 审批

Google 发布了 ADK JavaScript 的 devtools v2.0.0 版本,该版本引入了多项破坏性变更,包括移除 LLMAgentWrapper 和 WorkflowAgent,并允许将 Workflow 直接作为根节点运行。新版本还增加了 FunctionTool 的人工审批(HITL)功能,并在开发 UI 中支持渲染图工作流。此外,修复了多个 CLI、API 服务器和模型配置相关的缺陷。

阅读原文 ↗
12独立事件
11一手报道
9发布来源
≈9 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/22 23:49:22 · report-v3