VOL. 2026-08-21 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-21 · PUBLISHED · 约 9 分钟
今日AI领域呈现模型发布与基础设施优化并行的态势
今日AI领域呈现模型发布与基础设施优化并行的态势。在模型侧,多款无审查或量化版本集中发布,如LTX-2.3 22B、Ektome-Qwen3.8-27B及Ling-3.0-tiny的GGUF量化版,均旨在降低本地部署门槛或扩展应用场景;同时,机器人基础模型GEN-1.5展示了通过少量演示即可学会新任务的one-shot能力,而微软Skala 1.1则在科学计算领域提升了DFT模拟精度。基础设施方面,llama.cpp连续发布两个版本,分别优化CUDA和Metal后端的解码与注意力性能,FastGPT与Spring AI则聚焦于工具Schema迁移、音频流支持等工程改进。研究层面,阿拉伯语手写识别、晚期交互检索量化及VLM分布偏移安全性等课题亦有新进展,整体反映出从模型能力拓展到推理效率与安全审计的多线推进。
今日看点
3 个章节 · 12 条情报- 01模型发布LTX-2.3 22B uncensored 量化版发布:支持本地视频生成5
- 02产品发布FastGPT v4.16.1 发布:沙盒镜像更新与工具 Schema 迁移4
- 03研究进展Phoenix 与 Athar:面向阿拉伯语手稿的紧凑多领域 HTR 与证据感知审阅3
模型发布
MODEL RELEASE5 篇LTX-2.3 22B uncensored 量化版发布:支持本地视频生成
ChrisColeTech 发布了 LTX-2.3 22B uncensored 模型的 GGUF/FP8/INT8 量化版本,提供六种量化格式及配套的文本编码器、VAE、蒸馏 LoRA 和空间放大模型,用于本地运行文本到视频和图像到视频生成。该仓库提供了详细的推荐参数(如 1024×576 分辨率、12 步采样)和实测性能数据(RTX 5090 上生成 5 秒视频约需 11 分钟),并强调蒸馏 LoRA 为必需组件。此发布旨在方便用户本地部署,但未包含重新训练,且许可证未知。
Ektome-Qwen3.8-27B:无审查模型发布,能力保持且支持长上下文
Zynerji 发布了基于 Qwen3.8-27B 的未审查模型 Ektome-Qwen3.8-27B-PristinelyUncensored,采用 Ektomē 技术去除拒绝行为,同时保持甚至略微提升模型能力(MMLU-val 从 0.812 升至 0.818,有害请求拒绝率从 100% 降至 0%)。该模型保留了完整的 MTP 头和视觉塔,并提供了多种量化版本,其中 HOMEUSER-16-24 版本可在 24GB 显卡上支持 262,144 token 的上下文。模型还支持多 token 预测(MTP)加速,在 GPTQ 版本上测得最高 63% 的加速。
Ling-3.0-tiny GGUF 量化版发布,支持多种精度
bloomer010 发布了 inclusionAI/Ling-3.0-tiny 模型的 GGUF 量化版本,支持多种量化精度,并已集成到 llama.cpp 中。该模型为 7.9B 参数的 MoE 架构,激活参数 1.3B,支持 131K 上下文。量化版本经过验证,可在 CPU 和 CUDA 上运行,并提供了使用指南。
机器人GPT-3时刻:GEN-1.5看3秒演示即学会新动作
Generalist AI 发布了机器人基础模型 GEN-1.5,该模型通过大规模物理数据预训练,实现了 one-shot learning,机器人仅需观看 3-12 秒的动作演示即可学会新任务,且无需梯度更新或微调。模型还能拼接不同演示、从模拟器迁移到真实世界,这些能力是自发涌现的,被视为机器人领域的 GPT-3 时刻。在 10 种任务测试中,零样本平均成功率为 59%,微调后可提升至 83%。
微软发布Skala 1.1:提升DFT精度并集成主流化学软件
微软研究院发布了深度学习密度泛函(DFT)模型 Skala 1.1,该版本训练数据量是前版的2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala 现已集成到 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,同时推出实时基准以跟踪性能。这些进展旨在使计算化学模拟更具预测性,并广泛应用于科学和工业流程。
产品发布
PRODUCT RELEASE4 篇FastGPT v4.16.1 发布:沙盒镜像更新与工具 Schema 迁移
FastGPT 发布 v4.16.1 版本,主要更新包括:Agent Sandbox 镜像地址改为完整运行态镜像,并支持自定义 apt 源;MCP/HTTP 工具的 JSON Schema 统一为字符串存储,需按顺序执行迁移脚本;新增第三方发布渠道支持多模态文件、音频转录和引用,支持团队安装系统插件(进程模式)。此外,优化了 S3 key 命名、修复了多个工作流和插件相关问题。
llama.cpp b10534 发布:CUDA 解码交叉点优化
llama.cpp 发布 b10534 版本,主要更新为 CUDA 后端新增按硬件和量化类型调整的切换点,用于优化 mvq 到 MMQ 解码的交叉点。该更新引入了运行时环境变量 GGML_CUDA_MMVQ_MAX 来调整批量大小阈值,并针对 Blackwell、Ada 等硬件进行了调优,在 RTX 5090 上 Q4_K 密集解码在 B=8 时性能提升 23-41%。
llama.cpp b10532:Metal 后端 KV 反量化优化 Flash Attention
llama.cpp 发布 b10532 版本,在 Metal 后端为 flash attention 新增 KV 缓存反量化预处理,将 Q8_0、Q4_0、Q4_1、Q5_0、Q5_1 等量化 KV 反量化为 F16 后运行注意力内核,并优化了 MLA 模型中 V 为 K 视图时的冗余反量化。该版本在 M2 Ultra 上通过全部 4798 项测试,Qwen2.5-0.5B 的困惑度与 F16 KV 参考一致。
Spring AI 2.0.1 发布:新增音频流与工具调用限制支持
Spring AI 发布 2.0.1 版本,包含多项新功能和错误修复。新功能包括支持 OpenAI 音频流、可配置工具调用限制、Google GenAI 的 ToolChoice 支持、Google 图像生成支持等。错误修复涉及 Redis 聊天内存、PDF 文档读取、OpenAI 流关闭等问题。该版本还移除了弃用的 Mistral AI 聊天模型,并更新了升级说明。
研究进展
RESEARCH3 篇Phoenix 与 Athar:面向阿拉伯语手稿的紧凑多领域 HTR 与证据感知审阅
本文提出 Phoenix,一个 499 万参数的 CNN-BiLSTM-CTC 阿拉伯语手写文本识别模型,以及 Athar,一个证据感知的审阅工作流。Phoenix 通过文档感知重放和遗忘防护实现多领域适应,在大型测试集上字符错误率从 19.98% 降至 14.93%,相对降低 25.3%。研究发现候选选择是主要瓶颈,自动重排序方法无法弥补 oracle 差距,因此 Athar 强调保留视觉证据、提供有限替代方案并导出可审计记录。
CrossQ:面向晚期交互检索的跨令牌条件量化方法
CrossQ 是一种针对晚期交互检索模型(如 ColBERT)的跨令牌条件量化方法,通过在索引时计算轻量级文档上下文来指导码本选择,从而在压缩文档向量索引的同时保持排序质量。实验表明,在 2 B/token 下,CrossQ 在 BEIR 子集上将 MRR@10 提升了 0.010,在 4 B/token 下将 nDCG@10 提升了 0.009,并实现了 64 倍的原始存储压缩。该方法采用排序对齐的损失函数(如列表式蒸馏和成对排序损失)来保护候选分数分布和难负样本边界,在 8 B/token 下结合轻量微调可保留约 98% 的全精度 ColBERT 性能。
边际覆盖率无法保证零样本VLM在偏移下的类别条件安全性
该研究审计了零样本视觉语言模型(如CLIP、OpenCLIP、SigLIP)在分布偏移下使用分裂共形预测的类别条件安全性。研究发现,边际覆盖率看似较高(如ImageNet-Sketch上约0.86),但最差类别的覆盖率可降至0,且10-12%的类别低于有限样本零下限。源域诊断无法预测失败,源端Mondrian校准不迁移,目标端类别校准虽提升尾部但需每类标签且集合大小代价高。结论是边际共形覆盖率应视为平均可靠性统计,而非类别尾部的安全保证。