VOL. 2026-08-18 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

今日AI行业焦点集中在模型发布与推理效率优化上

今日AI行业焦点集中在模型发布与推理效率优化上。inclusionAI 连续推出 Ling-3.0-flash 和 Ling-3.0-tiny 两款混合推理模型,分别以124B总参数/5.5B激活和7.9B总参数/1.4B激活的稀疏MoE架构,在保持性能的同时大幅降低计算成本,成为当日最突出的技术趋势。同时,NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart,同样采用混合MoE架构(30B总参数/3B激活),面向高容量代理工作负载,显示行业对高效推理的持续追求。在应用层面,AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体通过 x402 协议自动处理支付,标志着AI智能体向实际商业场景落地迈出一步。此外,Haystack、Quarkus LangChain4j、langchain-openai 等开发工具链的更新,以及关于token膨胀感知路由和开放集胶片模拟的研究,共同构成了从模型、工具到应用的多元化进展。

今日看点

3 个章节 · 12 条情报
  1. 01
    模型发布inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B
    5
  2. 02
    产品发布Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更
    5
  3. 03
    研究进展Token 膨胀感知路由:面向智能体 LLM 系统的成本优化
    2
01

模型发布

MODEL RELEASE5 篇

inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B

inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.5B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE,在多个基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 SGLang HiCache 和 Mooncake 分层缓存,可将长输入场景的首 token 延迟降低 60% 至 80% 以上。模型已在 Hugging Face 和 ModelScope 上开源,支持 Claude Code、Kilo Code 等框架。

阅读原文 ↗

inclusionAI 发布轻量级混合推理 MoE 模型 Ling-3.0-tiny

inclusionAI 发布了 Ling-3.0-tiny,一个轻量级混合推理 MoE 模型,总参数量 7.9B,每 token 仅激活 1.4B 参数。该模型采用 KDA 与 MLA 交替的混合线性架构,支持可配置的思考模式,并针对本地和边缘部署优化,在 DGX Spark 和 M4 Pro MacBook 上分别达到约 100-105 tokens/s 和 86-90 tokens/s 的推理速度。模型提供 BF16、FP8 和 INT4 权重,适用于多种硬件环境。

阅读原文 ↗

inclusionAI 发布 Ling-3.0-flash:124B 参数原生混合推理模型

inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.1B,采用原生混合线性注意力架构(KDA 与 MLA 交替堆叠)和稀疏 MoE,在多项基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 10,000+ 交互训练环境,并原生支持 SGLang HiCache + Mooncake 分层缓存,可将长输入场景下的首 token 延迟降低 60% 至 80% 以上。模型在代码、智能体、通用知识、数学推理等基准上表现强劲,并兼容 Claude Code、Kilo Code 等主流框架。

阅读原文 ↗

Jais 2:阿拉伯语中心的开源大语言模型家族

MBZUAI、Cerebras 和 Inception 联合发布了 Jais 2,一个以阿拉伯语为中心的开源大语言模型家族,包括 70B 和 8B 参数版本。该模型在阿拉伯语和文化相关基准测试中表现优异,并支持高效推理,70B 版本在 Cerebras 硬件上可实现每秒 2000 token 的生成速度。模型已在 HuggingFace 上以商业许可发布,并提供聊天应用。

阅读原文 ↗

NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart

AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStart 直接部署,无需手动配置服务基础设施,并可基于 NVIDIA NeMo 进行定制。

阅读原文 ↗
02

产品发布

PRODUCT RELEASE5 篇

Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更

Haystack 发布 v3.1.0-rc1 版本,包含多项破坏性变更和新功能。主要变更包括:Agent 的 exit_reason 成为保留状态键、state_schema 属性行为调整、PipelineSnapshot 输入格式变化、不安全组件加载限制、SentenceWindowRetriever 参数校验等。新功能方面,为 Agent 增加了实验性的上下文压缩机制(CompactionHook),并支持 PDF 链接解析。

阅读原文 ↗

Quarkus LangChain4j 1.13.0 发布:新增 Guardrails 页面与工具调用支持

Quarkus LangChain4j 发布了 1.13.0 版本,该版本升级了 LangChain4j 依赖至 1.19.0,并引入了多项新功能,包括在 Dev UI 中新增 Guardrails 页面、支持在 AI 服务方法上使用 @Skills 注解、为 GPULlama3 添加工具调用支持,以及修复了多个问题。此外,还改进了文档结构,将 Agentic AI 提升一级,并调整了 Guardrails 和 Function Calling 的菜单位置。

阅读原文 ↗

langchain-openai 1.5.2a1 发布:支持 OpenAI 3.0 SDK 与网关元数据

LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处理和错误处理能力。

阅读原文 ↗

AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体自动交易

AWS 与 OpenClaw 基金会合作,在 Amazon Bedrock AgentCore 中推出 AgentCore payments 功能,使 OpenClaw 智能体能够通过 x402 协议处理 HTTP 402 支付挑战,在预设限额内自动完成小额稳定币支付。该方案通过分离人工管理路径与模型运行时权限,防止提示注入影响支付授权,并支持 Coinbase 或 Stripe Privy 钱包。

阅读原文 ↗

llama.cpp b10483 发布:修复 xcframework 并清理 CMake 构建

llama.cpp 发布 b10483 版本,主要修复了 xcframework 构建问题,并清理了 CMake 构建系统,为所有 vendored 库添加了 vendor:: 别名目标,统一了包含路径。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

阅读原文 ↗
03

研究进展

RESEARCH2 篇

Token 膨胀感知路由:面向智能体 LLM 系统的成本优化

arXiv 论文提出 InflationAgent,一种面向智能体 LLM 系统的路由框架,通过量化 token 膨胀(重试导致的真实成本与单次调用成本之比)来优化模型选择。其引入 CoT 分支熵(CBE)作为预执行难度信号,并以语义汇率(SER)为目标进行路由,在 GSM8K 上以更少 token 达到更高准确率,同时验证了失败链转发会显著降低强模型性能。

阅读原文 ↗

Deep Analog:基于参考条件 3D LUT 的开放集胶片模拟

Deep Analog 提出了一种开放集胶片模拟方法,通过参考图像预测单个 3D LUT,取代了传统的固定 LUT 库混合方法。研究发现传统方法存在门控崩溃问题,而新方法通过残差参数化和自监督训练,实现了对任意胶片风格的实时模拟,并支持导出 .cube LUT 用于主流软件。

阅读原文 ↗
12独立事件
12一手报道
8发布来源
≈9 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/19 22:12:11 · report-v3