VOL. 2026-08-18 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-18 · PUBLISHED · 约 9 分钟
今日AI行业焦点集中在模型发布与推理效率优化上
今日AI行业焦点集中在模型发布与推理效率优化上。inclusionAI 连续推出 Ling-3.0-flash 和 Ling-3.0-tiny 两款混合推理模型,分别以124B总参数/5.5B激活和7.9B总参数/1.4B激活的稀疏MoE架构,在保持性能的同时大幅降低计算成本,成为当日最突出的技术趋势。同时,NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart,同样采用混合MoE架构(30B总参数/3B激活),面向高容量代理工作负载,显示行业对高效推理的持续追求。在应用层面,AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体通过 x402 协议自动处理支付,标志着AI智能体向实际商业场景落地迈出一步。此外,Haystack、Quarkus LangChain4j、langchain-openai 等开发工具链的更新,以及关于token膨胀感知路由和开放集胶片模拟的研究,共同构成了从模型、工具到应用的多元化进展。
今日看点
3 个章节 · 12 条情报- 01模型发布inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B5
- 02产品发布Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更5
- 03研究进展Token 膨胀感知路由:面向智能体 LLM 系统的成本优化2
模型发布
MODEL RELEASE5 篇inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.5B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE,在多个基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 SGLang HiCache 和 Mooncake 分层缓存,可将长输入场景的首 token 延迟降低 60% 至 80% 以上。模型已在 Hugging Face 和 ModelScope 上开源,支持 Claude Code、Kilo Code 等框架。
inclusionAI 发布轻量级混合推理 MoE 模型 Ling-3.0-tiny
inclusionAI 发布了 Ling-3.0-tiny,一个轻量级混合推理 MoE 模型,总参数量 7.9B,每 token 仅激活 1.4B 参数。该模型采用 KDA 与 MLA 交替的混合线性架构,支持可配置的思考模式,并针对本地和边缘部署优化,在 DGX Spark 和 M4 Pro MacBook 上分别达到约 100-105 tokens/s 和 86-90 tokens/s 的推理速度。模型提供 BF16、FP8 和 INT4 权重,适用于多种硬件环境。
inclusionAI 发布 Ling-3.0-flash:124B 参数原生混合推理模型
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.1B,采用原生混合线性注意力架构(KDA 与 MLA 交替堆叠)和稀疏 MoE,在多项基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 10,000+ 交互训练环境,并原生支持 SGLang HiCache + Mooncake 分层缓存,可将长输入场景下的首 token 延迟降低 60% 至 80% 以上。模型在代码、智能体、通用知识、数学推理等基准上表现强劲,并兼容 Claude Code、Kilo Code 等主流框架。
Jais 2:阿拉伯语中心的开源大语言模型家族
MBZUAI、Cerebras 和 Inception 联合发布了 Jais 2,一个以阿拉伯语为中心的开源大语言模型家族,包括 70B 和 8B 参数版本。该模型在阿拉伯语和文化相关基准测试中表现优异,并支持高效推理,70B 版本在 Cerebras 硬件上可实现每秒 2000 token 的生成速度。模型已在 HuggingFace 上以商业许可发布,并提供聊天应用。
NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart
AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStart 直接部署,无需手动配置服务基础设施,并可基于 NVIDIA NeMo 进行定制。
产品发布
PRODUCT RELEASE5 篇Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更
Haystack 发布 v3.1.0-rc1 版本,包含多项破坏性变更和新功能。主要变更包括:Agent 的 exit_reason 成为保留状态键、state_schema 属性行为调整、PipelineSnapshot 输入格式变化、不安全组件加载限制、SentenceWindowRetriever 参数校验等。新功能方面,为 Agent 增加了实验性的上下文压缩机制(CompactionHook),并支持 PDF 链接解析。
Quarkus LangChain4j 1.13.0 发布:新增 Guardrails 页面与工具调用支持
Quarkus LangChain4j 发布了 1.13.0 版本,该版本升级了 LangChain4j 依赖至 1.19.0,并引入了多项新功能,包括在 Dev UI 中新增 Guardrails 页面、支持在 AI 服务方法上使用 @Skills 注解、为 GPULlama3 添加工具调用支持,以及修复了多个问题。此外,还改进了文档结构,将 Agentic AI 提升一级,并调整了 Guardrails 和 Function Calling 的菜单位置。
langchain-openai 1.5.2a1 发布:支持 OpenAI 3.0 SDK 与网关元数据
LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处理和错误处理能力。
AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体自动交易
AWS 与 OpenClaw 基金会合作,在 Amazon Bedrock AgentCore 中推出 AgentCore payments 功能,使 OpenClaw 智能体能够通过 x402 协议处理 HTTP 402 支付挑战,在预设限额内自动完成小额稳定币支付。该方案通过分离人工管理路径与模型运行时权限,防止提示注入影响支付授权,并支持 Coinbase 或 Stripe Privy 钱包。
llama.cpp b10483 发布:修复 xcframework 并清理 CMake 构建
llama.cpp 发布 b10483 版本,主要修复了 xcframework 构建问题,并清理了 CMake 构建系统,为所有 vendored 库添加了 vendor:: 别名目标,统一了包含路径。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
研究进展
RESEARCH2 篇Token 膨胀感知路由:面向智能体 LLM 系统的成本优化
arXiv 论文提出 InflationAgent,一种面向智能体 LLM 系统的路由框架,通过量化 token 膨胀(重试导致的真实成本与单次调用成本之比)来优化模型选择。其引入 CoT 分支熵(CBE)作为预执行难度信号,并以语义汇率(SER)为目标进行路由,在 GSM8K 上以更少 token 达到更高准确率,同时验证了失败链转发会显著降低强模型性能。
Deep Analog:基于参考条件 3D LUT 的开放集胶片模拟
Deep Analog 提出了一种开放集胶片模拟方法,通过参考图像预测单个 3D LUT,取代了传统的固定 LUT 库混合方法。研究发现传统方法存在门控崩溃问题,而新方法通过残差参数化和自监督训练,实现了对任意胶片风格的实时模拟,并支持导出 .cube LUT 用于主流软件。