VOL. 2026-08-18 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-18 · PUBLISHED · 约 10 分钟
当日AI行业最显著的变化是inclusionAI集中发布Ling-3…
当日AI行业最显著的变化是inclusionAI集中发布Ling-3.0系列模型,包括旗舰级Ling-3.0-flash和轻量级Ling-3.0-tiny,均采用混合线性注意力与稀疏MoE架构,在极低激活参数下实现高性能推理,凸显高效推理成为模型迭代的核心方向。同时,NVIDIA Nemotron 3.5 Lightning登陆AWS SageMaker JumpStart,进一步推动混合MoE模型在云端代理场景的落地。在应用层面,AWS与OpenClaw合作推出AgentCore支付功能,使智能体能够自动处理HTTP 402支付挑战,标志着AI智能体向自主交易迈出重要一步。此外,多项工具链更新值得关注:Haystack v3.1.0-rc1引入Agent上下文压缩等破坏性变更,Quarkus LangChain4j 1.13.0新增Guardrails页面,langchain-openai 1.5.2a1支持OpenAI 3.0 SDK,这些更新共同提升了Agent开发与部署的健壮性。研究方面,Claude AI生成的Python测试质量不弱于人类测试,以及无需噪声条件的自适应视频生成框架EqF,分别展示了AI在软件质量保障和生成任务中的潜力。
今日看点
3 个章节 · 12 条情报- 01模型发布inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B5
- 02产品发布Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更5
- 03研究进展Claude AI生成的Python测试质量不弱于人类测试2
模型发布
MODEL RELEASE5 篇inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.5B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE,在多个基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 SGLang HiCache 和 Mooncake 分层缓存,可将长输入场景的首 token 延迟降低 60% 至 80% 以上。模型已在 Hugging Face 和 ModelScope 上开源,支持 Claude Code、Kilo Code 等框架。
inclusionAI 发布轻量级混合推理 MoE 模型 Ling-3.0-tiny
inclusionAI 发布了 Ling-3.0-tiny,一个轻量级混合推理 MoE 模型,总参数量 7.9B,每 token 仅激活 1.4B 参数。该模型采用 KDA 与 MLA 交替的混合线性架构,支持可配置的思考模式,并针对本地和边缘部署优化,在 DGX Spark 和 M4 Pro MacBook 上分别达到约 100-105 tokens/s 和 86-90 tokens/s 的推理速度。模型提供 BF16、FP8 和 INT4 权重,适用于多种硬件环境。
inclusionAI 发布 Ling-3.0-flash:124B 参数原生混合推理模型
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.1B,采用原生混合线性注意力架构(KDA 与 MLA 交替堆叠)和稀疏 MoE,在多项基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 10,000+ 交互训练环境,并原生支持 SGLang HiCache + Mooncake 分层缓存,可将长输入场景下的首 token 延迟降低 60% 至 80% 以上。模型在代码、智能体、通用知识、数学推理等基准上表现强劲,并兼容 Claude Code、Kilo Code 等主流框架。
Jais 2:阿拉伯语中心的开源大语言模型家族
MBZUAI、Cerebras 和 Inception 联合发布了 Jais 2,一个以阿拉伯语为中心的开源大语言模型家族,包括 70B 和 8B 参数版本。该模型在阿拉伯语和文化相关基准测试中表现优异,并支持高效推理,70B 版本在 Cerebras 硬件上可实现每秒 2000 token 的生成速度。模型已在 HuggingFace 上以商业许可发布,并提供聊天应用。
NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart
AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStart 直接部署,无需手动配置服务基础设施,并可基于 NVIDIA NeMo 进行定制。
产品发布
PRODUCT RELEASE5 篇Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更
Haystack 发布 v3.1.0-rc1 版本,包含多项破坏性变更和新功能。主要变更包括:Agent 的 exit_reason 成为保留状态键、state_schema 属性行为调整、PipelineSnapshot 输入格式变化、不安全组件加载限制、SentenceWindowRetriever 参数校验等。新功能方面,为 Agent 增加了实验性的上下文压缩机制(CompactionHook),并支持 PDF 链接解析。
Quarkus LangChain4j 1.13.0 发布:新增 Guardrails 页面与工具调用支持
Quarkus LangChain4j 发布了 1.13.0 版本,该版本升级了 LangChain4j 依赖至 1.19.0,并引入了多项新功能,包括在 Dev UI 中新增 Guardrails 页面、支持在 AI 服务方法上使用 @Skills 注解、为 GPULlama3 添加工具调用支持,以及修复了多个问题。此外,还改进了文档结构,将 Agentic AI 提升一级,并调整了 Guardrails 和 Function Calling 的菜单位置。
langchain-openai 1.5.2a1 发布:支持 OpenAI 3.0 SDK 与网关元数据
LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处理和错误处理能力。
AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体自动交易
AWS 与 OpenClaw 基金会合作,在 Amazon Bedrock AgentCore 中推出 AgentCore payments 功能,使 OpenClaw 智能体能够通过 x402 协议处理 HTTP 402 支付挑战,在预设限额内自动完成小额稳定币支付。该方案通过分离人工管理路径与模型运行时权限,防止提示注入影响支付授权,并支持 Coinbase 或 Stripe Privy 钱包。
llama.cpp b10483 发布:修复 xcframework 并清理 CMake 构建
llama.cpp 发布 b10483 版本,主要修复了 xcframework 构建问题,并清理了 CMake 构建系统,为所有 vendored 库添加了 vendor:: 别名目标,统一了包含路径。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
研究进展
RESEARCH2 篇Claude AI生成的Python测试质量不弱于人类测试
一项研究评估了Claude AI生成的Python测试与人类编写的测试质量,发现Claude Sonnet/Opus 4.6及更新模型生成的测试在多个评估协议下不弱于人类编写的测试。该研究使用真实工具Extractor的测试套件,并采用四种独立评估方法,包括历史回退测试、AST变异测试、覆盖引导变异测试和定性评分。结果表明AI生成的测试质量与人类相当,但研究也指出此结果仅适用于2025年11月后的模型。
均衡强制:无需噪声条件的自适应视频生成
arXiv 论文提出 Equilibrium Forcing (EqF) 框架,用于无需噪声水平条件的自适应视频生成。EqF 通过均衡速度场和闭环反馈机制,在推理时自适应调整采样,提升视频质量和一致性。实验表明,EqF 在 1.3B 和 5B 参数的 Flow Matching 模型上微调,性能优于标准噪声条件方法。