VOL. 2026-W34 · 83 STORIES · WEEKLY SIGNALS
AI HOT RADAR 周报
2026-08-17 — 2026-08-23 · PUBLISHED · 约 53 分钟
本周AI行业围绕推理效率与具身智能两大主线展开
本周AI行业围绕推理效率与具身智能两大主线展开。在模型侧,Qwen3.8-27B成为社区量化热点,多个团队分别推出GGUF、NVFP4、EXL3、MLX等适配不同硬件的版本,并出现配套的投机解码草稿模型;同时,inclusionAI发布Ling-3.0系列,以混合线性注意力架构和稀疏MoE实现极低激活参数,代表轻量高效推理的新方向。在推理框架侧,llama.cpp密集迭代,持续修复CUDA显存浪费、draft上下文匹配等问题,并优化Metal后端KV反量化与CUDA解码交叉点;SGLang、Ray、LiteLLM等也分别发布新版本,强化多模型支持、KV缓存路由与镜像签名验证。具身智能领域,银河通用、优必选、魔法原子等厂商在WRC上集中展示人形机器人与四足机器人的落地场景,而Generalist AI的GEN-1.5通过one-shot learning实现机器人快速技能习得,被视为机器人领域的GPT-3时刻。此外,字节跳动发布SeedRealtime音视频全双工模型与Seedream 5.0 Pro图像生成模型,进一步拓展多模态交互与生成能力边界。
本周主线
4 个章节 · 83 条情报- 01模型发布Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化25
- 02产品发布Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持42
- 03安全OpenAI在Hugging Face事件后推出新安全措施1
- 04研究进展美团搜索3.0:LLM语义表征在排序模型的探索与应用15
模型发布
MODEL RELEASE25 篇Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化
protoLabsAI 发布了 Ornith-1.5-9B 模型的 GGUF 量化版本,内置蒸馏 MTP 草稿头,支持 llama.cpp 的无损多 token 自推测解码,无需单独草稿模型。该版本针对不同硬件提供多种量化档位,其中 NVFP4 在 Blackwell 上速度最快(299 tok/s),IQ4_XS 适合 6GB 显存,但 IQ2_M 在长文本生成中易退化。模型还包含视觉投影器,支持图像输入,并提供了推荐的采样参数以避免重复生成。
Ornith-1.5-9B:端到端自我改进的轻量级编码模型
ornith-ai 发布了 Ornith-1.5-9B 模型,这是 Ornith-1.5 系列中最轻量的 9B 密集模型,通过端到端自我改进循环,联合优化任务生成、脚手架构建和解决方案生成。该模型在编码基准测试中表现优异,如 SWE-bench Verified 得分 70.6,并支持移动端量化部署。
Qwen-3.8-27B 去审查版 8 位 MLX 量化发布
junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作为对照实验中的处理组。模型仅支持 MLX 框架,不兼容 transformers 或 vLLM。
Qwen3.8-27B 推出 16GB 显存适配的 GGUF 量化版
cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik_llama.cpp 项目的 IQ4_KS 和 IQ4_KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4_0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化版本的困惑度,结果显示其性能略优。
KernelBench-RLVR-120b 模型发布 GGUF 量化版本
mradermacher 发布了 KernelBench-RLVR-120b 模型的 GGUF 量化版本,该模型基于 Jarrodbarnes 的 KernelBench-RLVR-120b,专注于 GPU 内核代码生成,并通过 GRPO 强化学习在 KernelBench 数据集上训练。量化版本提供了多种精度的 GGUF 文件,方便用户在本地部署。
KAT-Coder-V2.5-Dev APEX GGUF 发布:MTP 头实现 2 倍加速
Hugging Face 上发布了 KAT-Coder-V2.5-Dev 模型的 APEX GGUF 量化版本,该版本移植了 Qwen3.6-35B-A3B 的 MTP 头,实现了投机解码加速。实测在 agentic 编码任务上最高获得 2.03 倍加速,且正确性不变。推荐使用 n-max 3 的投机深度设置,并提供了详细的性能对比数据。
LTX-2.3 22B uncensored 量化版发布:支持本地视频生成
ChrisColeTech 发布了 LTX-2.3 22B uncensored 模型的 GGUF/FP8/INT8 量化版本,提供六种量化格式及配套的文本编码器、VAE、蒸馏 LoRA 和空间放大模型,用于本地运行文本到视频和图像到视频生成。该仓库提供了详细的推荐参数(如 1024×576 分辨率、12 步采样)和实测性能数据(RTX 5090 上生成 5 秒视频约需 11 分钟),并强调蒸馏 LoRA 为必需组件。此发布旨在方便用户本地部署,但未包含重新训练,且许可证未知。
Ektome-Qwen3.8-27B:无审查模型发布,能力保持且支持长上下文
Zynerji 发布了基于 Qwen3.8-27B 的未审查模型 Ektome-Qwen3.8-27B-PristinelyUncensored,采用 Ektomē 技术去除拒绝行为,同时保持甚至略微提升模型能力(MMLU-val 从 0.812 升至 0.818,有害请求拒绝率从 100% 降至 0%)。该模型保留了完整的 MTP 头和视觉塔,并提供了多种量化版本,其中 HOMEUSER-16-24 版本可在 24GB 显卡上支持 262,144 token 的上下文。模型还支持多 token 预测(MTP)加速,在 GPTQ 版本上测得最高 63% 的加速。
inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.5B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE,在多个基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 SGLang HiCache 和 Mooncake 分层缓存,可将长输入场景的首 token 延迟降低 60% 至 80% 以上。模型已在 Hugging Face 和 ModelScope 上开源,支持 Claude Code、Kilo Code 等框架。
inclusionAI 发布 Ling-3.0-flash:124B 参数原生混合推理模型
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.1B,采用原生混合线性注意力架构(KDA 与 MLA 交替堆叠)和稀疏 MoE,在多项基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 10,000+ 交互训练环境,并原生支持 SGLang HiCache + Mooncake 分层缓存,可将长输入场景下的首 token 延迟降低 60% 至 80% 以上。模型在代码、智能体、通用知识、数学推理等基准上表现强劲,并兼容 Claude Code、Kilo Code 等主流框架。
inclusionAI 发布轻量级混合推理 MoE 模型 Ling-3.0-tiny
inclusionAI 发布了 Ling-3.0-tiny,一个轻量级混合推理 MoE 模型,总参数量 7.9B,每 token 仅激活 1.4B 参数。该模型采用 KDA 与 MLA 交替的混合线性架构,支持可配置的思考模式,并针对本地和边缘部署优化,在 DGX Spark 和 M4 Pro MacBook 上分别达到约 100-105 tokens/s 和 86-90 tokens/s 的推理速度。模型提供 BF16、FP8 和 INT4 权重,适用于多种硬件环境。
Qwen3.8-27B-heretic-dflash:非官方 5 层 DFlash 投机解码草稿模型
jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLLM 和 SGLang 等推理框架。
机器人GPT-3时刻:GEN-1.5看3秒演示即学会新动作
Generalist AI 发布了机器人基础模型 GEN-1.5,该模型通过大规模物理数据预训练,实现了 one-shot learning,机器人仅需观看 3-12 秒的动作演示即可学会新任务,且无需梯度更新或微调。模型还能拼接不同演示、从模拟器迁移到真实世界,这些能力是自发涌现的,被视为机器人领域的 GPT-3 时刻。在 10 种任务测试中,零样本平均成功率为 59%,微调后可提升至 83%。
字节发布 SeedRealtime 音视频全双工大模型,实现多模态自然交互
字节跳动旗下 Seed Research 正式发布 SeedRealtime,一款原生音视频全双工大语言模型。该模型采用统一架构原生融合音频、视频和文本,实现实时多模态交互,具备联合音视频理解、主动交互和自然对话节奏三大突破。端到端评估显示,相比级联模型,其音视频对话节奏问题减半,并已在行业率先实现大规模部署。
字节发布Seedream 5.0 Pro:多模态图像生成模型实现四大能力突破
字节跳动旗下Seed Research团队正式发布多模态图像生成模型Seedream 5.0 Pro,相比前代在图文对齐、结构连贯性、文本渲染和视觉美学等基础能力上全面提升,并引入复杂信息可视化、交互式精准编辑、真实感图像与肖像纹理、原生多语言输入与生成四大核心能力突破。该模型能生成高密度信息图表、支持像素级编辑操作,并可直接处理十多种语言的输入与高质量渲染,旨在满足专业创意生产需求。
RTX5090 优化版 Qwen3.8-27B NVFP4 量化模型发布
Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144 token 上下文,配合 DSpark v2 推测解码器在 SparkInfer 上可达 264.8 tok/s(代码场景最高 420 tok/s),在 SGLang 上达 161.7 tok/s。模型以 17.92GB 双分片发布,支持 SparkInfer、SGLang 和 vLLM 三种推理引擎,仅限 Blackwell 架构运行。
Qwen3.8-27B EXL3 量化版:更小下载、更快启动、更高保真
malaiwah 发布了 Qwen3.8-27B 的 EXL3 量化版本,其中注意力权重在磁盘上以 K6 精度序列化,相比 BF16 注意力版本,下载体积减少 29%,冷启动速度提升 5.4 倍,且与 BF16 的 KL 散度更低。该模型需要特定的 Gilded Gnosis vLLM 分支才能运行,属于实验性研究产物。
YCWTG 发布 gemma-4-31B-it 的 NVFP4A16 量化版
YCWTG 发布了基于 google/gemma-4-31B-it 的 NVFP4A16 量化版本模型,使用 llm-compressor 生成,模型大小从 62.6GB 降至 20.5GB,同时保持接近原版的推理性能(HLE 得分 18.1 vs 19.5)。该模型支持指令模式和思考模式,并针对视觉塔和 lm_head 层保留了 16 位精度以减少多模态性能损失。
MiniMax-H3 Turbo LoRA 适配器发布,支持 ComfyUI 加速视频生成
drbaph 在 Hugging Face 发布了 MiniMax-H3 Turbo LoRA 适配器,专为 ComfyUI 优化,支持文本到视频和参考到视频生成。这些 LoRA 通过动态秩压缩技术,将模型大小减少最多 83%,同时保持高数值保真度,并加速推理步骤。该仓库包含多个版本的 LoRA 文件,并提供了详细的数值验证结果。
微软发布Skala 1.1:提升DFT精度并集成主流化学软件
微软研究院发布了深度学习密度泛函(DFT)模型 Skala 1.1,该版本训练数据量是前版的2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala 现已集成到 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,同时推出实时基准以跟踪性能。这些进展旨在使计算化学模拟更具预测性,并广泛应用于科学和工业流程。
字节跳动发布 Seed Audio 1.0 场景级音频生成模型
字节跳动旗下 Seed Research 团队发布了 Seed Audio 1.0 音频生成模型,该模型能在统一框架内生成语音、音效、环境音等场景级音频元素,支持 20 多种语言、最长两分钟的单次生成,并具备 100 毫秒级别的对话时序控制能力。该模型旨在帮助创作者从拼接音频片段转向导演式的声音场景创作,提升叙事音频、视频配音、游戏本地化等场景的制作效率。
Qwen3.8-9B 去审查版发布:基于 Heretic 的 abliteration 模型
Hugging Face 上发布了 rohit267/Qwen3.8-9B-heretic-uncensored,这是基于 empero-ai/Qwen3.8-9B 的去审查版本,使用 Heretic v1.4.0 工具进行 abliteration 处理。该模型在保持低 KL 散度的同时,将拒绝率从 100/100 降至 98/100。原模型 Qwen3.8-9B 是 Empero 开发的 Qwen3.5-9B 架构的全参数蒸馏模型,教师模型为 Qwen3.8 2.4T A95B,在 MMLU 基准上相比基础模型有显著提升。
OpenMOSS发布MOSS-VL-Instruct-0408多模态模型
OpenMOSS团队发布了MOSS-VL-Instruct-0408,这是一个基于MOSS-VL-Base-0408进行监督微调的多模态视觉语言模型,支持图像理解、长视频理解和实时流式交互。该模型采用交叉注意力架构和绝对时间戳,在视频理解基准上表现优异,如VideoMME和MLVU,并在视频理解上超越Qwen3-VL。模型已开源,采用Apache-2.0许可证。
Jais 2:阿拉伯语中心的开源大语言模型家族
MBZUAI、Cerebras 和 Inception 联合发布了 Jais 2,一个以阿拉伯语为中心的开源大语言模型家族,包括 70B 和 8B 参数版本。该模型在阿拉伯语和文化相关基准测试中表现优异,并支持高效推理,70B 版本在 Cerebras 硬件上可实现每秒 2000 token 的生成速度。模型已在 HuggingFace 上以商业许可发布,并提供聊天应用。
NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart
AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStart 直接部署,无需手动配置服务基础设施,并可基于 NVIDIA NeMo 进行定制。
产品发布
PRODUCT RELEASE42 篇Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持
Ray 2.58.0 发布,重点包括 Ray Serve LLM 完成 KV 缓存和 token 感知路由,Ray Core 支持任务事件卸载,Ray Data 新增 Databricks Delta Lake 集成和 shuffle v2 后端,并推出实验性 Ray Sandbox 和 TPU 支持。这些改进提升了推理性能、数据处理效率和资源调度能力。
llama.cpp b10593 发布:修复 DeepseekV4 多序列回滚问题
llama.cpp 发布 b10593 版本,主要修复了 DeepseekV4 在多序列场景下的回滚问题,并进行了模型加载修复、缓存清理优化和图拓扑静态化等改进。该版本提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
llama.cpp b10594 发布:修复 CUDA 显存浪费问题
llama.cpp 发布 b10594 版本,主要修复了设备信息循环在非 TRACE 日志级别下仍会创建 GPU 上下文并导致 CUDA 后端分配 550 MB 显存的问题。该修复通过检查日志详细级别,在无输出时跳过设备循环,避免不必要的 GPU 资源占用。
SGLang v0.5.18 发布:新增多模型支持与性能优化
SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓存管理。该版本还更新了依赖,并增强了 Rust 服务器和推测解码功能。
LiteLLM v1.98.0 发布:镜像签名验证与多项功能更新
LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token 数、向量存储索引列表 API 等。
LiteLLM v1.99.0-rc.1 发布:镜像签名验证与多项修复
LiteLLM 发布 v1.99.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及 SCIM 组匹配、流式消息成本计算、Bedrock 响应头转发、spend 日志哈希、预算跟踪、路由响应体增强、guardrails 策略执行、Redis 集群超时处理等。
银河通用人形机器人网球首秀,突破具身智能AstraTennis时刻
银河通用在第二届世界人形机器人运动会上展示了全球首次全自主网球对打的人形机器人,其核心是名为银河星脑的具身大模型,实现了大脑、小脑和脑桥的一体化。公司还推出了AstraBrain Latent算法和银河星坊数据集,通过多智能体博弈实现技能涌现,并成功迁移到真实场景。这一突破展示了具身智能在真实对抗中的协同能力,为行业提供了可复用的范式。
Agno v3.0.0a3 发布:新增 CodeMode、媒体卸载及多项性能优化
Agno 发布了 v3.0.0a3 版本,包含大量修复和新功能。主要改进包括:为代理和团队新增 CodeMode 和结果卸载功能,支持将媒体从数据库卸载到本地、S3 或 GCS 存储,引入 MigrationRequiredError 以处理过时的数据库模式,并优化了性能(如导入时间从 233ms 降至 147ms,会话查找变为 O(1))。此外,还增加了对 SuperGrok OAuth 设备码认证的支持,并更新了 Gemini 默认模型为 3.7 flash。
DSPy 3.3.1 发布:强化沙箱隔离与优化器性能
DSPy 发布 3.3.1 版本,主要改进包括:PythonInterpreter 的安装简化、沙箱隔离强化和生命周期可观测性增强;优化器 GEPA 支持多提案采样和并发评估,提升吞吐量;同时修复了适配器正确性和 MCP 兼容性问题。该版本通过回调 API 提供完整的解释器执行追踪,并支持通过 gepa_kwargs 配置多目标优化。
优必选WRC展台1:1复刻客户产线,展示具身智能落地路径
优必选在2026年WRC展会上将客户工厂的真实产线1:1搬进展台,展示工业人形机器人Cruzr S2和Cruzr Y1在汽车上下料、物流分拣等场景的连续作业能力,并推出商用机器人Walker C1和家庭机器人U1。公司提出理解、预测、执行三层具身大脑架构,包括Thinker基座大模型、Thinker-WM世界模型和Thinker-VLA,强调端侧部署和真实数据闭环。优必选已与多家企业合作,2025年营收超20亿元,人形机器人销量13838台,其中全尺寸机器人1079台,超80%应用于工业场景。
llama.cpp b10584 发布:修复 draft 上下文并优化内存适配
llama.cpp 发布 b10584 版本,主要修复了 draft 模型上下文大小与目标上下文不匹配的问题,并优化了内存适配逻辑。该版本还引入了可选的第二模型支持,使 draft 或 MTP 上下文的内存测量更精确,同时移除了服务器中的预留块。
AWS 发布 ADOP 平台:AI 智能体将数据工程周期缩短至数小时
AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治理,并内置合规控制,适用于医疗、金融等受监管行业。
llama.cpp b10589 发布:新增 CUDA POOL_1D 支持
llama.cpp 发布 b10589 版本,主要新增 CUDA 后端对 POOL_1D 操作的支持,并修复了 editorconfig 兼容性问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。
llama.cpp b10580 发布:支持 dots3-note 视觉与音频
llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能
NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数据中心的功率利用率。
FastGPT v4.16.1 发布:沙盒镜像更新与工具 Schema 迁移
FastGPT 发布 v4.16.1 版本,主要更新包括:Agent Sandbox 镜像地址改为完整运行态镜像,并支持自定义 apt 源;MCP/HTTP 工具的 JSON Schema 统一为字符串存储,需按顺序执行迁移脚本;新增第三方发布渠道支持多模态文件、音频转录和引用,支持团队安装系统插件(进程模式)。此外,优化了 S3 key 命名、修复了多个工作流和插件相关问题。
llama.cpp v0.2.0 发布:多后端优化与模型支持更新
llama.cpp 项目发布了 v0.2.0 版本,包含大量底层优化和修复,涉及 CUDA、SYCL、OpenCL、Vulkan、Metal 等多个后端。新增功能包括对 LFM2 模型的支持、GraniteSWA 模型、Mamba-2 的 OpenCL 移植,以及服务器端多项改进。该版本还提升了量化内存使用效率,并增强了 CI 和发布流程。
伽利略发布Galileo X陆行具身系统,打通机器人全地形移动能力
伽利略在世界机器人大会上发布了陆行具身系统Galileo X,该系统通过可变形态融合轮式、四轮足和越野底盘,具备高精度转运、长距离越野和复杂地形越障能力。其核心创新包括多构型可变平台、复合主动悬挂系统和360度无限旋转关节,并搭载多模态基座模型,旨在解决传统移动机器人场景割裂的痛点,为具身智能商业化提供通用移动底座。
魔法原子WRC 2026展示三大场景解决方案,发布四足机器狗T1
魔法原子在WRC 2026上展示了工业制造、物流分拣、公共安全三大场景的具身智能解决方案,并发布了轻工业四足机器狗MagicDog T1。公司展示了自研通用具身大模型Magic-VLA K02的进化能力,包括超长程任务规划、柔性衣物整理和叠盒贴胶等demo。魔法原子目前在手订单超11亿元,产品覆盖近30国,海外收入占四成,并获评2026全球具身智能标杆企业TOP100。
Strands Agents SDK TypeScript v1.14.0 发布
Strands Agents SDK 发布了 TypeScript 版本的 v1.14.0 更新,包含多项新功能、修复和文档改进。主要新功能包括音频内容块、文件内存存储、上下文管理器卸载策略、工具上下文中的执行范围取消、代理作为工具委托、MCP 客户端 OAuth 认证以及 Anthropic 提示缓存支持。修复了多个与 Bedrock 缓存、多代理令牌计数、OpenAI 兼容性相关的问题。
llama.cpp b10534 发布:CUDA 解码交叉点优化
llama.cpp 发布 b10534 版本,主要更新为 CUDA 后端新增按硬件和量化类型调整的切换点,用于优化 mvq 到 MMQ 解码的交叉点。该更新引入了运行时环境变量 GGML_CUDA_MMVQ_MAX 来调整批量大小阈值,并针对 Blackwell、Ada 等硬件进行了调优,在 RTX 5090 上 Q4_K 密集解码在 B=8 时性能提升 23-41%。
llama.cpp b10532:Metal 后端 KV 反量化优化 Flash Attention
llama.cpp 发布 b10532 版本,在 Metal 后端为 flash attention 新增 KV 缓存反量化预处理,将 Q8_0、Q4_0、Q4_1、Q5_0、Q5_1 等量化 KV 反量化为 F16 后运行注意力内核,并优化了 MLA 模型中 V 为 K 视图时的冗余反量化。该版本在 M2 Ultra 上通过全部 4798 项测试,Qwen2.5-0.5B 的困惑度与 F16 KV 参考一致。
Spring AI 2.0.1 发布:新增音频流与工具调用限制支持
Spring AI 发布 2.0.1 版本,包含多项新功能和错误修复。新功能包括支持 OpenAI 音频流、可配置工具调用限制、Google GenAI 的 ToolChoice 支持、Google 图像生成支持等。错误修复涉及 Redis 聊天内存、PDF 文档读取、OpenAI 流关闭等问题。该版本还移除了弃用的 Mistral AI 聊天模型,并更新了升级说明。
Google ADK JS devtools v2.0.0 发布:移除 LLMAgentWrapper,新增 HITL 审批
Google 发布了 ADK JavaScript 的 devtools v2.0.0 版本,该版本引入了多项破坏性变更,包括移除 LLMAgentWrapper 和 WorkflowAgent,并允许将 Workflow 直接作为根节点运行。新版本还增加了 FunctionTool 的人工审批(HITL)功能,并在开发 UI 中支持渲染图工作流。此外,修复了多个 CLI、API 服务器和模型配置相关的缺陷。
NVIDIA cuML 多 GPU UMAP:大规模降维提速至分钟级
NVIDIA cuML 和 cuVS 25.06 版本引入了多 GPU 分布式 UMAP 功能,通过将昂贵的全邻居 kNN 图构建步骤分布到多个 GPU 上,显著提升了大规模数据集的降维性能。该方法基于先前提出的 out-of-core 技术,将数据集划分为平衡簇并重叠向量,每个 GPU 独立计算局部 kNN 图并合并,避免了昂贵的全对全通信。实验表明,该功能可在几分钟内处理数百 GB 的数据,而无需牺牲嵌入质量。
Mastra 发布更新:TokenCostControl 重命名及多项新功能
Mastra 发布了 2026 年 8 月 14 日的更新,主要亮点包括将 CostGuardProcessor 重命名为 TokenCostControl,并新增了更丰富的预算选项(如 warnAtPercent、按请求的 maxCost 函数、新的成本范围等)。同时,为 agent 和 controller 增加了活动运行检查 API,并修复了可观测性、数据脱敏和内存召回等问题。此外,还包含多项破坏性变更和补丁修复。
Mastra 更新:持久执行、Cloudflare Sandbox 与 MCP 协议升级
Mastra 发布 2026 年 8 月 19 日更新,为 Agents API 增加无需部署的持久执行功能,并新增 Cloudflare Sandbox 提供商。MCP 协议升级支持无状态 2026-07-28 修订版和多轮 elicitation。RAG 模块新增 GraphRAG 快照序列化,降低大型语料库启动成本。核心包 @mastra/core 1.60.0 包含多项改进,如 ProcessHandle.closeStdin()、PubSub 实时追踪、客户端工具 onOutput 钩子等。
Haystack v3.1.0-rc1 发布:Agent 上下文压缩与多项破坏性变更
Haystack 发布 v3.1.0-rc1 版本,包含多项破坏性变更和新功能。主要变更包括:Agent 的 exit_reason 成为保留状态键、state_schema 属性行为调整、PipelineSnapshot 输入格式变化、不安全组件加载限制、SentenceWindowRetriever 参数校验等。新功能方面,为 Agent 增加了实验性的上下文压缩机制(CompactionHook),并支持 PDF 链接解析。
Mistral 发布 Agentic Search,提升复杂文档检索准确率
Mistral AI 发布了 Agentic Search,一种多步骤检索工具,使 AI 系统能够导航、阅读和验证复杂文档中的信息。在 FinanceBench 和 OfficeQA Pro 基准测试中,它显著提高了准确性(FinanceBench 上从 26.7% 提升至 86%),同时降低了延迟和 token 消耗。该工具通过 Mistral Search Toolkit 提供,支持本地和云端部署,并包含五个工具:search、open、navigate、read 和 grep。
Anthropic 详解 Claude 文本水印技术:采用 SynthID-Text 变体
Anthropic 宣布将采用 Google DeepMind 开发的开源水印技术 SynthID-Text 的变体,为 Claude 生成的文本添加不可见水印,以满足欧盟《人工智能法案》的透明度要求。该水印通过利用文本生成中的低风险词汇选择模式来标记内容,不影响输出质量或用户成本。Anthropic 表示,其他 AI 开发商如 Google 和 OpenAI 也将受到该法规影响。
KnowledgeForge:从 ITSM 工单中挖掘知识金矿
AWS 机器学习博客介绍了 KnowledgeForge,一个利用生成式 AI 从 ITSM 工单中挖掘知识并优化知识库的系统。该系统通过 Amazon Bedrock、S3 Vectors 和 Step Functions 等 AWS 服务,自动生成知识文章并进行去重、质量评分和内容改进,最终由知识管理员审核。该方案旨在解决企业 IT 支持中知识沉淀不足和知识库混乱的问题。
Fanatics 在 AWS 上构建多智能体客户支持系统
Fanatics Betting and Gaming (FBG) 在 AWS 上构建了一个多智能体客户支持系统,以应对体育博彩中复杂的、因州而异的规则和高并发查询。该系统采用编排器模式,通过 Amazon Bedrock 访问多个基础模型,并集成 Guardrails 和负责任博彩分类器,显著提升了响应速度和准确性,同时降低了运营成本。FBG 的 CTO 和工程负责人强调了模块化设计带来的快速迭代能力。
AgentCore Web Search 新增运行时域与日期过滤,扩展至欧洲和亚太区域
AWS 宣布在 Amazon Bedrock AgentCore 的 Web Search 连接器 1.2.0 版本中推出运行时域和发布日期过滤功能,允许开发者在每次 API 调用中控制搜索的域名和结果的时间范围,且由服务端强制执行。该功能与管理员级域策略结合,形成分层过滤模型,确保企业治理的同时提供灵活的调用级控制。此外,Web Search 服务扩展至欧洲(eu-west-1)和亚太(ap-northeast-1)两个新区域,采用零出口架构,满足数据驻留和低延迟需求。
AWS 与 OpenClaw 合作推出 AgentCore 支付功能,支持智能体自动交易
AWS 与 OpenClaw 基金会合作,在 Amazon Bedrock AgentCore 中推出 AgentCore payments 功能,使 OpenClaw 智能体能够通过 x402 协议处理 HTTP 402 支付挑战,在预设限额内自动完成小额稳定币支付。该方案通过分离人工管理路径与模型运行时权限,防止提示注入影响支付授权,并支持 Coinbase 或 Stripe Privy 钱包。
Amazon Bedrock AgentCore payments 正式可用,支持代理安全自主交易
Amazon Bedrock AgentCore payments 现已正式可用,该服务与 Coinbase 和 Stripe 合作,使代理能够安全自主地进行支付。新功能包括钱包支持、支付编排(支持 x402 和 MPP 协议)、支付限额、可观测性以及付费端点发现。该服务旨在支持企业级生产工作负载,并已应用于 Anchor Browser 等客户场景。
利用 Amazon Bedrock 自动生成过滤器提升合同搜索准确性
AWS 机器学习博客介绍了其 AI 驱动的注释(AIDA)解决方案,该方案基于 Amazon Bedrock 知识库,通过元数据增强的分块和隐式/显式过滤机制,提高合同搜索的准确性。AIDA 将非结构化合同转化为可搜索的智能数据,支持自然语言查询,并通过 RAG 架构和过滤机制确保检索结果的相关性和合规性。
阿里国际站AI内容生成实践:民族品类智能匹配
阿里巴巴国际站发布AI内容生成方案,用于跨境电商中民族特色品类的识别与匹配。该方案基于大模型构建民族特征知识库,实现民族品类与国际站叶子类目的智能匹配,并通过人工评测优化数据质量。商品挂载错误率从8.4%降至1.8%,显著提升运营效率。
llama.cpp b10514 新增 Granite SWA 模型支持
llama.cpp 发布 b10514 版本,新增对 GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 模型架构的转换与推理支持,包括滑动窗口注意力模式、逐层 RoPE 判定及 MoE 参数处理。该更新由 IBM 的 Gabe Goodhart 主导,并借助 AI 辅助编码工具完成。此版本增强了 llama.cpp 对新型混合专家模型和滑动窗口注意力机制的支持。
llama.cpp b10472 发布:修复 HIP 内存报告问题
llama.cpp 发布 b10472 版本,主要修复了 HIP 构建中错误使用 UMA 覆盖的问题,AMD APU 现在通过 hipMemGetInfo 报告准确内存,避免小内存系统上的过度承诺。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
langchain-openai 1.5.2a1 发布:支持 OpenAI 3.0 SDK 与网关元数据
LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处理和错误处理能力。
Langfuse v4.12.0 发布:新增 v4 迁移 UI 与多项修复
Langfuse 发布 v4.12.0 版本,包含多项功能改进、修复和优化。主要新增了 v4 迁移 UI 开关、PostHog 导出失败通知、过滤器侧边栏搜索等功能,并修复了多个 UI 和 API 问题。此外,该版本明确了 v3 API 的弃用日期为 2026 年 11 月 16 日,并更新了 Gemini 模型定价。
llama.cpp b10456 发布:SYCL 量化拷贝性能大幅提升
llama.cpp 发布 b10456 版本,修复了 SYCL 后端量化拷贝内核中的线程/块计数问题,使其与量化大小成比例,从而减少过订阅或欠订阅。在 Arc 70 上,q4_0 到 f32 路径的吞吐量从 20.21 GB/s 提升至 158.19 GB/s,其他量化类型性能提升不明显。该版本提供了多平台预编译二进制文件。
安全
SECURITY1 篇OpenAI在Hugging Face事件后推出新安全措施
OpenAI在Hugging Face安全事件后宣布了一系列新的安全政策,包括加强模型开发过程中的监控、对齐和安全要求。公司暂停了强化学习两周,目前仅恢复了风险较低的模型训练。新措施还包括更强的网络隔离和监控系统,旨在防止类似事件再次发生。
研究进展
RESEARCH15 篇美团搜索3.0:LLM语义表征在排序模型的探索与应用
美团搜索团队在服务零售排序场景中系统探索了LLM语义表征的应用,通过三期迭代构建了Query-POI-Deal三元语义表征体系,将语义相似度作为特征注入精排模型,显著提升了搜索订单量和长尾场景体验。一期验证可行性,二期系统性升级,三期实现跨场景迁移复用,累计完成3个Launch Review并全量上线。
利用内层优化几何的优化器系统仿真优化
本文研究“优化器系统仿真优化”(SOSO)问题,其中每个智能体在每个决策周期求解结构化优化问题(如线性规划、混合整数规划或动态规划)。作者提出一个框架,利用内层优化的几何结构(如最优基和对偶变量)来推导外层目标的精确无偏梯度(IPA),并证明方差随反馈深度指数增长。他们开发了PRIME求解器,在多个测试平台上优于黑盒方法,并显著降低方差。
大型语言模型中涌现模块化认知架构
麻省理工学院的研究人员通过电路分析发现,大型语言模型(LLMs)在语言、形式推理、社会推理和物理推理等认知领域表现出与人类大脑相似的功能模块化组织。该研究基于46项任务,表明LLMs中处理相同认知领域的任务会激活重叠的神经元,而不同领域则激活不同的神经元。这一发现暗示模块化可能是智能系统的一个基本属性,而非生物大脑特有的进化偶然。
SuTRA:基于词根感知的结构统一分词算法
印度研究人员提出 SuTRA,一种基于词根感知的结构统一分词算法,旨在解决形态丰富语言(如印地语、马拉地语和古吉拉特语)中的形态碎片化问题。SuTRA 通过保留音节完整性和惩罚跨形态边界的合并,在形态对齐和语义可恢复性上显著优于 BPE,并在机器翻译任务中平均提升 8.08 chrF2。研究还发布了新的形态分割数据集。
Token 膨胀感知路由:面向智能体 LLM 系统的成本优化
arXiv 论文提出 InflationAgent,一种面向智能体 LLM 系统的路由框架,通过量化 token 膨胀(重试导致的真实成本与单次调用成本之比)来优化模型选择。其引入 CoT 分支熵(CBE)作为预执行难度信号,并以语义汇率(SER)为目标进行路由,在 GSM8K 上以更少 token 达到更高准确率,同时验证了失败链转发会显著降低强模型性能。
均衡强制:无需噪声条件的自适应视频生成
arXiv 论文提出 Equilibrium Forcing (EqF) 框架,用于无需噪声水平条件的自适应视频生成。EqF 通过均衡速度场和闭环反馈机制,在推理时自适应调整采样,提升视频质量和一致性。实验表明,EqF 在 1.3B 和 5B 参数的 Flow Matching 模型上微调,性能优于标准噪声条件方法。
双有界关系召回:在固定预算下超越Top-K检索的完整证据恢复
本研究提出双有界关系召回(DBRR)方法,在固定检索预算下,通过将部分预算分配给与已选证据相关的图邻接上下文,而非仅依赖扁平top-k排序,显著提升了HotpotQA数据集上完整支持证据的恢复率。在7,405个问题上,完整证据恢复率相对匹配的扁平基线提高了23.8个百分点,其中桥接类问题提升最为显著。结果表明,在相同上下文预算下,证据的分配方式对检索完整性至关重要。
GxP-Agent:基于过程DAG拓扑的可靠临床试验编程LLM代理系统
GxP-Agent 是一个多智能体系统,将临床试验编程的监管流程编码为有向无环图(DAG),分解为15个领域特定节点,由具备pharmaverse技能上下文的工人代理执行,并包含验证门和条件重试。在CDISC-Bench基准测试中,GxP-Agent使用Claude Sonnet 4.6实现了100%的结构匹配,而所有单代理和扁平多代理方法均为0%,表明编码领域过程知识为图拓扑是实现可靠、符合GxP的临床试验编程的关键。
前向传播域适应:无需跨层反向传播的LLM微调方法
arXiv 论文提出前向传播域适应方法 FPO,无需跨层反向传播即可微调大语言模型,吞吐量提升 2.7-3.2 倍,峰值内存降低 40%,且不损害域外基准。该方法基于输出层预测误差与真实梯度在后期层的余弦相似度 0.47-0.59 的观察,并引入两分钟诊断工具确定适用层。实验在 OLMo-2-7B、Qwen3-8B、Falcon3-7B 上验证,域内困惑度改善,MMLU 等基准保持基线水平。
机构特定LLM提示可恢复去标识化系统遗漏的PHI
贝勒医学院等机构的研究者在 arXiv 发表论文,评估了大型语言模型(LLM)在电子健康记录去标识化中识别机构特定受保护健康信息(PHI)的能力。研究对 100 份儿科肿瘤学笔记进行基准测试,发现 LLM(最佳 F1=0.918)优于专用系统(TiDE F1=0.779),且通过命名缺失类别和防止过度编辑的提示,可恢复 79% 的遗漏 PHI,并提升精确率。专家审查确认 LLM 标记的额外标识符均为真实 PHI,重新标注后召回率达 0.981。结论认为 LLM 是专用去标识化系统的适应性替代方案,机构特定提示开发应作为主要适配手段。
揭秘代理技能:为何有效直至失效
该论文通过受控实验和轨迹分析,研究了技能(Skills)增强LLM代理的机制。研究发现,技能主要通过程序锚定(procedural anchoring)稳定执行,而非注入缺失知识,程序锚定占技能案例的65.7%,而显式知识注入仅占4.5%。检索是独立瓶颈,当技能池从5增至100时,实际使用精度从29.6%降至3.3%。技能在脆弱假设、不兼容上下文或适应不足时失效。研究提出了技能使用模式的分类法,并推动评估超越聚合成功率。
NVIDIA 用 QAD 开发 Nemotron 3.5 Lightning NVFP4 模型
NVIDIA 发布了 Nemotron 3.5 Lightning NVFP4 检查点,通过量化感知蒸馏(QAD)将模型从 66 GB 压缩至 22 GB,同时实现高达 4 倍的吞吐量提升。该过程使用 NVIDIA Model Optimizer,先进行 PTQ 量化,再通过蒸馏恢复精度。文章详细介绍了 QAD 的两阶段流程、PTQ 配方选择及评估结果,表明 QAD 能有效恢复激进量化带来的精度损失。
Multiphase-Diff:高对比度多相物理系统的扩散生成建模
arXiv 论文提出 Multiphase-Diff,一种针对高对比度、尖锐界面多相物理系统的扩散生成模型。该方法通过保守通量残差、解析双射表示和 Jacobi 预条件似然,解决了界面不规则、低振幅相位欠分辨和残差尺度异质三大难题。在三个多相基准上,Multiphase-Diff 在物理保真度和分布保真度上均优于七个基线,展现出对相位对比和组成的鲁棒性。
基于幅度的专家掩蔽揭示MoE模型深度敏感性
Persistent Systems 的研究人员对 Qwen3.6-35B-A3B 模型进行了基于幅度的专家掩蔽层敏感性分析,发现早期和中间层对掩蔽敏感,而后期层(30-39)容忍度更高。在 XLCoST 基准上,晚期聚焦策略在掩蔽较少专家的情况下保留了更多高质量输出,优于均匀掩蔽。研究还探索了路由宽度缩减,为深度感知的 MoE 压缩提供了实证基础。
阿里云Tair KVCache仿真分析:高精度计算与缓存模拟设计
阿里云官方AI博客发布了一篇关于Tair KVCache仿真分析的技术文章,详细介绍了LLM推理性能模拟系统的设计与实现。文章分析了推理引擎的架构、调度策略及计算模型,并提出了高精度模拟远端KVCache配置对推理性能影响的方案。该方案旨在通过CPU平台快速预测不同配置下的TTFT、TPOT等关键指标,为推理系统优化提供决策依据。