VOL. 2026-08-02 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-02 · PUBLISHED · 约 8 分钟
今日AI领域迎来密集的模型发布潮,多家机构同步推出重量级新品,竞争焦…
今日AI领域迎来密集的模型发布潮,多家机构同步推出重量级新品,竞争焦点明显从单一模态转向多模态与推理效率的深度融合。其中,Thinking Machines Lab 的 Inkling 与 Black Forest Labs 的 FLUX 3 分别代表了多模态混合专家模型和统一流模型的进阶方向,前者上线首日即获 Together AI 推理平台支持,后者则通过自监督框架同时提升生成与表征质量。在效率赛道上,Mamba-3 以状态空间模型强化推理效率,DeepCoder-14B 则通过分布式强化学习在代码任务上逼近闭源模型水平。与此同时,xAI 与 Mistral AI 分别以 Grok-2 和 Mistral Large 2 巩固其在通用对话与多语言代码生成上的优势,而 Pixtral 12B 与 Grok-1.5V 则进一步拓宽了视觉理解边界。基础设施层面,llama.cpp 对 DeepSeek V4 超连接的原生支持,以及 RAG 幻觉抑制方法 LettucePrevent 的提出,反映出社区在模型部署可靠性与事实准确性上的持续投入。
今日看点
3 个章节 · 12 条情报- 01模型发布Together AI 首日上线 Thinking Machines Lab 多模态模型 Inkling9
- 02产品发布llama.cpp b10232 发布:Metal 支持 DeepSeek V4 超连接1
- 03研究进展J-Space:又一个LLM读心术?2
模型发布
MODEL RELEASE9 篇Together AI 首日上线 Thinking Machines Lab 多模态模型 Inkling
Thinking Machines Lab 发布了新模型 Inkling,这是一个多模态混合专家模型,支持文本、图像和音频输入,并具有可控推理能力。Together AI 在发布当天即在其推理平台上提供该模型,并优化了其推理内核以支持新架构。Inkling 在科学推理、数学、编程等基准测试中表现强劲,总参数达 975B,激活参数 40B,上下文窗口 1M。
FLUX 3 发布:统一多模态流模型,支持图像视频音频与动作预测
Black Forest Labs 发布了 FLUX 3,这是一个统一的多模态流匹配基础模型,支持图像、视频、音频和动作预测。其核心创新是 Self-Flow 框架,通过自监督特征重建目标同时提升生成质量和表征质量,在机器人操作任务中成功率从 42% 提升至 71%。FLUX 3 支持长达 20 秒的同步音频视频生成,并计划后续开放 Dev 权重。
Mamba-3发布:以推理效率为核心的新型状态空间模型
Together AI 与卡内基梅隆大学、普林斯顿大学、Cartesia AI 合作发布了 Mamba-3,这是一种以推理效率为核心的新型状态空间模型(SSM),通过更富表现力的递推公式、复数值状态跟踪和 MIMO 变体,在 1.5B 规模下实现了比 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B 更低的预填充和解码延迟。该模型还开源了基于 Triton、TileLang 和 CuTe DSL 的内核。Mamba-3 的发布反映了行业从训练优先向推理优先的转变,旨在推动质量-效率前沿。
DeepCoder-14B开源模型发布,性能媲美o3-mini
Together AI与Agentica团队联合发布了DeepCoder-14B-Preview,这是一个基于DeepSeek-R1-Distilled-Qwen-14B通过分布式强化学习微调的开源代码推理模型。该模型在LiveCodeBench上达到60.6%的Pass@1准确率,与o3-mini相当,并开源了数据集、代码、训练日志和系统优化。训练使用了24K个可验证的编程问题,在32块H100上耗时2.5周,并引入了加速2倍训练的verl-pipe系统。
Mistral AI 发布 Mistral Large 2 模型,支持多语言与代码生成
Mistral AI 发布了 Mistral Large 2 模型,拥有 128k 上下文窗口,支持多语言和 80 多种编程语言,参数规模为 1230 亿,可在单节点上高效运行。该模型在代码、推理和多语言基准上表现优异,并增强了指令遵循和函数调用能力。模型以研究许可发布,商业使用需获取商业许可,并已在 la Plateforme 和多家云平台上提供。
xAI 发布 Grok-2 和 Grok-2 mini 测试版,性能超越 GPT-4-Turbo
xAI 发布了 Grok-2 和 Grok-2 mini 的测试版,在聊天、编码和推理方面性能显著提升,在 LMSYS 排行榜上超越了 Claude 3.5 Sonnet 和 GPT-4-Turbo。这两个模型已在 X 平台上向 Premium 用户开放,并计划于本月晚些时候通过企业 API 提供给开发者。Grok-2 在视觉任务上表现出色,并与 Black Forest Labs 合作探索 FLUX.1 模型以扩展功能。
Mistral AI 发布 Pixtral 12B 多模态模型
Mistral AI 发布了 Pixtral 12B,这是一个原生多模态模型,基于 Mistral Nemo 架构,并新训练了 4 亿参数的视觉编码器,支持可变图像尺寸和 128K 长上下文。该模型在 MMMU 基准上达到 52.5%,在指令跟随和多模态任务上表现优异,同时保持文本性能不妥协。模型采用 Apache 2.0 许可证,可在 La Plateforme 和 Le Chat 上使用。
xAI 发布多模态模型 Grok-1.5V 及 RealWorldQA 基准
xAI 发布了其首个多模态模型 Grok-1.5V,能够处理文档、图表、截图和照片等多种视觉信息。该模型在多个基准测试中表现优异,特别是在新的 RealWorldQA 基准上超越了 GPT-4V 和 Claude 3 等竞品。xAI 还开源了 RealWorldQA 数据集,包含 700 多张图像,旨在评估模型对真实世界的空间理解能力。
Lightricks 发布 LTX-2.3 音频-视频生成模型
Lightricks 发布了 LTX-2.3,这是其 LTX-2 音频-视频基础模型的重大更新,改进了音频和视觉质量以及提示遵循能力。该模型基于 DiT 架构,能够生成同步的视频和音频,并提供多种检查点,包括完整版、蒸馏版、LoRA 版本和上采样器。模型权重开放,支持本地执行,并可通过 API Playground 在线体验。
产品发布
PRODUCT RELEASE1 篇llama.cpp b10232 发布:Metal 支持 DeepSeek V4 超连接
llama.cpp 发布 b10232 版本,主要更新是在 Metal 后端实现了 DeepSeek V4 的超连接(hyper-connections)支持,包括新增 GGML_OP_DSV4_HC_COMB、GGML_OP_DSV4_HC_PRE 和 GGML_OP_DSV4_HC_POST 算子,并针对 SIMDgroup 寄存器与 shuffle 进行了优化。该版本还提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
研究进展
RESEARCH2 篇J-Space:又一个LLM读心术?
Hugging Face 博客发布文章,介绍一篇关于用雅可比透镜(J-lens)解读大语言模型内部表征的研究。研究通过干预 Claude 的西班牙语表征,发现模型存在两条独立的信息处理路径,分别支持自动语言处理和显式推理,类似神经科学的全局工作空间。文章强调该结果比标题更严肃,但并未证明模型具有主观意识。
LettucePrevent:RAG 中实时预防事实幻觉的新方法
Hugging Face 博客发布了 LettucePrevent,一种在 RAG 生成循环中集成 token 级检测器以实时抑制事实幻觉的方法。其数字检测器在多个模型上将数字幻觉相对减少超过 60%,但事实检测器仅在 Llama-2 7B 上显著降低幻觉(-26.6%),且运行时开销高达 7 倍。该方法通过自定义 LogitsProcessor 和 Hugging Face custom_generate 模块实现。