精选

2026年8月12日星期 · AI 自动挑选的高价值内容 · 推荐理由由模型阅读全文后逐条撰写

1847
已入库内容
105
活跃信源
1765
已 AI 结构化
7271
检索分块

当前热点

完整榜单 →
  1. 1NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行45 热度
  2. 2Ollama v0.32.9 发布,支持 NVIDIA Nemotron 3.5 Lightning45 热度
  3. 3NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型41 热度
  4. 4deepdml 发布西班牙语微调 Whisper Tiny 语音识别模型40 热度
  5. 5Mistral推进AI主权:区域推理、开放模型与欧洲新基建36 热度
8月11日星期二 · 4
NVIDIA Technical Blog一手来源✦ 精选模型发布45

NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr

另有 1 家信源报道

推荐理由Nemotron 3.5 Lightning 以 3B 活跃参数实现 30B MoE 的容量,专攻长时 AI 代理的高频执行层,输出速度比同类快 4 倍,且权重、数据与配方全开放,适合在 DGX Spark 到数据中心的各类硬件上微调部署。不过,PinchBench 的 86% 准确率仅针对单一基准,且与 Qwen3.6 的对比未说明测试条件,实际多框架兼容性仍需开发者自行验证。

Latent Space✦ 精选模型发布15

Meta 发布 Muse Glimmer 与 Spark,重申个人超级智能愿景

Meta 在扎克伯格发表个人超级智能文章一周年之际,发布了开放权重模型 Muse Glimmer,并计划推出 Spark,标志着其重返开放权重前沿。扎克伯格在文章中阐述了 Meta 以个人超级智能为核心的战略,并提出了关于就业、基础设施、安全、美国领导力等风险与应对建议。Glimmer 模型可在单张 RTX 3090 上运行,被视为美国开放模型的一次胜利。

另有 2 家信源报道

推荐理由Meta 以 Apache 2.0 协议发布 30B 稠密多模态模型 Glimmer,可在单张 RTX 3090 上运行,对本地智能体工作流开发者意味着无需云端即可部署;但正文未提供与同类模型的基准对比,实际推理速度与任务表现仍需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布41

NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型

NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可

推荐理由该模型以30B总参数、3B激活参数的MoE混合架构实现单GPU部署,配合DSpark投机解码,对长时运行的智能体任务和本地推理场景有直接价值;但基准测试未公开与同规模模型的对比细节,实际加速效果和编码能力仍需在真实负载中验证。

NVIDIA Generative AI Blog一手来源✦ 精选模型发布34

NVIDIA 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard,提升代理式 AI 效率

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提

推荐理由Nemotron 3.5 Lightning以300亿参数MoE架构实现4倍输出速度和30%任务加速,对运行高并发代理任务的企业可直接降低推理延迟;NeMo Switchyard则通过智能路由将成本降至单一前沿模型的三分之一,且无需重写应用。不过,文中性能数据均来自合作伙伴自测,未提供独立基准或与同类开源模型的横向对比,实际收益需在自身负载下验证。

8月10日星期一 · 6
THE DECODER✦ 精选模型发布15

Meta 回归开放模型,发布 Muse Glimmer 并捍卫蒸馏策略

Meta 发布了 30B 参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可,可在消费级 GPU 上本地运行,并在多数基准测试中优于同类竞品。扎克伯格同时发表文章,捍卫模型蒸馏的合法性,并呼吁美国在开放模型领域保持领先。Meta 计划未来几周发布更强模型 Muse Spark 1.2 的开放权重版本,并考虑通过云业务变现其数据中心

另有 2 家信源报道

推荐理由Meta 以 Apache 2.0 许可发布 30B 参数的 Muse Glimmer,让消费级 GPU 用户能本地运行代理模型,且多数基准领先同类,但官方自测数据未针对竞品调优,实际差距需独立验证。扎克伯格借机为蒸馏辩护并抛出算力拍卖构想,但该变现模式尚无产品与时间表,能否落地仍是未知数。

TechCrunch AI✦ 精选模型发布15

Meta 发布开源模型 Glimmer,推进个人超级智能愿景

Meta 发布了开源权重模型 Muse Glimmer,该模型拥有 300 亿参数,旨在本地消费级硬件上运行 AI 代理,支持多步骤任务和隐私保护。此举体现了 CEO 扎克伯格关于“个人超级智能”的愿景,但更强大的 Muse Spark 模型仍保持闭源,显示出 Meta 在开源与控制的平衡策略。

另有 2 家信源报道

推荐理由Glimmer 将 300 亿参数模型以 Apache 2.0 协议开源,使开发者能在单张消费级 GPU 上本地运行多步骤 AI 代理,直接回应了隐私敏感场景对数据不出设备的需求;但更强大的 Muse Spark 仍闭源,且官方未公布 Glimmer 与 Spark 在任务成功率上的对比,实际性能差距尚待验证。

Hugging Face Blog一手来源✦ 精选模型发布13

Meta 发布 Muse Glimmer:开源多模态模型,支持图像视频与工具调用

Meta 发布了 Muse Glimmer,一个 30B 参数的开源多模态模型,包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频和工具调用。该模型在 transformers、llama.cpp、vLLM 等库中获得首发支持,并采用混合注意力、门控分组查询注意力等架构优化。Muse Glimmer 还提供了可选的投机解码模块,以加速生成。

推荐理由Meta 将 Muse Glimmer 的视觉编码器扩至 2B 参数,配合混合注意力与门控分组查询注意力,使 30B 模型在图像视频理解上具备更强基础,同时 KV 缓存缩减 16 倍,对部署长上下文任务更友好;但官方仅公布单卡 H100 的优化流程,未提供与其他多模态模型的横向基准,实际推理速度与效果仍需开发者自行对比验证。

Hugging Face Blog一手来源✦ 精选模型发布15

NVIDIA 发布 Magpie 多语言 TTS:开源权重,低延迟部署

NVIDIA 发布 Magpie 多语言 TTS 模型,新增阿拉伯语、韩语和巴西葡萄牙语支持,共支持 12 种语言。该模型为 3.64 亿参数的开源权重模型,可通过 NVIDIA NIM 部署,在 B200 GPU 上实现 32 毫秒的首音频延迟和 320 倍实时吞吐。通过帧堆叠和局部 Transformer 架构优化,在保持语音质量的同时降低推理延迟,适用

推荐理由Magpie 将多语言 TTS 的部署门槛降到开源权重层面,新增三种语言后覆盖 12 种,配合 NIM 在 B200 上实现 32 毫秒首音频延迟,对需要自建语音管线的企业意味着可完全掌控延迟与数据驻留。不过其 320 倍实时吞吐仅基于特定 GPU 与流数配置,实际生产环境下的表现仍需按自身负载验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布14

Nanbeige4.2-3B GGUF 量化版本发布

gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8_0 到 IQ2_XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4_K_M 在质量与体积间达到最佳平

推荐理由该量化版本将3B级agent模型压缩至2.4GB的Q4_K_M档位,MMLU-Pro和MuSR测试显示其质量接近bf16原版,对内存受限的本地部署或边缘设备尤为实用。不过基准仅基于128题小样本,且部分量化档位的MuSR结果仍待补全,实际推理表现需在真实任务中进一步验证。

NVIDIA Technical Blog一手来源✦ 精选模型发布14

Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流

Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090

推荐理由该模型以30B稠密架构实现单GPU每秒20K tokens的本地推理,对需要处理长上下文且数据不出内网的代理开发者而言,可直接替代需分片或外接端点的方案;但官方未公布与MoE模型的能耗对比,且吞吐数据仅基于Blackwell Ultra平台,其他GPU上的实际表现仍需实测验证。

8月9日星期日 · 4
Hugging Face New and Trending Models一手来源✦ 精选模型发布8

Deepwen 3.6:融合 DeepSeek 推理的 3D 生成微调模型

Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。

推荐理由该模型将DeepSeek的推理链与Qwen的3D生成能力结合,为AAA游戏开发中的程序化建模和Blender工作流提供了开箱即用的微调方案,且MoQ量化版本降低了本地部署门槛。但评测仅基于同服务器同种子的配对任务,未公开第三方基准对比,实际跨场景稳定性仍需验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布5

MiniMax 发布全模态生成系统 H3,支持 2K 视频与原生音频

MiniMax 发布了通用全模态生成系统 MiniMax H3,支持文本、图像、视频和音频的统一理解,并能生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该系统包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式,并提供 API 和在线应用。

推荐理由该模型将多模态理解与生成整合进单一系统,支持文本、图像、视频和音频的混合输入,并直接输出带原生立体声的2K视频,对需要复杂指令跟随的创作者和开发者而言,省去了多模型拼接的流程。不过,2K生成依赖单独的H3-Regenerate-2K模块,且官方未提供与现有视频生成模型的对比评测,实际效果和推理成本仍需自行验证。

量子位✦ 精选模型发布2

中国团队发布BigBang-V1:基于RSI的基座模型,数据层自进化

由上海交大人工智能学院、深势科技和上海算法创新研究院组成的无尽前沿团队发布了首个基于递归自我改进(RSI)原生方式训练的基座模型BigBang-V1。该模型参数规模35B,后训练数据100%由AI自主合成,在长程搜索、代码、科学研究等评测中取得多项第一,甚至超过1T参数的DeepSeek V4 Pro Preview。团队通过自演化合成数据管线,让AI参与任

推荐理由BigBang-V1把RSI从概念落成可运行的数据层闭环,让AI自主完成出题、求解、验证和筛选,对科研自动化场景意味着训练数据不再受人类出题速度限制;但评测集中在科研和代码任务,通用对话等场景表现未公开,35B对1T的对比也需独立复现验证。

THE DECODER✦ 精选模型发布3

DeepMind 发布 WeatherNext Cyclones,同时预测气旋路径与强度

Google DeepMind 推出 WeatherNext Cyclones(WN-C),一种用于热带气旋预报的 AI 系统,可同时预测路径和强度,比现有专业模型提前约一天。该系统与 NHC、CIRA 和英国气象局合作开发,已在 Google Weather Lab 上线,并在 Nature 发表论文。WN-C 使用粗分辨率数据(约 28 公里网格)和功能

推荐理由该模型首次在同一系统中兼顾气旋路径与强度预测,将五日均路径误差从370公里降至230公里,对依赖单一预报源的决策者可直接提升预警提前量;但论文未披露粗分辨率下强度预测的物理可解释性,且实际部署效果仅经单个飓风案例验证,长期稳定性仍需观察。

8月8日星期六 · 3
Hugging Face New and Trending Models一手来源✦ 精选模型发布2

MiniMax H3 量化版发布:支持 ComfyUI 的多格式视频生成

rockerBOO 发布了 MiniMax H3 的量化版本,支持 ComfyUI 单文件检查点,提供 NVFP4 和 INT4 等多种量化变体,适用于 Blackwell 及非 Blackwell GPU。该模型为 33B 参数的全模态视频和音频生成模型,支持文本到视频、图像到视频等功能。量化方法采用混合精度,包括 NVFP4、FP8 和 BF16,并通过

推荐理由该量化版将33B全模态模型压缩至20GB并适配ComfyUI单文件加载,让Blackwell用户可直接用NVFP4跑视频生成,非Blackwell用户也有INT4备选路径;但仓库明确未做任何质量评测,INT4变体仅验证能跑通,且混合精度层选择直接沿用FLUX的结论而非针对H3实测,实际画质损失需自行对比。

Hugging Face New and Trending Models一手来源✦ 精选模型发布2

飞桨发布 PaddleOCR-VL:0.9B 超紧凑多语言文档解析模型

百度飞桨发布 PaddleOCR-VL,一个基于 ERNIE-4.5-0.3B-Paddle 的 0.9B 超紧凑视觉语言模型,专注于多语言文档解析,支持 OCR、版面分析、表格、公式和图表识别。该模型以 Apache-2.0 许可证开源,并提供英文、中文和多语言支持,新版本为 PaddleOCR-VL-1.6。

推荐理由该模型以0.9B参数将OCR、版面分析、表格、公式和图表识别整合进单一视觉语言模型,对需要轻量级多语言文档解析的开发者可直接部署,Apache-2.0许可降低了商用门槛。但正文未提供与现有OCR工具链的精度对比数据,实际解析效果仍需在真实文档集上自行验证。

xAI News一手来源✦ 精选模型发布1

xAI 发布 Imagine Image 2.0,支持精确编辑与多参考生成

xAI 发布了 Imagine Image 2.0,作为 grok.com/imagine 及 iOS/Android 应用上的新质量模式,提供精确的图像生成和编辑功能。该模型在文本到图像生成和图像编辑方面排名世界第二,并引入了魔法棒、区域分割、背景移除和多参考编辑等工具。此外,xAI 还推出了针对常见工作流的模板,API 访问即将推出。

推荐理由该版本将精确编辑工具(魔法棒、区域分割、多参考编辑)直接集成到消费级应用中,对需要快速迭代视觉素材的设计师和内容创作者而言,可省去手动合成步骤;但排名依据的是第三方榜单且未公开内部评测细节,实际编辑精度和风格一致性仍需在真实工作流中验证。

8月7日星期五 · 3
Hugging Face New and Trending Models一手来源✦ 精选模型发布1

GLM-5.2 量化模型发布:混合精度专家与融合 MoE 优化

Hugging Face 上发布了 brandonmusic/GLM-5.2-EXL3-TR3v4-3.5bpw-MTP78 模型,基于 zai-org/GLM-5.2,采用 trellis 量化与混合精度专家,支持 MTP-78。该模型在 4x RTX PRO 6000 Blackwell 上实现了 KLD 0.061282(fp8 KV)和 0.0695

推荐理由该量化版本通过混合精度专家和融合MoE路径,在4卡Blackwell上实现115.5 tok/s解码速度,同时将长上下文KV容量提升至35万token,对部署GLM-5.2的团队有直接参考价值;但KLD数据仅基于单机PCIe环境,且当前生产加载器尚不兼容该schema-v2检查点,实际部署需等待扩展支持。

Hugging Face New and Trending Models一手来源✦ 精选模型发布1

Hugging Face 发布 Carbon-3B 生成式 DNA 基础模型

Hugging Face 发布了 Carbon-3B,一个 3B 参数的生成式 DNA 基础模型,专注于真核生物,支持 32,768 个 6-mer 令牌(约 197k 碱基对)的上下文,并可扩展至 65,536 令牌。该模型在序列恢复、变异效应预测和基序扰动任务上可与 Evo2-7B 竞争,同时推理速度更快。Carbon 系列还包括 Carbon-8B 和

推荐理由Carbon-3B以3B参数在序列恢复、变异效应预测等任务上对标Evo2-7B,同时推理速度提升数倍,对预算有限的基因组学团队是更务实的选择;其混合分词器与FNS训练目标也为长序列建模提供了新思路。不过,性能对比仅基于零样本评测,未覆盖微调场景,且YaRN扩展超过393k碱基对时检索质量明显下降,长上下文实用性仍需验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布1

Red Hat 发布 Gemma 4 12B NVFP4 量化模型

Red Hat AI 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,该模型权重和激活均量化为 4 位浮点格式,使用 llm-compressor 工具和 GPTQ 方法进行量化,并针对 vLLM 进行了优化。初步评估显示,该量化模型在 GSM8K 和 Wikitext 基准上接近原始 BF16 模型的性能,恢复率超过 8

推荐理由该模型将Gemma 4 12B的权重和激活同时压缩至4位浮点,在GSM8K和Wikitext上恢复率超89%,对需要部署多模态模型但显存受限的团队可直接用vLLM加载,省去自行量化调参的流程。不过评估仅覆盖两个基准且未公开推理速度或显存占用对比,实际部署收益仍需在真实负载下验证。

8月6日星期四 · 3
Hugging Face Blog一手来源✦ 精选模型发布0

Jina 发布轻量重排序模型 v3.5,混合注意力与自蒸馏实现性能突破

Jina AI 发布 jina-reranker-v3.5 重排序模型,参数仅 0.6B,性能超越 1.5B 的 mxbai-rerank-large-v2 和 4B 的 Qwen3-Reranker-4B,在 BEIR 上达到 63.20,半结构化检索提升 9.6 nDCG@10。该模型采用混合注意力(3L2G)和自蒸馏技术,在保持质量的同时显著提升推理速

推荐理由该模型以0.6B参数在BEIR上超越4B级竞品,半结构化检索提升9.6 nDCG@10,对资源受限的检索系统是直接可用的性能升级;但官方明确承认在RTEB法律医疗任务、低资源语言上仍与4B模型有差距,且列表式重排的候选数上限约束未消除,实际部署前需按场景验证。

Hugging Face Blog一手来源✦ 精选模型发布0

Vaani-LID_v0:覆盖42种印度语言的语音识别前端

Hugging Face 与 ARTPARK-IISc 联合发布 Vaani-LID_v0,这是一个开源语音语言分类器,可识别印度 42 种语言,覆盖四个语系。该模型基于 Vaani 语料库预训练的 FastConformer 编码器,在冻结状态下跨域表现优于微调的 Whisper,并采用分层 softmax 提升泛化能力。研究还发现,对预训练编码器进行微调

推荐理由Vaani-LID_v0 首次将印度语音识别前端覆盖到42种语言,且冻结的FastConformer编码器在跨域测试中比微调Whisper高出20多个百分点,直接降低了多语言语音管线的路由错误成本。不过,模型在中央印度-雅利安语支的准确率仅58.7%,且未公开与真实部署环境的噪声鲁棒性对比,低资源语种的实用性仍需实测验证。

NVIDIA Generative AI Blog一手来源✦ 精选模型发布0

NVIDIA 发布 Cosmos 3 开放世界模型,推动物理 AI 发展

NVIDIA 发布了 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础模型系列,包含 Super、Nano 和 Edge 三个版本,支持视觉推理、世界生成和动作预测。该模型在多个基准测试中排名第一,并采用 Linux 基金会的 OpenMDW 1.1 许可证,允许开发者进行后训练和定制。NVIDIA 还通过 Omnivers

推荐理由Cosmos 3 将视觉推理、世界生成与动作预测整合进单一模型家族,开发者无需再为不同任务拼装多套模型,可直接基于 OpenMDW 1.1 许可证在自有数据上后训练,对机器人、自动驾驶等物理 AI 团队是流程上的实质简化。不过其基准排名均基于官方自测,且 Edge 版在 Jetson 上的实际推理延迟与能效尚未有第三方数据佐证,部署前仍需自行验证。

8月5日星期三 · 2
Simon Willison's Weblog✦ 精选模型发布0

Meta 发布 Muse Code 和 Muse Spark 1.2 编码模型

Meta 发布了 Muse Code 和 Muse Spark 1.2,后者是面向编码的模型更新,提升了代码生成、调试和代码库理解能力,并支持长序列智能体工具调用。模型提供两种定价选项,其中 contributor 版本通过允许数据使用大幅降价。

另有 1 家信源报道

推荐理由Muse Spark 1.2 将长序列智能体工具调用作为核心卖点,并针对整库生成和端到端项目做了专门训练,对需要复杂调试和代码库理解的开发者是直接升级;但正文未提供与 1.1 的基准测试对比,实际提升幅度需自行验证。定价上 contributor 版本以数据使用换取近 90% 降价,适合非敏感场景,但数据用途条款的具体边界未在文中说明。

Hugging Face New and Trending Models一手来源✦ 精选模型发布0

Qwen3.6-27B 多阶段微调模型突破 ARC-C 700 分

DavidAU 发布了基于 Qwen3.6-27B 的多阶段微调模型 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP,声称在 ARC-C 基准上首次突破 700 分,超越 OpenAI、Claude 和 Gemini 的闭源模型水平。该模型在 4bit 和 8bit 量化下均超过基座模型,

推荐理由该模型首次让27B级开源模型在ARC-C上突破700分,且4bit和8bit量化均超基座,对消费级硬件用户意味着可本地运行接近闭源旗舰的推理能力;但分数仅来自作者自测,未提供第三方复现或完整评测协议,实际泛化效果仍需独立验证。