精选

2026年9月27日 周日 · 今天值得看的 AI 动态

7807
已入库内容
131
活跃信源
7306
已 AI 结构化
44019
检索分块

当前热点

完整榜单 →
  1. 1DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中41 热度
  2. 2Qwen3-4B-Base 模型卡上线 Hugging Face40 热度
  3. 3CrowdGPT 发布社区分布式模型 Crowd-v124 热度
  4. 4audio.cpp 发布多款语音模型 GGUF 量化包24 热度
  5. 5Qwen3.6-35B无审查Genesis版GGUF发布24 热度
9月27日周日 · 2 条
Hugging Face New and Trending Models一手来源✦ 精选模型发布41

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台

推荐理由这个1.08B掩码扩散检查点用置信度定向重填充,整段序列约20次并行去噪即可生成,而自回归每token需一次前向,对想试并行解码的研究者可省下自建成本。但训练仅到一半、事实性不可靠,且未报告任何公开基准分数,实际质量仍需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布40

Qwen3-4B-Base 模型卡上线 Hugging Face

Hugging Face 上出现了一个名为 ReliquaryForge/qwen3-4b-base-dapo-v4 的模型页面,内容为 Qwen3-4B-Base 的模型卡。该模型卡介绍了 Qwen3 系列在预训练语料、训练技术、三阶段预训练和超参数调优方面的改进,并给出 Qwen3-4B-Base 的 4.0B 参数、32k 上下文等规格。页面还提示需使

推荐理由Qwen3-4B-Base 模型卡明确了 4.0B 参数、32k 上下文与三阶段预训练流程,对打算在本地部署小尺寸基座模型做微调的人可直接据此评估显存与序列长度。但页面只给出规格,评测结果全部外链到博客,且需 transformers≥4.51.0 否则报 KeyError,实际效果与兼容性仍需自行验证。

9月26日周六 · 1 条
Hugging Face New and Trending Models一手来源✦ 精选模型发布17

Prism ML 发布三值量化 Bonsai 2 27B GGUF 模型

Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1 0)或 7.21 GB(PQ2 0),相比

推荐理由该模型把 27B 级推理权重全部压到三值,体积约 5.95 GB,可在 llama.cpp 的 CUDA、Metal、CPU 上跑,对想在单卡或笔记本本地部署长上下文智能体的开发者直接可用。但官方 98.2% 的保留率与 84.78 平均分均出自自家白皮书,尚无第三方复现;且密集 PTQ1_0 打包在 Ampere、Hopper、Blackwell 上解码反而更慢,延迟收益仍待验证。

9月25日周五 · 3 条
Hugging Face New and Trending Models一手来源✦ 精选模型发布12

GLM-5.3-Flash W4A16 INT4 量化版发布,体积减70%

canada-quant 发布了 GLM-5.3-Flash 的 W4A16(INT4)量化版本,仅对 36,288 个路由专家 GEMM 做 GPTQ 对称 INT4 量化,注意力、路由、共享专家、嵌入、视觉塔和 MTP 头保持 BF16。模型体积从约 599 GiB 降至 177.7 GiB(-70%),可在 H100、H200、RTX PRO 6000

推荐理由该量化版把 599 GiB 的 GLM-5.3-Flash 压到 177.7 GiB,只量化 36,288 个路由专家 GEMM,注意力、视觉塔和 MTP 头保持 BF16,使 4×H100 或 2×DGX Spark 这类配置能跑起完整 1M 上下文。但质量对比仅限 AIME 2025、GSM8K、GPQA-Diamond 三项且样本为 n=120,其他任务上的精度损失尚未验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布8

RedHatAI 发布 Qwen3.8-27B-NVFP4 量化模型

RedHatAI 发布了 Qwen3.8-27B-NVFP4,这是对 Qwen/Qwen3.8-27B 的混合精度量化版本,采用 FP4/FP8 方案,MLP 投影量化为 FP4,注意力投影和最终 MLP 层量化为 FP8,KV 缓存量化为 FP8,语言模型头保持全精度。该模型使用 LLM Compressor 结合 AWQ 与 GPTQ 在 perfect

推荐理由RedHatAI 把 Qwen3.8-27B 做成 FP4/FP8 混合精度版,检查点从约 54 GB 压到 24.7 GB,显存和磁盘需求降约七成,对单卡部署多模态大模型的团队直接可用。但校准只用了 perfectblend 的 512 个样本,且性能曲线仅在 B200 上以 TP=1、DP=4 测得,其他硬件与业务分布上的精度保持情况仍需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布9

Viggle 发布 Qwen-Image-2.1 少步蒸馏 LoRA v0.2.1

Viggle 在 Hugging Face 上发布了 Qwen-Image-2.1-viggle-turbo v0.2.1,这是基于 Qwen/Qwen-Image-2.1 的少步蒸馏 LoRA 适配器,采用分布匹配蒸馏(DMD)训练。它支持文生图和指令驱动编辑,仅需 6 次 transformer 前向(而非基座的 40 步)且无需无分类器引导,端到端约快

推荐理由这个 LoRA 把 Qwen-Image-2.1 的推理从 40 步压到 6 步、端到端约快 5 倍,且无需分类器无引导,对显存和延迟受限的本地出图与编辑流程直接可用,还附带 ComfyUI 工作流。但作者自述 ComfyUI 移植多为 AI 辅助编写、可能有粗糙之处,且质量对比只基于 96 条自建样本,2K 输出仅凭肉眼比较,复杂编辑仍会退化。

9月24日周四 · 2 条
Hugging Face New and Trending Models一手来源✦ 精选模型发布4

inclusionAI 开源 Ling-mini-2.0:16B MoE 模型仅激活 1.4B

inclusionAI 开源了 Ling 2.0 系列首个模型 Ling-mini-2.0,这是一个基于 MoE 架构的大语言模型,总参数 16B、每 token 仅激活 1.4B(非嵌入 789M),在 20T+ tokens 上训练。该模型采用 1/32 激活比、MTP、QK-Norm 等设计,宣称以 1.4B 激活参数达到 7-8B 稠密模型性能,在

推荐理由16B 总参数、每 token 仅激活 1.4B 的 MoE 模型,宣称达到 7-8B 稠密模型水平,H20 上生成超 300 token/s,并开源 FP8 训练方案与五个预训练检查点,适合显存受限、需要长上下文推理的部署场景。但性能对标数据来自团队自测,第三方复现与真实业务负载下的表现尚未验证。

NVIDIA Technical Blog一手来源✦ 精选模型发布3

NVIDIA 发布 NV-Reason-CT:面向放射科思维链的 3D CT 视觉语言模型

NVIDIA 发布 NV-Reason-CT,一个专为 3D CT 分析构建的视觉语言模型,将思维链推理扩展到全容积 CT,可生成结构化诊断报告、模拟放射科医生思维链并支持多轮追问对话。该模型基于 NV-Reason-CXR 的推理方法,采用 3D ViT 编码器与 Qwen3.5-4B 语言模型组合,处理 192³ 体素 CT 数据。NVIDIA 强调其定

推荐理由NV-Reason-CT 用 3D ViT 编码器直接处理 192³ 体素 CT,而非把切片当独立 2D 帧,并输出覆盖 30 项胸部、29 项腹部异常的结构化报告与思维链,对需要多轮追问的胸腹部 CT 研究场景有用。但 NVIDIA 明确它只是开放研究基础模型,不是获批临床产品,也未公布独立评测数据,实际诊断表现仍需自行后训练验证。

9月23日周三 · 4 条
AWS Machine Learning Blog一手来源✦ 精选模型发布1

Claude Opus 5.5 上线 AWS Bedrock

Anthropic 的 Claude Opus 5.5 现已在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,是 Claude 5.5 系列首个模型。该模型面向智能体编程、知识工作和长时任务,据 Anthropic 称比 Opus 5 用更少 token 完成更多工作,且单 token 价格和缓存读取成本更低,从而降低

另有 2 家信源报道

推荐理由Claude Opus 5.5 在 Bedrock 上线,对跑长时智能体编程和长文档知识工作的团队意味着可用更少 token 和更低缓存读取成本换取更低单任务成本,且自适应思考默认开启、无需再手动设思考预算。但正文只转述 Anthropic 的说法,未给出与 Opus 5 的公开评测或成本对比数据,实际降本幅度仍需自行验证。

量子位✦ 精选模型发布1

Claude Opus 5.5 突袭:跑分登顶,API 价格打 8 折

Anthropic 发布旗舰模型 Claude Opus 5.5,在 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 等编程与知识工作基准上登顶,输出速度比 Opus 5 快 30% 以上。API 输入输出价格下降 20%,缓存读取价从每百万 Token 0.50 美元降至 0.20 美元,Anthr

另有 2 家信源报道

推荐理由Opus 5.5 把缓存读取价从每百万 Token 0.50 美元砍到 0.20 美元,对反复读取长上下文的 Agent 编程场景是实打实的成本下降,且默认中档 effort 在 CursorBench 上仍领先。但跑分多为 Anthropic 自选基准,FrontierCode 上仅领先 GPT-6 Astra 1.1 分,官方也承认榜单差距难反映真实体验,实际收益仍需自行验证。

THE DECODER✦ 精选模型发布1

Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,成本降四成

Anthropic 发布新模型家族首款产品 Claude Opus 5.5,宣称在多数任务上达到 Claude Fable 5.1 的水平,但运行成本比 Opus 5 低约 40%,输出速度提升超 30%。该模型定价降至每百万输入 token 4 美元、输出 20 美元,缓存读取费用下降 60%,并首次配备与 Fable 5.1 同级的网络安全、生物和前沿

另有 1 家信源报道

推荐理由Opus 5.5 把输入输出价格降到每百万 4 美元和 20 美元,缓存读取降 60%,官方称总运营成本比 Opus 5 低约四成,对高频调用 API 的团队是直接的账单变化。但性能对标 Fable 5.1 的说法来自 Anthropic 自家基准,第三方评测尚未公布,实际差距仍需自行验证。

Google DeepMind News一手来源✦ 精选模型发布2

Gemini 3.8 文本转语音模型发布

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向创意角色设计与逐行表演控制,后者面向高吞吐、低成本的配音与语音代理场景。新模型支持自然语言生成定制音色、30 秒样本声音复刻、2000+ 预置音色及 100 多种语言,并配备同意验证、SynthI

推荐理由两款 TTS 模型把音色设计、逐行表演控制和 30 秒声音复刻打包进 Gemini API 与 AI Studio,对做配音、有声书和语音代理的开发者可直接替换原有拼接方案;但官方只给出 Hume AI 基准第一和部分语种盲测领先,未公开完整评测数据,且企业版 API 尚未上线,实际多语种表现仍需自行验证。

9月22日周二 · 6 条
Hugging Face New and Trending Models一手来源✦ 精选模型发布1

poolside 发布 Laguna XS.2:33B MoE 本地智能体编程模型

poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Ver

推荐理由33B 总参数、每 token 仅激活 3B,让这台模型能在 36GB 内存的 Mac 上本地跑智能体编程,Apache 2.0 许可也方便商用改造。不过 SWE-bench Verified 69.9% 是官方自报成绩,且对比表中部分竞品数据缺失,实际编码收益仍需自行复现验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布1

阿里PAI发布MiniMax-H3视频ControlNet-Union模型

阿里 PAI 团队在 Hugging Face 发布 MiniMax-H3-Fun-Controlnet-Union,这是一个基于 VideoX-Fun 流程训练的 ControlNet-Union 模型,可为 MiniMax-H3 视频生成器提供 Canny、Depth、HED、MLSD、Pose 五种控制条件以及视频修复能力。该模型仅包含约 6.8GB

推荐理由这个 ControlNet-Union 权重约 6.8GB,叠加在 MiniMax-H3 基础模型上即可用 Canny、Depth、HED、MLSD、Pose 五种条件控制视频生成,还支持视频修复,省去按条件切换多个检查点的麻烦;但页面已明确标注为 legacy,官方推荐改用效果更好的 2.0 版本,且未给出与 2.0 的量化对比。

Claude App Release Notes一手来源✦ 精选模型发布1

Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

Anthropic 发布 Claude Opus 5.5,这是全新 Claude 5.5 系列的首个模型。该模型在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。

另有 2 家信源报道

推荐理由Claude Opus 5.5 作为 5.5 系列首个模型,在多数任务上对标 Fable 5.1,同时运行成本比 Opus 5 低 40%,对成本敏感、正评估模型替换的团队可直接算一笔迁移账。但正文未给出具体评测数据与基准对比,40% 降本的口径和「多数任务」的覆盖范围都需看博客原文确认。

Hugging Face New and Trending Models一手来源✦ 精选模型发布1

Synthyra 发布 ESM++ Large 蛋白质语言模型

Synthyra 在 Hugging Face 上发布了 ESMplusplus large 模型,将 biohub/ESMC-600M 检查点与 FastPLMs 运行时打包,用于蛋白质语言建模。该模型支持氨基酸序列输入,提供序列/残基嵌入、下游分类预测、PEFT LoRA 微调以及测试时训练(TTT)等功能,并兼容多种注意力后端。

推荐理由该模型把 biohub/ESMC-600M 检查点与 FastPLMs 运行时打包,支持序列/残基嵌入、LoRA 微调和测试时训练,对需要在本地跑蛋白质语言建模的研究者可直接用 Transformers 接口加载。但分类头是随机初始化的,必须先微调才能解读输出;且运行要求 Python 3.11-3.14、PyTorch 2.13 与 Transformers 5.13,FlashAttention 还需兼容 CUDA 硬件,环境门槛较高。

AWS Machine Learning Blog一手来源✦ 精选模型发布

xAI 的 Grok 4.6 现已上线 Amazon Bedrock

xAI 的 Grok 4.6 模型正式上线 Amazon Bedrock,成为 xAI 在 Bedrock 上的第二个模型。该模型面向长时运行的 agent、编程和知识工作,提供 500K token 上下文窗口和四档可配置推理强度(low、medium、high、xhigh)。相比前代,Grok 4.6 同时支持 bedrock-mantle 和 bedr

推荐理由Grok 4.6 在 Bedrock 上同时支持 bedrock-mantle 与 bedrock-runtime 端点,并新增 Converse API、流式与跨区域推理,对已用 Bedrock 统一接口的团队可直接接入,无需另建 OpenAI 兼容链路。但文中基准成绩均为 xAI 自行发布,且部分评测来自 Artificial Analysis,缺少第三方独立复现,实际表现仍需按自身负载验证。

Latent Space✦ 精选模型发布

小米 MiMo-V2.6-Pro 开源:1T-A42B 新晋最强开源权重模型,训练成本 300 万美元

小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数(46),训练成本约 300 万美元。小米同时开源 RL 环境、训练配方与代码,并披露 RL 训练细节(130 小时、75B tokens、约 260 万美元)。此举被视为中国前沿实验室开源发布潮的一部分,也凸显

推荐理由小米把 MiMo-V2.6-Pro 的权重、RL 环境与训练配方一并开源,对想自建 agent 或复现 RL 流程的团队,可直接拿到环境代码和奖励设计,而不只是模型文件。但完整的 7k+ 任务数据集尚未发布,且智能指数 46 的评测口径未在正文中说明,实际能力仍需自行验证。

9月21日周一 · 3 条
Microsoft Research Blog一手来源✦ 精选模型发布

微软开源逆合成模型RetroChimera,登Nature

微软研究院在《Nature》发表逆合成预测模型 RetroChimera,它结合基于 Transformer 的 R-SMILES 2 与基于图神经网络的 NeuralLoc 两个互补模型,通过学习式集成策略对二者预测排序。盲测中化学家更偏好 RetroChimera 给出的反应预测,优于子模型、既有方法甚至文献记录的反应。该模型已在 GitHub 以 MI

推荐理由RetroChimera 把 Transformer 与图神经网络两个互补模型用学习式集成排序,盲测中化学家更偏好它的单步断键预测,甚至优于文献记录的反应;MIT 许可开源并放出权重,做药物或材料合成的团队可直接接入试用。不过偏好评测来自专家主观判断,正文未给出与既有方法在成功率等量化指标上的对比,实际规划路线的可用性仍需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布

JoyFox 发布 Qwen3.8-27B 未审查变体,降低拒绝率

joyfox 发布了基于 Qwen3.8-27B 的未审查变体模型,通过 abliteration 技术降低拒绝率,同时保留原生架构、视觉栈和 MTP 权重。该模型在 800 个良性提示上实现 0% 拒绝率,能力得分与官方版持平,并提供多种 GGUF 量化版本。

推荐理由该模型用 abliteration 把 Qwen3.8-27B 在 800 条良性提示上的拒绝率从 59.2% 降到 0%,且能力得分持平,适合需要减少误拒的本地部署场景,并附多种 GGUF 量化。但评测仅 1000 条提示、单一 llama.cpp 提交,且作者自承 abliteration 可能连带削弱应有的拒绝行为,实际边界需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布

IFM 发布 K2-Horizon-0.9B 紧凑推理模型

IFM 在 Hugging Face 发布 K2-Horizon-0.9B,这是 K2-Horizon 系列中的紧凑型 dense 解码器模型,参数量 0.9B,支持 128K 上下文窗口(通过 YaRN RoPE 缩放)。模型采用多教师蒸馏训练,覆盖数学、代码、STEM 和指令跟随,并在数学、编程、科学和工具使用基准上与 Qwen3.5-0.8B、Open

推荐理由0.9B 稠密模型做到 128K 上下文,并以 Apache-2.0 开放、承诺放出训练数据与配方,对想在单卡上跑长文档推理或做蒸馏复现的开发者门槛较低。但卡片只给出与 Qwen3.5-0.8B 等参考模型的对比图,未说明评测集与评测方式,且训练数据、配方和代码目前仍是「将公开」,实际可用性待验证。

9月20日周日 · 4 条
Hugging Face New and Trending Models一手来源✦ 精选模型发布

ESPnet 发布 OWSM-CTC v4 1B 开源语音基础模型

ESPnet 团队发布 OWSM-CTC v4 1B 语音基础模型,基于分层多任务自条件 CTC 的纯编码器架构,在 32 万小时公开音频上训练三个 epoch,支持多语言语音识别、任意语言对语音翻译和语种识别。该模型完全开源,代码、权重和训练日志均已公开,其配套论文获得 INTERSPEECH 2025 最佳学生论文奖。模型提供批量推理、长音频解码和 CT

推荐理由该模型把多语言识别、任意语言对语音翻译和语种识别合并进单个非自回归编码器,并公开代码、权重与训练日志,适合想自建语音管线又需要可复现训练的团队。但正文只给出训练数据规模与轮次,未列出与 Whisper 等基线的评测对比,实际精度与延迟仍需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布

Qwen3.8-27B 无审查消融版 GGUF 发布

Hugging Face 上发布了一个名为 Qwen3.8-27B RVN Heretic Abliterated Uncensored 的 GGUF 模型,它基于 Qwen3.8-27B,并在 trohrbaugh 的 ARA 消融版本上额外进行两轮全权重 ARA 处理,将有害提示拒绝率从 3/100 降至 0–1/100,同时保持极低的行为损伤(KL≈0

推荐理由该模型在 trohrbaugh 的 ARA 消融版上再做两轮全权重 ARA,把有害提示拒绝率从 3/100 压到 0–1/100,同时 KL 仅约 0.0085,适合做红队测试与拒绝行为分析的研究者。但拒绝率数据来自独立测量而非官方评测,且模型明确保留部分安全护栏,跨语言与跨领域表现仍需自行验证。

Hugging Face New and Trending Models一手来源✦ 精选模型发布

Luck-Spark V-300-MoE:小型Mixtral风格MoE研究预览

开发者 Dr. Zeon 在 Hugging Face 发布 Luck-Spark V-300-MoE,一个从零预训练的小型 Mixtral 风格 MoE 语言模型,总参数约 2.95 亿,含 4 个专家、top-2 路由、1024 上下文。模型在 Kaggle 双 T4 上训练,目标语料 50 亿 token,当前权重处于训练早期,可生成短文本但可能重复或

推荐理由这个约2.95亿参数、4专家top-2路由的Mixtral风格模型,为想在单张Kaggle T4上验证稀疏专家路由与跨会话断点续训的开发者提供了可复现的小规模样本,并覆盖土耳其语、英语、数学与代码混合配比。但权重仅处于50亿token目标的早期,官方评测对比尚未发布,生成重复与混语问题也未解决,实际路由效果需自行验证。

量子位✦ 精选模型发布

中国电信开源全栈国产模型Xing4.0-29B-A4B,单张3090可跑

中国电信AI开源了全栈国产化的轻量级代码智能体大模型Xing4.0-29B-A4B,采用MoE架构,总参数290亿、每次推理仅激活约40亿,经4-bit量化后可在单张RTX 3090上运行。该模型完全基于华为昇腾910C算力与MindSpore/MindFormers框架训练,支持256K上下文并可扩展至512K,重点强化Coding与Agent能力,已适配

推荐理由中国电信开源 Xing4.0-29B-A4B,用 MoE 把 290 亿总参数压到每次仅激活约 40 亿,4-bit 量化后单张 3090 可跑,且从昇腾 910C 训练到 MindSpore 框架全链路国产,适合数据不能出域、算力有限的企业私有化部署。不过文中 90% 复杂业务办理成功率等数据均来自官方口径,缺少第三方评测佐证,实际效果仍需自行验证。