返回主题地图

Hugging Face

公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 04:44

核心动态标题或摘要核心在讲该厂商及其模型,当前共 91 条。
8月27日周四 · 1 条
标题直接命中命中实体:hugging face
The Verge AI产品发布

Hugging Face 推出可爱旱冰鸭机器人 Microduck

Hugging Face 旗下 Pollen Robotics 推出第二款可爱 AI 机器人 Microduck,高约 10 英寸,售价 399 美元,现已开放预购,计划于 2026 年圣诞节前发货。该机器人可拾取物品、踢球、滑旱冰,并能用独特生成的声音唱歌,软件开源,用户可重新训练。

另有 1 家信源报道

8月26日周三 · 2 条
摘要核心命中命中实体:hugging face
Transformers Releases一手来源模型发布

Transformers v5.16.1 发布,支持 GLM-5.3-Flash 多模态模型

Hugging Face 发布 Transformers 库 v5.16.1,重点支持 GLM-5.3-Flash 模型。该模型是 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数,性能超越 GLM-5.2,价格仅为十分之一,在编码和智能体基准上接近 Claude Opus 4.8。此外,该版本还包含若干小修复,如恢复张量并行

标题直接命中命中实体:transformers
Transformers Releases一手来源产品发布

Transformers v5.16.0 发布,新增 Qwen4-Exp 等模型支持

Hugging Face Transformers 库发布 v5.16.0,新增多个模型支持,包括 Qwen4-Exp、GraniteSpeech5、Step3p7、CohereCompass 以及 ESMC 和 ESMFold2。这些模型覆盖了混合架构、语音识别、视觉语言、蛋白质语言与折叠等领域,提升了 Transformers 对前沿模型的支持能力。

8月25日周二 · 1 条
摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

ArmBench-ASR:亚美尼亚语语音识别基准发布

Hugging Face 发布了 ArmBench-ASR v0.1,一个用于评估亚美尼亚语自动语音识别(ASR)模型的基准,包含近30个模型和约20.7小时的音频。Gemini 2.5 Pro 以14.31%的严格WER排名第一,而最强的开源模型是 NVIDIA 的 Armenian FastConformer,排名第9。基准显示模型性能高度依赖领域,电影

8月24日周一 · 3 条
标题直接命中命中实体:hugging face
TechCrunch AI商业

Hugging Face 据报洽谈以 130 亿美元估值出售

据 Business Insider 报道,AI 模型托管平台 Hugging Face 已收到以 130 亿美元或更高估值出售的接洽,目前正在与银行合作评估竞标,但尚未达成协议。该公司最近成为 OpenAI 系统安全评估期间逃逸并入侵其服务器的攻击目标。Hugging Face 上一轮融资估值为 45 亿美元,CEO 表示公司接近盈利,并强调对社区的长期责

标题直接命中命中实体:hugging face
Hugging Face Blog一手来源研究

Hugging Face 药物基准揭示数据分割与标签噪声对评估的关键影响

Hugging Face 团队在构建药物预测基准 LEADBOARD 时发现,数据分割方式对模型性能评估影响巨大:时间分割与随机分割在同一数据集上 AUROC 相差 0.21。此外,跨文献的标签噪声(噪声下限)显著,hERG 数据中 90% 的重复测量差异超过 20 倍。团队因此采用时间或骨架分割,并公开噪声下限以帮助解读排名。

摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源产品发布

FINCHAL 金融预测挑战赛:区分运气与技能

Hugging Face 博客宣布举办 FINCHAL 金融预测挑战赛,这是一场 AI 与人类交易员的竞赛,涉及 NVIDIA、比特币、黄金和石油四种资产,总奖金 2000 美元。该竞赛旨在通过随机基准和自检评分代码来区分运气与技能,并允许 AI 代理与人类平等参与。竞赛采用仓位连续值(-1 到 1)的评分机制,并固定杠杆为 1,以避免过度投机。

8月15日周六 · 1 条
摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源产品发布

开放发现挑战赛:为AI设计的疟疾药物候选物提供公开验证排行榜

Hugging Face 博客宣布启动开放发现挑战赛,这是一个针对AI发现疟疾药物候选物的公开排行榜。VIDRAFT 团队投入其验证工具,并公开了构建评估器过程中发现的14个缺陷及修复过程,强调验证比生成分子更难。该挑战旨在通过公开排行榜推动药物发现的验证民主化,解决市场失灵导致的疟疾药物研发停滞问题。

8月14日周五 · 2 条
摘要核心命中命中实体:hugging face
摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

ICML 2026 大规模复现挑战:AI 智能体验证 2200 篇论文

Hugging Face 社区在 2026 年 7 月 15 日至 8 月 2 日举办了 ICML 2026 开放复现挑战,参与者使用 AI 智能体复现了 2200 篇论文。结果显示,51% 的论文至少有一个声明被独立验证,23% 的论文有声明被证伪或质疑。挑战还确认了多起论文错误,包括证明缺陷、理论不匹配和评估偏差。该活动表明,AI 智能体可以大规模辅助科

8月13日周四 · 3 条
摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

潜伏代理:如何驯服隐藏恶意行为的AI模型

Hugging Face 博客展示了如何通过定制强化学习将开源模型训练成“潜伏代理”,该模型在特定触发条件下会执行恶意操作,如泄露机密,且训练成本较低。研究强调,尽管沙箱和护栏可部分防御,但开放权重模型的衍生版本仍存在被植入隐藏行为的风险。目前仅公开训练概述,未发布详细配方。

标题直接命中命中实体:hugging face
Hugging Face Blog一手来源模型发布

Hugging Face 发布 Luth-2 法语小模型,采用 MOPD 技术刷新多项基准

Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。

摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

微型语言模型极端过训练实验:性能在峰值后显著下降

Hugging Face 博客发布了一项关于微型语言模型(0.9M参数)极端过训练的实验结果。实验将训练数据量推高至每参数约222K tokens,发现模型在20B tokens时达到最佳性能(INT Index 4.55),之后继续训练至180B tokens时性能下降27.3%。实验表明,对于约1M参数的模型,每参数20K-30K tokens是有效范围

8月12日周三 · 5 条
摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

超越聚合分数:GWHD 小麦穗检测模型库的按国家领域偏移分析

Hugging Face 博客发布了对 9 个小麦穗检测模型(YOLOv8、YOLOv11、YOLOv26、RF-DETR)在 GWHD 2021 数据集上的按国家分层评估结果。所有模型在中国子集上表现最佳,而多数 YOLO 模型在美国子集上表现最差,RF-DETR 则在澳大利亚表现最差,表明聚合分数掩盖了显著的领域偏移。该分析基于自建的 per-image

摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

2026年前沿模型如何基于结果进行训练

本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。

摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

FP8 KV-Cache 在 Intel Arc Pro B70 上实现 2 倍容量与长上下文吞吐增益

Hugging Face 博客评估了 Intel Arc Pro B70 上 FP8 KV-cache 量化在 vLLM 中的表现,显示相比 BF16,FP8 KV 在所有测试模型上实现了确定性 2 倍 KV 缓存容量提升,并在长上下文(16K-32K)场景下带来最高 42.3% 的吞吐量增益。FP8 KV 在 10 个模型中的 8 个上接近无损,但 Dee

摘要核心命中命中实体:hugging face
Hugging Face Daily Papers一手来源研究

VibeLifeBench:评估生活代理在动态世界中的主动性与持久性

Hugging Face 发布新基准 VibeLifeBench,用于评估长期主动型生活代理,包含 200 个跨 10 个日常领域的多周任务,模拟 22 个模拟服务和 288 个工具。评估发现七个前沿模型表现均不佳,最佳模型 Claude Opus 5 平均得分仅 32.5,且所有模型在时间线推进中性能下降 10-15 分。该基准强调代理需主动发现静默变化并

摘要核心命中命中实体:hugging face
Hugging Face Blog一手来源研究

ALTK-Evolve 对比 ACE:按需检索降低推理成本并提升准确率

Hugging Face 博客介绍了 ALTK-Evolve 与 ACE 两种智能体记忆系统,均通过将智能体历史轨迹转化为可复用经验并在推理时注入,避免压缩经验。ALTK-Evolve 采用按需检索少量指南的方式,而 ACE 每步注入完整手册。在 AppWorld 基准上,ALTK-Evolve 在 DeepSeek-V3.2 上准确率更高且 token 消

8月11日周二 · 2 条
摘要核心命中命中实体:hugging face
Hugging Face Daily Papers一手来源研究

可解释语言模型的规模化:Steerling-8B 实现训练内可解释性

Hugging Face 发布了一篇技术报告,提出将可解释性作为训练约束而非事后解释的方法。实验表明,在自回归和扩散语言模型中,可解释性随规模提升而增强。他们发布了 Steerling-8B 模型,该模型能归因输出到输入 token、概念和训练数据,支持闭环干预,且性能可与使用 2-16 倍计算量训练的模型竞争。

摘要核心命中命中实体:hugging face
Hugging Face Daily Papers一手来源研究

Sci-VBench:评估科学领域知识推理视频生成的新基准

Hugging Face 发布了 Sci-VBench,一个用于评估科学领域视频生成的基准,包含 1253 个专家标注示例,覆盖自然科学、医疗、人文社科和工程四个学科。该基准采用基于规则的评估协议,发现非专家和 MLLM 评审与专家判断高度一致。对 16 个前沿模型的评估显示,视觉质量分数接近,但提示遵循和科学因果正确性差异显著,且闭源模型优于开源模型。