返回主题地图

Hugging Face

公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:55

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 608 条。
8月10日周一 · 20 条
正文顺带提及命中实体:hugging face
量子位研究

AI倒查论文100年:99.2%顶刊被检出问题,ICML论文过半无法复现

近期多项研究显示,AI Agent可大规模审计顶会论文的可复现性。ICML 2026的92篇论文中58篇无法复现,GPT-5论文检查系统发现99.2%的顶刊论文存在客观错误。研究者认为AI正开启大规模重审科学文献的新时代,也为学术新人提供了找错、写勘误的新选题方向。

正文顺带提及命中实体:hugging face
THE DECODER模型发布

Meta 回归开放模型,发布 Muse Glimmer 并捍卫蒸馏策略

Meta 发布了 30B 参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可,可在消费级 GPU 上本地运行,并在多数基准测试中优于同类竞品。扎克伯格同时发表文章,捍卫模型蒸馏的合法性,并呼吁美国在开放模型领域保持领先。Meta 计划未来几周发布更强模型 Muse Spark 1.2 的开放权重版本,并考虑通过云业务变现其数据中心

另有 2 家信源报道

正文顺带提及命中实体:hugging face
Hugging Face New and Trending Models一手来源模型发布

Nanbeige4.2-3B GGUF 量化版本发布

gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8 0 到 IQ2 XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4 K M 在质量与体积间达到最佳平

正文顺带提及命中实体:huggingface
NVIDIA Technical Blog一手来源模型发布

Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流

Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090

正文顺带提及命中实体:hugging face
llama.cpp Releases一手来源开源

llama.cpp 新增 Granite-Switch 架构,支持逐 token LoRA 切换

llama.cpp 新增 Granite-Switch 架构后端,支持带多个 LoRA 适配器的模型,通过控制 token 实现逐 token 切换。该实现采用路由注意力机制在图中恢复适配器索引,解决了并发序列隔离问题,但存在单序列内无法回退的已知限制。目前支持 CPU 和 Mac (Metal) 构建,并已通过相关测试。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

对抗性攻击用于善:视觉内容生命周期主动保护综述

这篇综述论文探讨了“对抗性攻击用于善”的保护范式,即在视觉内容生命周期中,数据所有者、创作者、平台或审计者应用扰动和结构化信号来干扰未经授权的自动化或支持事后问责。论文识别了五个独立研究社区,分别针对隐私过滤、不可学习示例、生成式防护、对抗性验证码和溯源机制。评估发现大多数保护措施仍主要针对静态或弱自适应对手进行验证,缺乏受控基准之外的证据。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

激活预言机学会不阅读:微调预言机中的概念特异性盲区

Hugging Face 每日论文发布了一篇关于激活预言机(Activation Oracles)的研究。研究发现,在受控的禁忌词猜测场景中,针对隐藏特定概念的模型微调得到的激活预言机,反而会选择性丧失恢复该概念的能力,成为概念特异性反阅读器。尽管该概念在预言机内部仍可线性解码,但失败发生在读出路径上,这揭示了行为泄露、表征可解码性和预言机可表述性之间的分离

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

FATE:帧级音视频时间嵌入方法

FATE是一种帧级音视频时间嵌入方法,旨在同时捕捉语义和时间对齐。与现有嵌入模型和同步模型不同,FATE保留帧级序列并在物理时间线上对齐,通过联合目标训练。在三个任务上,FATE在时间和语义检索上大幅超越最强基线,在零样本事件定位上匹配全监督方法,并作为生成评估指标与人类判断相关性最佳。源代码已公开。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

OneEmo:统一多模态情感推理模型

OneEmo是一个统一的多模态情感推理模型,能够处理情感感知、理解和交互任务。研究团队构建了EmoWorld-130K数据集,通过人类参与的工作流程将专业知识转化为推理轨迹,并提出Emo-Chord强化学习策略来优化多任务学习。实验表明,OneEmo在多数基准上达到最先进性能,且参数远少于商业模型。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

Capek 0.5:面向具身智能的执行中心视觉语言模型

Capek 0.5 是一个面向具身智能的执行中心视觉语言模型,围绕执行能力分类法组织训练,涵盖空间推理、时间理解、动作引导和状态验证四类能力。每个能力先通过强化学习由共享骨干网络训练出专家,再通过权重空间合并和路由策略空间蒸馏整合为单一推理模型。Capek 0.5 在 2B 和 35B-A3B 规模上进行了评估,在多数基准上优于初始化模型,并能在模拟环境中完

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

可解释视网膜眼底图像基础模型DualIFM

DualIFM是一个为视网膜眼底图像设计的可解释基础模型,采用BagNet骨干网络,通过小感受野生成忠实于模型决策过程的类别证据图,并在预训练期间加入2D投影层以直接可视化表示空间。该模型在超过80万张彩色眼底照片上训练,性能与参数多16倍的RETFound相当,同时提供可解释的预测。代码和预训练模型已在GitHub上公开。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

基准污染缓解新指标与策略:SA-PPG 与 RailCap

Hugging Face 每日论文发布了一篇关于基准测试污染缓解的研究。论文指出现有评估指标 G-AP 存在缺陷,并提出新指标 SA-PPG 和缓解策略 RailCap。实验表明,SA-PPG 揭示先前策略的恢复效果被高估,而 RailCap 实现了最低的 SA-PPG。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

SFT冲突与RL共存:大语言模型多任务学习的理论与实证分析

该研究探讨了监督微调(SFT)和强化学习(RL)在提升大语言模型多任务推理能力时的不同表现。实验发现SFT在多阶段训练中面临严重的任务冲突,而RL能使不同任务稳定共存。研究从参数层面和理论角度分析了这一机制,指出SFT的干扰受梯度范数限制,而RL的干扰受梯度方差限制,并据此提出Parallel-RL范式,通过解耦多任务训练提升效率和灵活性。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

超越环境规模扩展:设计有效的多模态智能体环境分布

该研究重新审视了多模态智能体训练中环境规模扩展的常见范式,发现单纯增加环境数量并不总能提升性能,多模态环境尤其容易产生负迁移和优化冲突。为此,作者提出能力感知环境选择(AES)和分层难度课程(HDC)两种方法,分别从多样性和难度结构两个维度设计更有效的环境分布。实验表明,精心设计的环境分布能显著优于朴素的环境扩展,并带来更好的训练效果和泛化能力。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

PrivacyPeek:审计 LLM 智能体获取而非仅输出的隐私泄露

PrivacyPeek 是一个用于评估 LLM 智能体在获取阶段隐私泄露的基准,包含 1182 个案例,覆盖 7 种获取行为和 16 个应用领域。实验发现,不必要的敏感信息获取普遍存在,且任务完成能力与获取阶段泄露相关,提示级防御仅能减少少量泄露。该研究强调审计获取阶段隐私的紧迫性,数据集和代码已公开。

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

AI人格会成长吗?分析并基准测试LLM智能体经历生活事件后的人格演变

Hugging Face 每日论文发布了一项研究,分析了 LLM 智能体在经历生活事件后的人格演变。研究发现,基于人格条件的 LLM 智能体(PC-Agents)在事件诱导下表现出可测量的人格特质变化,但变化幅度通常低于人类效应量,且人格层面的离散度被压缩。研究引入了可复用的基准 BFI-Adapt,用于评估事件诱导人格变化的方向保真度,并对 14 个模型进

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

C4 框架:评估多模态大语言模型的跨概念创造力

Hugging Face 每日论文介绍了一项名为 C4 的评估框架,用于测试多模态大语言模型(MLLMs)的跨概念创造力,该框架基于中文成语设计。研究构建了包含 184 个合成项目和 37 个人类创建项目的 C4-Eval 数据集,并在十个 MLLM 上进行了评估。结果显示,最强的闭源模型准确率约为 50%,而开源模型显著较低,揭示了当前 MLLMs 在解码

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

往返一致性:双向扩散模型可预测自身滚动误差

该论文提出了一种双向条件潜扩散模型,通过方向标志控制动力系统在时间上的前向或后向演化,并利用往返一致性(即前向i步再后向i步应回到起点)作为无需测量数据的测试时误差信号。实验表明,该信号在可压缩磁流体动力学、湍流辐射混合层和自然人脸视频上能有效预测滚动误差,并在分布外检测和误差削减上优于基线方法。双向训练成本为负,且后向方向可作为快速逆求解器。

正文顺带提及命中实体:transformers
Hugging Face New and Trending Models一手来源模型发布

Jina AI 发布 jina-reranker-v3:0.6B 多语言重排序模型,BEIR 达 SOTA

Jina AI 发布了 jina-reranker-v3,一个基于 Qwen3-0.6B 的 0.6B 参数多语言文档重排序模型,采用新颖的 last but not late interaction 架构,在 131K token 上下文中可同时处理多达 64 个文档。该模型在 BEIR 基准上达到 61.94 nDCG@10 的 SOTA 性能,比生成式

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

不确定性感知世界模型用于空中图像目标导航

Hugging Face 每日论文发布了一篇关于空中图像目标导航的研究,提出了一种名为 UA-NWM 的不确定性感知世界模型。该模型将轨迹评分视为条件分布外检测,通过不确定性子空间表示可能的未来,并仅使用不可解释的残差进行评分,从而无需多次未来采样即可实现稳健选择。实验表明,UA-NWM 在多种任务上优于现有导航世界模型,同时保持低推理延迟,并通过真实无人机