冻结像素扩散模型可通过自身样本实现自我引导
该研究提出了一种名为合成自引导(SSG)的方法,使冻结的预训练像素空间扩散模型能够利用自身生成的样本进行自我引导,无需从头训练新模型。通过在中间层附加轻量级预测头,并利用中间层与最终层预测之间的差异作为采样时的引导方向,该方法在ImageNet上显著提升了生成质量,将FID降低超过50%,且适配器训练计算量不到全模型训练的1%。
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:55
该研究提出了一种名为合成自引导(SSG)的方法,使冻结的预训练像素空间扩散模型能够利用自身生成的样本进行自我引导,无需从头训练新模型。通过在中间层附加轻量级预测头,并利用中间层与最终层预测之间的差异作为采样时的引导方向,该方法在ImageNet上显著提升了生成质量,将FID降低超过50%,且适配器训练计算量不到全模型训练的1%。
Hugging Face 每日论文介绍了一项关于智能体失败定位的新研究。该研究提出了一种以交互为中心的失败分类法,将41种失败模式分配到智能体系统组件间的交互边上,并指明修复责任方(模型、框架、环境或评估器)。该分类法通过公开基准、系统卡片和智能体轨迹进行验证,并使用独立推理智能体评估其可复现性,最强评判者与人类标签的Cohen's κ达到0.76。
RecHarness 提出了一种基于 Bandit 路由的智能体框架,用于自动化推荐模型优化。该框架将优化过程分为两步:Bandit 路由器根据历史验证反馈选择修改方向,LLM 在选定方向内生成具体优化假设和可执行代码编辑。在多个推荐任务和数据集上,RecHarness 比纯 LLM 推理搜索更稳定且更节省试验预算,在大型短视频广告平台的 7 天在线 A/B
Hugging Face 每日论文发布了一篇关于视觉-语言混合专家模型负载均衡的研究。论文提出 ReBA 方法,通过分别平衡图像和文本的负载、以图像为单位进行路由决策,解决了标准辅助损失在混合负载下可能隐藏模态特定不平衡的问题。实验表明,ReBA 在四个视觉-语言 MoE 骨干网络上降低了负载不均衡,同时保持了任务准确率。
Hugging Face 每日论文发布了一篇关于视频运动迁移的新研究,提出了一种名为 Motion Beyond Morphology (MBM) 的框架,旨在解决参考视频与目标对象在形态、关节或变形机制上差异较大时的运动迁移问题。该框架通过两阶段学习,利用多粒度抽象运动表示引导跨类别视频对,并在推理时直接基于参考视频生成,无需显式运动提取。实验表明,在相同
Hugging Face 每日论文发布了一篇题为《3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering》的研究论文。该论文提出了一种名为3DZip的三阶段令牌压缩框架,用于3D视觉语言模型,通过粗体素化、基于特征多样性的锚点选择以及空
本文提出了一种名为DAPD(双锚定策略蒸馏)的新框架,用于解决语言模型后训练中在线策略自蒸馏(OPSD)存在的特权幻觉问题。DAPD通过双路径锚定和双源锚定两个层面的锚定机制,消除了教师模型与学生模型在推理时的信息不对称。实验表明,DAPD在Qwen3-4B上平均提升2.00分,在4B和32B规模上分别提升2.69和2.78分,显著优于OPSD。
SKT 是一种基于验证的合成数据生成流水线,用于提升语言模型代理的技能使用能力。它从 2000 个公共技能中生成 4000 个任务包和 27164 条验证轨迹,并通过监督微调显著提升模型性能。研究还构建了 SkillEval 基准,验证了该方法在不同模型和代理框架中的有效性。
Hugging Face 每日论文介绍了 UEmbed,一种仅解码器的多模态嵌入模型,能在一次因果前向传播中同时生成稀疏词级和稠密表示。UEmbed 通过添加可学习特殊标记并将词汇表划分为不相交子集来实现稀疏预测,发布了 2B、4B 和 9B 三种规模,其中 9B 模型在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏)的分数,优于现有公开数据训
本文提出视觉归因蒸馏(VAD),一种用于多模态同策略蒸馏的反事实目标重建算法,通过评估教师模型在有/无视觉证据时的输出差异,估计纠正信号中由视觉证据支持的部分。在4B和9B规模的六个细粒度视觉基准上,VAD优于直接特权视图蒸馏和视觉优势加权方法。结果表明,反事实目标重建是源混合监督的有效替代方案。
llama.cpp 发布 b10250 版本,主要新增了模型解析测试,通过模拟 Hugging Face 仓库列表和本地 HTTP 服务器,端到端验证了模型解析、分片、mmproj、sidecar 等功能的正确性。同时引入了可移植的环境变量辅助函数和 HTTP 客户端封装,并修复了 Windows 和 TLS 构建下的兼容性问题。
Hugging Face 上发布了 Qwopus3.6-27B-Coder 的 NVFP4 量化版本,该模型基于 Jackrong/Qwopus3.6-27B-Coder,采用 W4A4 量化,大小约 18GB,相比 bf16 原始模型减少约 33%,在 wikitext-2 上困惑度为 6.63,支持 256K 上下文,专为 NVIDIA Blackwel
Hugging Face 博客介绍了 Bekko Embedding,两个多语言检索模型 bekko-embedding-v1-a8m 和 a25m,分别仅有 7.67M 和 24.93M 活跃参数,在 MMTEB Multilingual v2 的 18 个检索任务上平均分达 56.2 和 57.5,超越多语言 e5 和 BGE-M3。模型通过剪枝 mmB
这项研究提出了一种名为“宪法式中期训练”的LLM对齐方法,在中期训练阶段插入基于Anthropic宪法的原则性内容,以提升对齐的持久性。在120B参数规模下,使用394M token的语料库进行实验,结果显示该方法在泛化和持久性上优于对照组,尤其在黑mail场景中,经过良性微调后仍能降低17.5个百分点的倾向,且不损害MMLU等能力。研究还发现,内容的存在比
DesignArena 的开发商 Intelligence 宣布获得 790 万美元种子轮融资,由 Index Ventures 领投。该平台通过众包人类反馈来评估 AI 生成内容,目前拥有 530 万用户,年经常性收入达 6000 万美元。其创始人表示,人类反馈是 AI 模型在设计领域改进的关键瓶颈,该平台已成为前沿实验室的重要数据来源。
Hugging Face 上发布了名为 ModernGuard-1 的新模型,由用户 guardion 上传。该模型支持超过 1000 种语言,包括多种小语种和方言,旨在提供广泛的语言覆盖能力。模型的具体架构和用途尚未在正文中详细说明,但其多语言特性可能对自然语言处理领域有重要影响。
Hugging Face 上发布了 whisper-tiny 模型,专为 React Native ExecuTorch 库设计,提供 XNNPACK、CoreML 和 MLX 后端的 .pte 格式导出。模型使用 ExecuTorch v1.2.0 导出,不保证向前兼容,用户需确保运行时版本匹配。该模型可用于自动语音识别任务。
该论文提出了一种名为“能力维持情感对话”(CSED)的纵向研究范式,旨在超越传统情感对话中仅关注即时情绪缓解的目标,强调在交互生命周期中维持用户的情绪调节、应对、自主决策和社交连接能力。通过对60篇系统构建论文和300个ESConv支持者回合的审计,发现当前研究几乎不评估能力或纵向结果,且存在过度依赖通用建议的问题。作者发布了扩展审计协议,并提出了一个连接潜
SAF-OPD 提出了一种稳定优势融合框架,用于结合强化学习(RLVR)和在线蒸馏(OPD)训练。该框架通过四阶段流程(稀疏化、压缩、预热、退火)解决固定系数融合导致的熵崩溃问题,在七个数学推理和代码生成基准上,使用 Qwen3-1.7B/4B/8B 模型,将聚合分数提升了 0.51-2.70%,并实现了更稳定的训练。
商汤科技发布了SenseNova U1.5-Lite-Preview,这是基于NEO-Unify架构的原生统一多模态模型的预览版本,以8B-MoT轻量级规模支持4K图像生成、精细编辑和复杂视觉指令遵循。该模型在多个评测基准上显著超越前代U1,并已开源至GitHub、Hugging Face和魔搭社区。商汤表示,U1.5验证了统一架构能力的可持续扩展,并计划近
另有 1 家信源报道