SWE-Bench ProMax:多语言大规模代码重构基准
Hugging Face 发布 SWE-Bench ProMax,一个由专家策划的多语言代码重构基准,包含 170 个实例,覆盖七种编程语言。该基准通过重写问题描述和人工审查测试套件,解决了现有基准中测试缺陷和训练数据泄漏的问题。实验显示,前沿模型在两种代理框架下的最佳解决率仅为 41.2%,表明该基准对当前 AI 编码代理构成有意义的挑战。基准已在 Hug
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 04:44
Hugging Face 发布 SWE-Bench ProMax,一个由专家策划的多语言代码重构基准,包含 170 个实例,覆盖七种编程语言。该基准通过重写问题描述和人工审查测试套件,解决了现有基准中测试缺陷和训练数据泄漏的问题。实验显示,前沿模型在两种代理框架下的最佳解决率仅为 41.2%,表明该基准对当前 AI 编码代理构成有意义的挑战。基准已在 Hug
Hugging Face 与 EleutherAI 合作发起 FineBooks 项目,在超过 2000 页历史书籍上测试了 14 个开源 OCR 模型,发现小模型表现优于大模型,最佳模型字符准确率超 97%,成本低于每千页 2 美元。研究认为这些模型足以用于 AI 训练数据,但尚不适合学术用途。团队计划用顶级模型重新处理约 20 万份 BHL 文档并开放数
Hugging Face 与 EleutherAI 合作推出 FineBooks 项目,旨在评估开源 OCR 模型在处理历史文献上的表现,并重新处理公共领域书籍以提升 AI 训练数据质量。项目发布了包含 14 个模型的 BHL OCR 排行榜、基准数据集和评估工具,基于 2165 页专家转录的历史书籍页面进行测试。初步结果显示,现代 VLM 模型在历史文档上
另有 1 家信源报道
Hugging Face 团队在收到社区关于阿拉伯语 TTS Arena 排行榜与用户体验不符的反馈后展开调查。他们最初怀疑存在刷榜行为,但通过逐条听取投票音频和检查提示词,发现异常投票其实是用户使用海湾方言进行真实评测的结果。进一步分析表明,不同阿拉伯语方言下最佳模型各不相同,单一排行榜掩盖了这种差异。最终,团队保留了所有投票,并为排行榜增加了方言筛选功能
Hugging Face Transformers 发布 v5.15.0 版本,新增多个模型支持,包括 Meta 的 Muse Glimmer(30B 参数多模态模型,专为智能体场景设计,Apache 2.0 许可)、IBM 的 GraniteSWA/GraniteMoeSWA、SKT 的 A.X-K1/K2 和 Cosmos3 Edge。该版本还包含多项破
Hugging Face 团队发表论文,提出两种系统优化方法:离线缓存教师模型的 Top-K logits,以及融合分块 KL 损失,以大幅降低大语言模型知识蒸馏的显存占用和训练成本。该方法使长上下文蒸馏可在单 GPU 上运行,并支持大规模实验。
Hugging Face 博客发布了一篇技术文章,介绍了一个名为 dinghy-law 的 0.6B 参数法律嵌入模型,在 MTEB(Law) 基准上排名第二,超越了更大的模型。文章详细描述了在时间和计算资源有限的情况下,通过 LoRA 微调、基于梯度对齐的硬负样本挖掘、数据读取和权重空间合并等技术,实现了高性能。该模型基于 Qwen3-Embedding-
Hugging Face 博客文章深入解析了 Transformer 模型中张量维度的处理,特别是解码器架构中的矩阵乘法、多头注意力机制和维度变换。文章通过具体示例说明了输入张量如何经过嵌入、注意力、前馈网络等层保持形状不变,并解释了掩码注意力在自回归生成中的作用。该文旨在帮助读者掌握生成式 AI 模型中的张量操作基础。
Hugging Face 博客发布了一篇技术文章,介绍如何通过分析公开的模型配置文件(config.json)、分词器(tokenizer)和权重(embedding CKA)来客观判断一个大型语言模型是从零训练还是基于开源基础模型衍生而来。文章指出,架构指纹和分词器重叠是主要证据,而权重相似性因旋转不变性等原因不可靠。作者将该方法应用于韩国九个组织的公开基
Hugging Face 发布了 TutorMoments 框架预览,用于评估大语言模型在辅导学生时能否平衡提供帮助与让学生自主思考。该框架基于真实一对一数学辅导记录,由教师标注关键时刻,并通过模拟会话测试模型表现。研究发现模型倾向于过度帮助,而明确提示权衡可改善表现但仍不及人类教师。团队同时发布了去标识化数据集、代码和回放结果,以促进开放研究。
Hugging Face 发布了 Carbon-3B,一个 3B 参数的生成式 DNA 基础模型,专注于真核生物,支持 32,768 个 6-mer 令牌(约 197k 碱基对)的上下文,并可扩展至 65,536 令牌。该模型在序列恢复、变异效应预测和基序扰动任务上可与 Evo2-7B 竞争,同时推理速度更快。Carbon 系列还包括 Carbon-8B 和
Hugging Face 发布了 W2-VLA 模型,该模型通过任务条件化的未来手腕建模来提升精细机器人操作能力。W2-VLA 利用潜在建模令牌作为视觉语言模型与手腕预测器之间的接口,并引入 W2-CoT 合成管道生成结构化注释以辅助训练。实验表明,在 LIBERO、RoboTwin 2.0 和真实世界任务中,该模型在单臂和双臂场景下均取得了改进,动作生成速
Hugging Face 发布了 Optimum Intel v2.1.0,新增了对多个模型架构的导出和推理支持,包括 Google 的 Gemma 3n 和 Gemma 4 Unified、阿里巴巴的 Qwen3-Omni-MoE 和 Qwen3-VL-Embedding、SmolLM3 以及 Black Forest Labs 的 FLUX.2。该版本通
Hugging Face 宣布 Baseten 成为其推理提供商生态的新成员,用户可在 Hub 模型页面和 SDK 中直接使用 Baseten 托管的模型。Baseten 支持多种模型类型,初期提供对话和文本生成任务,包括 Kimi K3、DeepSeek V4 Flash 等。用户可通过自定义 API 密钥直接调用,或通过 Hugging Face 路由计
Hugging Face 与 ARTPARK-IISc 联合发布 Vaani-LID v0,这是一个开源语音语言分类器,可识别印度 42 种语言,覆盖四个语系。该模型基于 Vaani 语料库预训练的 FastConformer 编码器,在冻结状态下跨域表现优于微调的 Whisper,并采用分层 softmax 提升泛化能力。研究还发现,对预训练编码器进行微调
Hugging Face 博客介绍了如何使用 TRL 和 OpenEnv 在远程 HF 沙箱中训练编码代理。文章通过 OpenCode 代理示例,展示了利用 AsyncGRPO 算法对代理产生的真实 token 进行训练,并实现每个 rollout 在独立远程沙箱中运行以扩展规模。该架构通过透明代理捕获 token,使用隐藏测试作为奖励,并支持在 Huggi
Hugging Face 博客发布了一篇关于物理 AI 模拟现状的综述,指出数据稀缺是物理 AI 发展的主要挑战,而仿真通过 GPU 并行可低成本生成大量训练数据。文章介绍了训练、仿真和机载三计算机范式,并概述了 MuJoCo、MuJoCo Warp、NVIDIA Isaac Sim 和 Isaac Lab 等主流仿真引擎的特点与适用场景。该综述旨在帮助开发
Hugging Face 博客发布了一篇关于 KV 缓存的教程,解释了该技术如何通过存储注意力层的键值对来避免重复计算,从而加速 Transformer 模型的文本生成。文章提供了 PyTorch 伪代码和 transformers 库的使用示例,并展示了在 T4 GPU 上使用 KV 缓存可获得约 5.21 倍的加速。该技术对于长文本生成尤为重要,能显著提
Hugging Face 团队发布了用于自动背景移除的最先进模型 FeyNoBg,在八个基准测试中,四项取得最佳 S-measure,其余四项与领先者差距在 2% 以内。同时开源了训练库 NoBg,支持运行 FeyNoBg 或训练自定义模型。该模型基于 BiRefNet 架构,通过扩展特征提取器第三阶段并混合多数据集训练,提升了前景识别和边界精度。
NVIDIA与Hugging Face合作,推出NVIDIA NeMo Automodel开源库,支持对Diffusers格式的扩散模型进行分布式微调,无需转换检查点或重写模型。该库支持流匹配模型,提供全参数和LoRA微调,并支持FSDP2、张量并行等多种并行策略,可扩展至数百GPU。已为Wan 2.1、FLUX.1-dev、HunyuanVideo等模型提