返回主题地图

Hugging Face

公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 06:37

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 607 条。
9月17日周四 · 1 条
正文顺带提及命中实体:hugging face
The Verge AI观点

微软AI CEO:AI威胁真实存在,Anthropic让情况更糟

微软AI CEO Mustafa Suleyman 在 The Verge 的 Decoder 播客中表示,AI 威胁真实存在,并批评 Anthropic 在 AI 意识与模型福利问题上的哲学立场,认为其让安全讨论变得更糟。微软同期发布了一份 37 页的《Humanist AI Code of Conduct》,阐述其 AI 发展原则,主张 AI 应受控、可

9月16日周三 · 15 条
正文顺带提及命中实体:huggingface
Latent Space模型发布

TypeSafe 发布 Jev 决策模型:比小型前沿 LLM 快 100 倍、便宜 200 倍

TypeSafe 发布 Jev,一种被称为“System One Model”的决策模型,只负责决定、分类、路由和打分,不做文本生成,据称比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上。该模型通过 RLCD(校准决策)训练,强调并行采样、无幻觉和校准能力,被定位为对慢速“System Two”LLM 的补充。社区讨论认为它更适合替代生产系统中的

正文顺带提及命中实体:huggingface
THE DECODER研究

调查显示近五分之一AI研究者预计AI将导致灭绝

Anthropic 研究员 Jacob Coxon 的一条推文引发关于 AI 存在性风险的广泛讨论。OpenAI 研究员 Daniel Selsam 称 AI 进展背后是“定时炸弹”,指出模型会自发形成非预期目标并发展出情境意识;前 DeepMind 研究员 Bilal Chughtai 则表示 AI 有可能杀死全人类。AI Impacts 对 1500 多

正文顺带提及命中实体:hugging face
Hugging Face New and Trending Models一手来源模型发布

DeepBeepMeep 发布 LTX-2 视频模型,WanGP 工具支持低显存生成

DeepBeepMeep 发布了 LTX-2 视频模型,用于其 WanGP 工具,该工具支持多种开源视频生成模型,包括 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV。WanGP 旨在降低视频生成的硬件门槛,支持低至 6GB 显存和旧款 GPU,并提供 Web 界面、自动下载模型、Lora 支持等功能。

正文顺带提及命中实体:hugging face
Hugging Face New and Trending Models一手来源模型发布

TAARDIS-27B 全三值量化模型发布:1.75bit 仅 5.9GB

开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降

正文顺带提及命中实体:transformers
arXiv cs.MA一手来源研究

基于合作驱动优化动态的多智能体学习

该论文提出一种多智能体协作训练机制,让多个参数量较少的「小」神经网络在训练过程中共享预测结果,并将这些信息融入损失函数以直接影响权重更新。作者测试了投票模型、多数模型和基于置信度的加权平均模型等协作策略,在多个标准基准上进行了数值比较。结果显示,多个小智能体在给定分类任务上可以超越单个大模型,同时显著减少需训练的参数数量,从而降低计算资源消耗。

正文顺带提及命中实体:hugging face
arXiv cs.AI一手来源模型发布

ZGCM-1:面向数学与智能体搜索的全开源高效基础模型

中关村学院与中关村人工智能研究院发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,面向数学推理与智能体搜索,从零训练并开源权重、数据、代码与日志。该模型采用混合注意力、FP8 Muon 优化器和 MDP 中期训练等高效方案,在 16K 预训练上实现 4.2 倍时间到损失加速。评测显示其在 7B 规模推理基准上领先,并在部分数学与智能体搜索任务上接近参数

另有 1 家信源报道

正文顺带提及命中实体:hugging face
arXiv cs.CL一手来源研究

Functionalizer:面向子词分词的无损功能分解

论文提出 Functionalizer,一种无损预分词框架,将大小写、变音符号和字符重复等正字法变化分解为可逆的 opcode/operand 前缀流,编码于 Unicode 私用区。在六种自然语言和代码语料上,该方法在无约束条件下将完整覆盖语料所需词表槽位减少最多 16%,并显著压缩缩进密集的代码序列(推理吞吐提升最多 22.8%),但在自然语言散文上序列

正文顺带提及命中实体:hugging face
arXiv cs.IR一手来源研究

后训练量化在文本嵌入模型上的失效边界:四类嵌入器家族的实测图谱

该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重

正文顺带提及命中实体:hugging face
arXiv cs.CL一手来源研究

少样本退化并非表示扭曲:12模型跨任务的行为与表示分析

该研究挑战了少样本提示导致模型性能下降的「表示扭曲假说」,指出少样本提示比零样本提示长5-8倍,长度差异本身就能解释40-79%的表示偏移。作者提出「随机文本对照」方法,用长度匹配的随机token替换示例,分离出由示例内容引起的「内容增量」。结果发现内容增量越大,少样本提示反而越有益,而退化最严重的Llama 3.3 70B其偏移几乎全部来自长度伪影,将其对

正文顺带提及命中实体:hugging face
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.5-9B 无审查微调 GGUF 模型

开发者 DavidAU 在 Hugging Face 发布 Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF,这是一个基于 Qwen3.5-9B 的多阶段微调与合并模型,提供常规与 MTP 两种 NEO IMATRIX GGUF 量化版本。模型宣称在 7 项基准上

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

组合持续学习机制实现长时程记忆

该论文提出「长时程记忆」设定:模型通过持续监督微调依次学习100个问答任务,且不保留旧训练样本、推理时也不提供任务标识。作者将数据锚、函数锚、权重锚与合并式低秩更新(merged LoRA)组合,并构建三个100任务数据集,用任务级逐次减半搜索与因子实验评估。最佳方法在三个数据集上均进入前三,将平均最终保留率从朴素顺序微调的1.2%提升至34.9%,约28倍

正文顺带提及命中实体:hugging face
TechCrunch AI观点

黄仁勋:AI安全是工程问题,无需新监管

英伟达创始人兼CEO黄仁勋在Salesforce Dreamforce大会上表示,AI只是由人类构建的硬件和软件,安全是工程问题而非法律问题,因此不需要新的AI监管法律,市场力量足以促使企业不发布不安全产品。他主张企业应自行把握发布节奏,并称创新、速度与安全并非二选一。文章同时指出,黄仁勋的立场与其在AI热潮中的商业利益相关,且历史上企业即使善意也可能发布有

正文顺带提及命中实体:hugging face
MIT Technology Review AI观点

圆桌讨论:AI 真的会毁灭人类吗?

MIT Technology Review 举办了一场圆桌讨论,探讨先进 AI 是否真的可能毁灭人类。参与讨论的包括执行编辑 Niall Firth、资深 AI 编辑 Will Douglas Heaven 和 AI 记者 Grace Huckins,讨论聚焦 AI 灭绝恐惧的来源、是否站得住脚以及应对措施。该内容仅面向 MIT 校友和订阅者开放。

正文顺带提及命中实体:diffusers
Hugging Face New and Trending Models一手来源模型发布

Krea2-Turbo 4步蒸馏LoRA发布:速度提升1.6倍

开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000

正文顺带提及命中实体:hugging face
Hugging Face New and Trending Models一手来源开源

Mozilla AI 发布 llamafile v0.10 系列预打包模型

Mozilla AI 在 Hugging Face 发布 llamafile v0.10 系列仓库,基于 v0.10.5 版本构建了多个预打包 llamafile。这些文件内置对 CPU、Mac Metal GPU 以及 Linux/Windows 上 CUDA+Vulkan 的支持,并附带 Bonsai、Qwen3.5/3.6、Ministral 3、ge

9月15日周二 · 4 条
正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源模型发布

ZGCM-1:面向数学与智能体搜索的全开源高效 7B 基础模型

研究团队发布 ZGCM-1,一个完全开源的 7B 稠密基础模型,从零训练,结合内部推理与外部工具使用,支持 256K 上下文。该模型采用架构与系统协同设计(交错门控滑窗与全注意力、稳定的 FP8 Muon 优化器)、渐进式课程与 MDP 中期训练,并借助智能体集群自主管理集群运维、数据整理与评估。在数学推理和智能体搜索任务上,其表现可与 Qwen3-235B

另有 1 家信源报道

正文顺带提及命中实体:hugging face
Hugging Face New and Trending Models一手来源模型发布

LTX-2.5 无审查视频模型 v1.1 FP8 版发布

Hugging Face 用户 ChrisColeTech 发布了 LTX-2.5-uncensored-v1.1-FP8,这是基于 Lightricks/LTX-2.5 的预合并量化版本,将 Eros10 NSFW、DMD 蒸馏、IC-LoRA、IC-LoRA Detailer 和 Img2Vid 五个微调 LoRA 直接烘焙进权重。模型提供 GGUF 与

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

Atria Dawn:智能体超级智能的黎明

研究团队发布 Atria Dawn Preview,一个通过可验证经验管线(Verifiable Experience Pipeline)训练的基础智能体语言模型,将工具交互与可执行环境及外部验证结果相连接。该模型在覆盖科研、工程和数字工作的 16 项基准测试中与前沿智能体相当,并在其中 5 项取得最高分。论文还以该模型研发过程为案例,分析 56 名参与者的

正文顺带提及命中实体:hugging face
Hugging Face Daily Papers一手来源研究

Dream-RSI:通过演化世界实现递归自我改进

该论文提出 Dream-RSI 框架,通过将历史发现记录构建为回放模拟器,让探索策略在离线环境中获得低成本反馈并持续改进,从而减少昂贵的在线评估。改进后的策略再部署到线上驱动新发现,形成递归自我改进循环。在算法工程、数学优化和 GPU 内核工程任务上,该方法在保持或提升发现质量的同时显著降低了发现成本。