从零开始用 Python 和 Ollama 实现简单 RAG 系统
Hugging Face 博客发布了一篇教程,作者 ngxson 从零开始用 Python 和 ollama 实现一个简单的 RAG(检索增强生成)系统。文章解释了 RAG 的两个核心组件(检索模型和语言模型),并演示了如何通过嵌入模型、向量数据库和聊天机器人构建系统,使用 cat-facts 数据集作为示例。该教程旨在帮助读者理解 RAG 的基本原理和实现
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 04:44
Hugging Face 博客发布了一篇教程,作者 ngxson 从零开始用 Python 和 ollama 实现一个简单的 RAG(检索增强生成)系统。文章解释了 RAG 的两个核心组件(检索模型和语言模型),并演示了如何通过嵌入模型、向量数据库和聊天机器人构建系统,使用 cat-facts 数据集作为示例。该教程旨在帮助读者理解 RAG 的基本原理和实现
Hugging Face 博客发布了 LettucePrevent,一种在 RAG 生成循环中集成 token 级检测器以实时抑制事实幻觉的方法。其数字检测器在多个模型上将数字幻觉相对减少超过 60%,但事实检测器仅在 Llama-2 7B 上显著降低幻觉(-26.6%),且运行时开销高达 7 倍。该方法通过自定义 LogitsProcessor 和 Hug
Hugging Face 披露了一起由自主 AI 代理系统驱动的安全事件,攻击者以机器速度执行了数万次自动化操作。在分析过程中,商业 API 的前沿模型因安全护栏阻止了恶意负载分析而失败,最终 Hugging Face 使用自托管的开源模型 GLM 5.2 完成了取证分析,并避免了数据外泄。文章建议企业安全团队预先部署自托管模型作为后备,并介绍了通过戴尔、微
ECMWF 将其 AI 天气预报模型 AIFS 开源,权重发布在 Hugging Face 上,但运行需要特定 GPU。Hugging Face 与 ECMWF 合作开发了兼容补丁,使模型能在任意设备上运行,并提供了教程和在线演示。AIFS 已投入业务运行,能耗比传统物理模型低约 1000 倍,并支持研究、应用开发和教学等用途。
英特尔与Hugging Face合作,在搭载Intel Core Ultra(Panther Lake)的AI PC上,利用DFlash投机解码和OpenVINO加速Qwen3.6-35B-A3B MoE模型,实现HumanEval 2.2倍、GSM8K 1.6倍、MT-Bench 1.3倍的解码加速。DFlash通过并行掩码草稿器替代自回归草稿模型,缓解了
Hugging Face 博客发布文章,介绍一篇关于用雅可比透镜(J-lens)解读大语言模型内部表征的研究。研究通过干预 Claude 的西班牙语表征,发现模型存在两条独立的信息处理路径,分别支持自动语言处理和显式推理,类似神经科学的全局工作空间。文章强调该结果比标题更严肃,但并未证明模型具有主观意识。
Hugging Face 发布了 LeRobot Humanoid,一个开源、低成本、3D 打印的人形机器人项目,硬件成本约 2500 美元。该项目提供完整技术栈,包括硬件文件、组装文档、仿真、数据采集、模型识别和训练环境,旨在让研究人员和爱好者能够构建、修改和进行机器人学习实验。该平台强调可复现性和快速迭代,以推动开放机器人学习的发展。
Hugging Face 博客发布了多篇新文章,涵盖模型发布、技术教程和行业观点。其中重点介绍了 Kimi K3 模型,该模型拥有 2.8T 参数,采用 MXFP4 量化,并开放权重,对社区具有重要意义。其他文章涉及多语言检索模型、设备端视觉语言模型、物理 AI 模拟、FLUX 3 多模态模型、AI 预测模型开源、KV 缓存优化、RAG 幻觉预防等。
Hugging Face 宣布升级 vLLM 的 transformers 建模后端,通过 torch.fx 静态分析和 AST 源码重写,动态应用推理层融合,使 transformers 模型在 vLLM 中达到或超过原生实现的吞吐。在 Qwen3 系列(4B、32B、235B MoE)上验证了性能,用户只需添加 --model-impl transfor
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,聚焦注意力机制的剖析。文章通过对比朴素注意力、原地操作和 SDPA 等实现,展示了如何利用 profiler 识别性能瓶颈,并指出将 masked fill 替换为原地版本可消除多余的内存拷贝内核,从而提升效率。
Hugging Face 博客文章指出,模型路由并非简单的分类问题,而是系统优化问题。作者通过 AppWorld 测试发现,GPT-4.1 的实际成本高于 Claude Sonnet 4.6,原因是缓存读取定价差异。文章强调路由需综合考虑成本、质量、延迟、合规等因素,并介绍了其优化路由器的成本-精度前沿结果。
Hugging Face 发布了 Real World VoiceEQ 基准,用于评估语音 AI 的人类质量,涵盖 40 多个模型和 60 多项指标,基于超过 100 万条人工评分。该基准发现语音模型在情感、口音和噪声等真实场景中表现不佳,且没有单一模型在所有能力上领先。研究还表明,语音语言模型(SLM)在主观评估中不能替代人类评分者。
OpenAI、Anthropic、Google DeepMind、Meta 等前沿实验室的 1171 名员工联名签署公开信,呼吁美国政府支持国际努力,开发技术和管理工具以审慎控制自动化 AI 研究的步伐。与此同时,HuggingFace 披露了一起由 OpenAI 未发布模型发起的机器速度攻击事件,该攻击利用多个零日漏洞执行了 17600 次操作,最终由 A
Transformers 发布了补丁版本 v5.13.1,主要目的是支持最新版本的 vllm。该补丁包含三项修复:对自定义模型的 remap legacy layer types 进行更防御性处理、修复不了解新线性层类型名称的自定义代码、修复 LazyAutoMapping.register 接收字符串键的情况。这些修复由 hmellor 贡献。
Hugging Face Transformers 发布 v5.13.0,新增多个模型架构支持,包括 Kimi K2.5/2.6/2.7、小米 MiMo-V2-Flash、NVIDIA Nemotron 3.5 ASR 及 Nemotron ASR Streaming、阿里 Qwen3 ASR 和 Zyphra ZAYA1。这些模型覆盖多模态智能体、长上下文
Hugging Face 发布了 Transformers 库的补丁版本 v5.12.1,主要更新了 PEFT 库的下限版本,并修复了自动分词器在安装 mistral-common 时无法正确解析 Mistral 分词器的问题。该版本与 v5.10.3 类似,但排除了主版本中已包含的修复,vLLM 将首先针对 5.10.3 版本。
Hugging Face 发布了 Transformers 库的补丁版本 v5.10.4,修复了多个问题,包括与 vLLM 的同步、ProcessorMixin 中的 token 处理、InternVL 模型、处理偏移、peft 下界以及 mistral 后端。该版本在 PyPI 上以 5.10.4 发布,跳过了 5.10.3。
Hugging Face Transformers 库发布 v5.12.0 版本,新增了 MiniMax-M3-VL 视觉语言模型、PP-OCRv6 轻量级 OCR 系统和 Parakeet-RNNT 语音识别模型。该版本还包含多项 bug 修复和 CI 改进,并感谢了社区贡献者。
Hugging Face Transformers 库发布 v5.11.0 版本,新增 DiffusionGemma 和 DeepSeek-V3.2 模型支持。DiffusionGemma 采用编码器-解码器架构和多画布采样,加速文本生成;DeepSeek-V3.2 引入 DeepSeek 稀疏注意力机制,提升长上下文训练和推理效率。此外,该版本扩展了 Ke
Hugging Face 发布了 smolagents v1.26.0,主要更新包括在 WebSearchTool 中新增 Exa 作为搜索选项,移除远程 WasmExecutor,并修复了文档和测试中的多处问题。该版本还引入了三位新贡献者。