Hugging Face 博客新文章:Kimi K3 等模型发布与技术教程
Hugging Face 博客发布了多篇新文章,涵盖模型发布、技术教程和行业观点。其中重点介绍了 Kimi K3 模型,该模型拥有 2.8T 参数,采用 MXFP4 量化,并开放权重,对社区具有重要意义。其他文章涉及多语言检索模型、设备端视觉语言模型、物理 AI 模拟、FLUX 3 多模态模型、AI 预测模型开源、KV 缓存优化、RAG 幻觉预防等。
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
Hugging Face 博客发布了多篇新文章,涵盖模型发布、技术教程和行业观点。其中重点介绍了 Kimi K3 模型,该模型拥有 2.8T 参数,采用 MXFP4 量化,并开放权重,对社区具有重要意义。其他文章涉及多语言检索模型、设备端视觉语言模型、物理 AI 模拟、FLUX 3 多模态模型、AI 预测模型开源、KV 缓存优化、RAG 幻觉预防等。
Ollama 发布 v0.31.2 版本,主要更新包括:在旧款 NVIDIA GPU(计算能力 6.x)上启用 flash attention,iGPU 可卸载视觉模型以适配内存,修复了思考模型禁用思考时的结构化输出问题,并强化了 GGUF 模型创建。此外, ollama launch 为 Claude Code 默认禁用遥测,修复了非 UTF-8 路径加载
Hugging Face Transformers 发布 v5.13.0,新增多个模型架构支持,包括 Kimi K2.5/2.6/2.7、小米 MiMo-V2-Flash、NVIDIA Nemotron 3.5 ASR 及 Nemotron ASR Streaming、阿里 Qwen3 ASR 和 Zyphra ZAYA1。这些模型覆盖多模态智能体、长上下文
Interconnects AI 的最新开源模型报告指出,开源生态系统正变得更加多元化,参与者包括纯模型制造商、大科技公司和产品公司。报告重点推荐了 NVIDIA 的 Nemotron 系列、Cohere 的 Command A+、GLM-5.2、Zyphra 的 ZAYA1 和 Poolside 的 Laguna-M.1 等模型,并讨论了开源模型发布的动机
本文是一篇关于使用开源工具和开放权重模型搭建本地编码代理的教程,作者介绍了如何用本地LLM和编码框架替代Claude Code和Codex订阅服务。文章强调了本地方案在成本、隐私、可定制性方面的优势,并主要使用Qwen3.6模型和Qwen-Code框架,同时提及了其他框架如Claude Code、Codex和Cline。作者还引用了Nvidia的Polar论
Google DeepMind 发布了实验性开放模型 DiffusionGemma,采用文本扩散技术,可在 GPU 上实现高达 4 倍的文本生成加速。该 26B MoE 模型激活参数仅 3.8B,支持双向注意力,适合本地低并发推理场景,但输出质量低于标准 Gemma 4。模型权重以 Apache 2.0 许可在 Hugging Face 上提供,并支持 vL
Google DeepMind 宣布扩展其内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud 平台。其 SynthID 水印技术已应用于超过 1000 亿张图片和视频及 6 万小时音频,并新增 C2PA Content Credentials 验证功能。公司还推出了新的 AI 内容检测 API,并与 OpenAI
vLLM 发布 v0.21.0 版本,包含 367 个提交,来自 202 位贡献者。该版本正式弃用 transformers v4,要求 C++20 编译器,并引入 KV 卸载与混合内存分配器集成、推理预算感知的投机解码、Blackwell 上的 TOKENSPEED MLA 后端等新特性。同时新增多种模型架构支持,并在性能、硬件支持(如 AMD ROCm、
Chip Huyen 分析了 900 个最受欢迎的开源 AI 工具,发现 AI 技术栈分为基础设施、模型开发和应用开发三层,其中应用开发层在 2023 年增长最快。她指出,应用开发中的 AI 工程领域(如提示工程、AI 接口、代理框架)成为热点,而模型开发层的增长主要来自推理优化。此外,她观察到中国开源生态与西方存在显著差异,且 2023 年 9 月后新工具