Google ADK JS v1.3.0 发布:新增技能注册表与 Gemini 3.x 支持
Google 发布了 ADK JavaScript 库的 v1.3.0 版本,新增了 --reload agents 标志以监视代理文件变化,支持 Gemini 2.5 和 3.x Live 模型,并引入了技能注册表核心接口、远程 GCP 技能注册表集成以及 OpenAPI REST API 工具实现。此外,该版本还修复了多个 bug,包括流式传输中的原型污
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 703 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google 发布了 ADK JavaScript 库的 v1.3.0 版本,新增了 --reload agents 标志以监视代理文件变化,支持 Gemini 2.5 和 3.x Live 模型,并引入了技能注册表核心接口、远程 GCP 技能注册表集成以及 OpenAPI REST API 工具实现。此外,该版本还修复了多个 bug,包括流式传输中的原型污
Z.ai 于 2026 年 6 月发布了开源模型 GLM-5.2,该模型在编码代理任务中表现出色,被社区视为开源代理的转折点。其性能在多个基准测试中与 OpenAI 和 Anthropic 的闭源模型相当,甚至超越,引发了广泛关注。作者认为 GLM-5.2 缩小了开源与闭源模型的能力差距,并可能对 Anthropic 等闭源实验室构成竞争压力。
Interconnects AI 联合创始人 Kevin Xu 发表评论文章,反对美国监管或禁止开源 AI,认为开源软件安全、促进教育、创新和竞争,并警告限制开源将产生反效果。文章指出 Anthropic 和 OpenAI 的闭源模型导致权力集中,而开源模型是重要制衡力量。
Interconnects AI 博客作者在 2026 年中回顾其职业转型,宣布将保持独立写作风格,并披露与 Arcee AI 和 Mercor 的顾问协议,以支持其开放模型生态和透明评估的目标。博客已拥有 7 万订阅者,但财务上仍依赖外部工作,作者计划继续在非营利领域工作,并优化博客的财务增长。
Google DeepMind 发布了实验性开放模型 DiffusionGemma,采用文本扩散技术,可在 GPU 上实现高达 4 倍的文本生成加速。该 26B MoE 模型激活参数仅 3.8B,支持双向注意力,适合本地低并发推理场景,但输出质量低于标准 Gemma 4。模型权重以 Apache 2.0 许可在 Hugging Face 上提供,并支持 vL
Google DeepMind 发布了 Gemma 4 12B,这是一款面向笔记本电脑的无编码器多模态模型,支持原生音频输入,性能接近其 26B MoE 模型,但内存占用更小。该模型采用统一架构,视觉和音频输入直接进入 LLM 主干,无需传统编码器,并支持多 token 预测以降低延迟。模型以 Apache 2.0 许可开源,可在 16GB 内存的设备上本地
vLLM 发布 v0.22.0 版本,包含 459 个提交,来自 230 位贡献者。该版本重点提升了 DeepSeek V4 的成熟度,包括新增 NVFP4 融合 MoE 支持、CUDA 图优化和 MTP 投机解码。同时,Model Runner V2 成为 Qwen3 稠密模型的默认选项,并引入了实验性的 Rust 前端。性能方面,批量不变推理通过 Cut
Hugging Face 发布 smolagents v1.25.0,修复了远程执行器的高危漏洞,并移除对旧版无前缀 pickle 的支持,默认禁用 pickle 以增强安全性。该版本还重构了反序列化逻辑,改用注册表模式,并新增 MLflow 集成文档。
作者分享了理解开源大语言模型架构的工作流程,强调从官方技术报告入手,但指出当前论文细节不足,因此建议直接检查 Hugging Face 上的配置文件和 transformers 库中的参考实现。该流程主要适用于开源权重模型,不适用于闭源模型如 ChatGPT。作者认为手动分析架构是学习的最佳方式,尽管部分过程可以自动化。
本文回顾了2026年1月至2月期间发布的10个开源权重LLM,重点比较了它们的架构异同。主要发布包括Arcee AI的Trinity Large、Moonshot AI的Kimi K2.5、StepFun Step 3.5 Flash、Qwen3-Coder-Next、z.AI的GLM-5、MiniMax M2.5、Nanbeige 4.1 3B、Qwen
Google DeepMind 发布 2025 年度回顾,总结其在 AI 和量子计算领域的研究突破。2025 年,Google 发布了 Gemini 2.5、Gemini 3 和 Gemini 3 Flash 等模型,提升了推理和多模态能力,并推出 Nano Banana、Veo 3.1 等生成式媒体工具。同时,Google 通过 Gemini 应用、Not
Google DeepMind 发布了 Gemma Scope 2,这是一套面向 Gemma 3 全系列模型(270M 至 27B 参数)的开源可解释性工具,旨在帮助 AI 安全社区深入理解复杂语言模型的内部行为。该工具集包含稀疏自编码器和转码器,并采用 Matryoshka 训练技术,支持对越狱、拒绝机制和思维链忠实性等行为进行分析。据称这是 AI 实验室
Hugging Face 发布了 smolagents v1.23.0,新增了对话模式 CLI、Blaxel 远程代码执行支持、指数退避重试、自定义 Python 执行器等功能,并修复了多个 bug。该版本还改进了文档翻译,并将默认推理模型改为 Qwen3-Next-80B-A3B-Thinking。
Moonshot AI 发布了 Kimi K2,这是一个具有 1 万亿总参数和 320 亿激活参数的混合专家(MoE)语言模型,专注于智能体能力。该模型在多个基准测试中表现出色,尤其在编码任务上,并提供了基础版和指令版两种变体。Kimi K2 采用 Muon 优化器进行训练,支持 128K 上下文长度,并已在 Hugging Face 上开源。
Google DeepMind 宣布推出 MedGemma 系列中的两个新开放模型:MedGemma 27B 多模态模型和 MedSigLIP 图像编码器。这些模型旨在支持医疗 AI 开发,可处理文本和图像输入,并能在单 GPU 上运行。它们基于 Gemma 3 构建,并经过医学数据优化,同时保留通用能力。开发者可下载、微调并部署到 Vertex AI,已有
Google DeepMind 正式发布 Gemma 3n,这是一款面向移动端和边缘设备的开源多模态模型,基于 MatFormer 架构,支持弹性推理和自定义模型尺寸。该模型引入了 Per-Layer Embeddings 和 KV Cache Sharing 等技术,以提升设备端性能和长输入处理效率。Gemma 3n 支持多种开发工具,并提供了预提取模型和
Hugging Face 发布了 smolagents v1.22.0,包含多项改进和修复。主要更新包括支持自定义 Dockerfile、MCP 结构化输出、Modal 远程执行器,以及修复 GPT-5 和 Grok 模型不支持 stop 参数的问题。此外,还改进了文档翻译和 CI 流程。
Chip Huyen 分析了 900 个最受欢迎的开源 AI 工具,发现 AI 技术栈分为基础设施、模型开发和应用开发三层,其中应用开发层在 2023 年增长最快。她指出,应用开发中的 AI 工程领域(如提示工程、AI 接口、代理框架)成为热点,而模型开发层的增长主要来自推理优化。此外,她观察到中国开源生态与西方存在显著差异,且 2023 年 9 月后新工具