Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流
原标题:Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA
AI 摘要
Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090、DGX Spark、DGX Station 和 Jetson,并支持通过 NIM 容器、SGLang、vLLM 等推理栈进行部署和微调。
正文节选
Meta returns to the open source ecosystem with the release of Muse Glimmer, a 30B open-weight dense model with a 120K+ context window built for local AI agentic work. Optimized to run across a range of NVIDIA edge, desktop, and workstation AI platforms, Muse Glimmer delivers 20K tokens/sec on a single GPU, enabling always-on agents to process data locally and execute complex, multi-step workflows. Most LLMs are optimized for chat, prioritizing single-turn interactions and fast time to first toke