MiniMax 发布全模态生成系统 H3,支持 2K 视频与原生音频
MiniMax 发布了通用全模态生成系统 MiniMax H3,支持文本、图像、视频和音频的统一理解,并能生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该系统包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式,并提供 API 和在线应用。
公司与模型 · MiniMax 的模型与产品动态:M 系列大模型、语音与多模态能力、开源与商业化 · 共 20 条
MiniMax 发布了通用全模态生成系统 MiniMax H3,支持文本、图像、视频和音频的统一理解,并能生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该系统包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式,并提供 API 和在线应用。
SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。
Hugging Face 上发布了 MiniMax H3 模型的 GGUF 量化版本(Abiray/MiniMax-H3-GGUF),该模型是 MiniMax 推出的全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该仓库提供了多种量化精度的 UNet 模型(FL2VA 和 Ref2VA 模
Hugging Face 上发布了 MiniMax-H3 的 GGUF 量化版本,用于 ComfyUI。MiniMax-H3 是一个多模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该模型提供多种变体,并支持通过 API 和在线应用使用。
MiniMax 发布了通用全模态生成系统 MiniMax-H3,支持文本、图像、音频和视频输入,可生成最长 15 秒的带音频视频。PipeNetwork 提供了将其移植到 MLX 的 Python 包,使模型能在 Apple Silicon 上运行。作者在 M5 Max MacBook Pro 上成功运行,下载约 115GB 模型文件,生成视频耗时近 45
realrebelai 在 Hugging Face 上发布了 MiniMax-H3 模型的 GGUF 量化版本,支持文本到视频生成,并提供了 ComfyUI 的目录结构。该模型基于 Comfy-Org/MiniMax-H3,包含 UNet、文本编码器和 VAE 组件,用户需从 Comfy-Org 获取 VAE 文件。发布者声称已获得 MiniMax 的许可
中国公司MiniMax发布了H3视频模型权重,成为首个在AI视频排名中登顶的开源模型。该模型拥有330亿参数,能处理文本、图像、视频和音频,生成4至15秒带立体声的片段。尽管2K分辨率模块和H3-Context-IR未开源,但开放权重允许微调,商业使用仅限年收入低于2000万美元的公司。同日,字节跳动发布了闭源的Seedance 2.5模型。
阿里巴巴发布了其最大、最强大的AI模型Qwen3.8-Max,声称性能可与Anthropic和OpenAI的顶级系统媲美。该模型拥有2.4万亿参数,在Arena.AI排行榜上仅次于Anthropic的Fable 5和Opus系列。阿里巴巴计划下周开放模型权重,标志着其回归开源策略,加剧了中美AI竞争。
Meta 发布 2026 年二季度财报,净利润暴跌 14%,自由现金流仅剩 7.84 亿美元,同时上调全年 AI 资本开支至 1350 亿-1450 亿美元,引发股价大跌。Meta 在 AI 上半场因 Llama 4 失败和产品融合不佳而落后,现正通过自研模型路由器、限制 Token 使用、筹建云业务等方式寻求 AI 变现。分析认为,AI 行业已从拼投入转向
Together AI 推出了 Provisioned Throughput 服务,为前沿开放模型提供预留推理容量,采用基于 token 的定价和 99% 可用性 SLA。该服务允许客户购买 PTU 单位,以固定速率保证吞吐量,成本比 Claude Opus 4.8 低 90%。目前支持 MiniMax M3 和 GLM-5.2,覆盖北美和 EMEA 地区。
Together AI 宣布成为 MiniMax M3 的首选云合作伙伴,将在其公开发布后托管该开放权重模型。Together AI 的推理和内核团队通过多项优化,如 KV-Block-Major 稀疏注意力内核、MSA 的分页注意力集成等,实现了 81-125% 的吞吐量提升。MiniMax M3 支持 1M 上下文窗口和原生多模态,其稀疏注意力机制显著加
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。
MiniMax 发布视频旗舰模型 H3,价格仅为 Seedance 2.0 的三分之一,并宣布即将开源,成为首个旗舰级开源视频模型。H3 支持文本、图片、音频、视频等多模态统一处理,具备全模态编辑、复杂文本保持和一站式成片能力,在 Artificial Analysis 视频编辑榜单中排名第一。开源旨在推动企业私有化部署和生态扩展,可能改变视频生成行业的竞争
OpenAI 宣布大幅下调 GPT-5.6 系列模型价格,其中 Luna 降价 80%,Terra 降价 20%,并推出延迟降低 2.5 倍的 Sol Fast 模式。降价得益于 GPT-5.6 的递归自我优化,包括自主内核优化、推测解码和 KV 缓存等推理加速技术,以及智能体框架的改进。相比四个月前,GPT-5.4 级别的智能成本下降了约 13 倍,年化降
在 Interconnects 播客中,Nathan Lambert 和 Florian Brand 讨论了开放模型的近期进展,包括 Kimi K3 的发布、Qwen 3.8 的开放权重计划、中国领导人的开源承诺,以及中美模型差距和蒸馏技术的争议。他们指出,开放模型在特定任务上可能接近前沿,但后训练和微调仍面临挑战。
Interconnects AI 的最新开源模型报告指出,开源生态系统正变得更加多元化,参与者包括纯模型制造商、大科技公司和产品公司。报告重点推荐了 NVIDIA 的 Nemotron 系列、Cohere 的 Command A+、GLM-5.2、Zyphra 的 ZAYA1 和 Poolside 的 Laguna-M.1 等模型,并讨论了开源模型发布的动机
Spring AI 发布了 2.0.0-RC1 版本,包含多项新特性、错误修复和文档更新。新特性包括为 MessageWindowChatMemory 添加回合边界裁剪、移除模型默认值、将 advisors 移至独立模块、移除内部工具执行等。错误修复涉及流式处理、span 层级和 JSON schema 生成等问题。该版本旨在简化 API 并提升可维护性。
RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。
LlamaIndex 发布 v0.14.19 版本,包含多个包更新。核心修复包括在 BaseIndex.delete_ref_doc 中传递 delete_from_docstore 参数、保留 SQLDatabase.run_sql 中的 CTE 名称、对齐同步检索去重键等。新增 MiniMax LLM 集成(默认 M2.7)、支持 GPT 5.4 Min
本文回顾了2026年1月至2月期间发布的10个开源权重LLM,重点比较了它们的架构异同。主要发布包括Arcee AI的Trinity Large、Moonshot AI的Kimi K2.5、StepFun Step 3.5 Flash、Qwen3-Coder-Next、z.AI的GLM-5、MiniMax M2.5、Nanbeige 4.1 3B、Qwen