返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月1日周二 · 19 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-Flash-Next 混合量化 SSD-PLE GGUF 发布

Baekpica 发布了 Qwen3.8-Flash-Next 的混合量化 GGUF 模型,采用 SSD-PLE 技术将 51.2B 参数的预测性潜在嵌入表移至 SSD,以 BF16 存储,从而将显存预算分配给 128.8B 参数的计算主干。在单个 NVIDIA DGX Spark 上,Q5 变体实现了 606.4 tok/s 的中位冷预填充速度和 28.3

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

小云雀AI品牌升级:从生成工具到专业创作伙伴

8月31日,内容创作平台小云雀AI宣布品牌升级,定位为“一起创作好故事”,升级产品能力、创作者扶持政策和内容生态。产品方面,推出自研剧本模型、基于Seedream的AnyCook生图模型、自由画布、3D导演台,并与剪映打通,支持完整故事创作。未来3年将投入一亿积分,更新创作者计划,新增课程中心,覆盖不同成长阶段。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

GenFirst:生成先于重建的稳定端到端潜在生成建模

GenFirst 提出了一种生成先于重建的端到端潜在生成模型训练策略,通过熵保持和非对称动力学避免潜在空间坍缩,实现了稳定的直接端到端训练。该方法在 ImageNet-256 上 SiT 模型达到 gFID 0.97(带 CFG)和 1.45(不带 CFG),MMDiT 在文本到图像生成中 GenEval 得分 0.90,并扩展到统一多模态生成和表示学习。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 2-bit MLX 文本版发布

lukaskremla 发布了 Qwen3.8-27B 的 2-bit MLX 量化版本,该版本移除了视觉塔,仅保留文本生成能力。模型基于 Qwen/Qwen3.8-27B,使用 mlx-lm 0.31.2 转换,采用 2-bit 权重量化(RTN,group-size-64),支持长上下文、多语言、推理和工具使用。用户可单独下载 MTP 头,另有支持视觉的

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Hugging Face 论文页面介绍了 DreamX-Creator 1.0,一个紧凑的 7B 原生联合音视频生成系统。该系统通过跨模态注意力、渐进式联合训练、多模态反馈强化学习以及自回归 2K 细化流程,实现同步的高分辨率音视频输出。其性能与最先进的开源系统相当,并已开源生成器和 2K 细化器,旨在推动原生音视频生成的普及。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MoziAI-35B-V3.8:15.9GB 本地部署多模态金融模型

MoziAI-35B-V3.8 是由中国金融领域意见领袖陈雨墨团队开发的开源多模态 AI 模型,基于 Ornith-1.5-35B-A3B 基础模型,采用 MoE 架构,通过自研 MoziSmartBit 量化压缩至 15.9GB,支持本地部署和免费商用。模型具备动态七维思考框架、Agent LOOP 迭代机制、金融垂直优化和无审查特性,支持多语言、视觉理解

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

Ropedia发布HOMIE Gen2,为具身智能补上“经验”课

Ropedia发布新一代多模态采集系统HOMIE Gen2,旨在为具身智能补上“经验”这一课。该系统通过4目全景、4路空间音频及50µs多传感器同步精度,记录人类真实操作中的动作、时机和环境变化,采集成本降至约1/12.5。Ropedia提出Human Experience Scaling Law,认为机器人能力将随高质量人类经验规模化增长而提升,并已服务超

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

壁仞科技中期业绩营收激增近20倍,亏损收窄加速

国产GPU企业壁仞科技发布2026年中期业绩,上半年营收12.36亿元,同比增长约1997.6%,亏损大幅收窄76.4%至3.77亿元。公司完成互联网大客户导入,并发布新一代NPO光互连超节点方案,支持FP8/FP4精度,自研BLink 2.0协议。壁仞科技正牵头制定异构混训国家标准,并完成DeepSeek-V4等旗舰大模型适配。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

筷子科技推KP钱包,统一视频商业AI价值计量

筷子科技发布视频商业AI能力统一价值单位“KP”及企业“KP钱包”,旨在统一管理模型调用、内容生产、分发等环节的预算与能力。KP建立在Token之上,覆盖模型、算力、Agent、工具等资源,企业可通过KP钱包分配预算并管理多业务环节。目前Kuaizi已积累超1.2亿条商业视频,服务13500多家付费企业,并展示了多个客户效率提升案例。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

参数化多模态用户记忆:存储字幕无法承载的感知信息

本文提出了一种参数化多模态用户记忆方法,将感知记忆(如声音、面部)以原生模态存储,通过VLM进行指代定位、专用编码器提取身份键,并利用AttMem记忆库以注意力令牌形式存储,无需外部检索。实验表明,该方法在跨年龄、多说话人等场景下显著优于基于文本描述的记忆系统,弥补了纯文本记忆的不足。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

MIRAGE-CAD:通过构造中介的多模态可执行CAD程序生成

MIRAGE-CAD 是一个多模态 CAD 程序生成系统,能从自然语言、图像、点云和 STEP/B-Rep 几何输入生成可执行的 Python CAD 代码,并通过 OpenCASCADE 内核执行。该系统引入显式的构造中间表示(IR)作为计划接口,实验表明该表示有助于提高生成程序的构建成功率和几何保真度,且其可读性为下游执行成功提供参考。研究还发现,可执行

正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源API 更新

Gemini API 发布智能体视频理解,支持多模型并减少 token 消耗

Gemini API 于 2026 年 9 月 1 日发布更新,为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出了智能体视频理解功能,该功能通过 Interactions 和 GenerateContent API 提供。模型能够动态导航视频时间线,按需请求转录、帧或音频轨道,与静态处理相比,长视频内容可减

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Liquid AI 发布 LFM2.5-VL-3B GGUF 量化版,面向边缘 AI

Liquid AI 发布了 LFM2.5-VL-3B 的 GGUF 量化版本,这是一个专为边缘 AI 和端侧部署设计的新一代混合模型,支持多语言和图像到文本任务。该模型可通过 llama.cpp 运行,并支持通过命令行加载图像进行对话。此版本旨在提供高质量、高速度和内存效率,为边缘设备上的多模态 AI 应用提供支持。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Liquid AI 发布 LFM2.5-VL-3B 多模态模型,面向端侧部署

Liquid AI 发布了 LFM2.5-VL-3B 多模态模型,基于 LFM2.5-2.6B 语言模型和 SigLIP2 NaFlex 视觉编码器,支持文本和图像处理,具备改进的接地、OCR 和高效推理能力。该模型专为端侧部署设计,在 Apple M5 Max 上达到 228 tok/s,在 AMD Ryzen AI Max+ 395 上达到 116 to

正文结构化主题已通过公开置信门槛
Google Gen AI JavaScript SDK Releases一手来源产品发布

Google Gen AI JS SDK 2.20.0 发布:新增视频理解与音频支持

Google 发布了 Gen AI JavaScript SDK 2.20.0 版本,新增了对 audio/webm MIME 类型的支持、GEAP 的 translation config SDK 支持,以及 Interactions API 的视频理解功能。同时修复了文件上传请求中冗余 Content-Length 的问题,并暴露了 Processing

正文结构化主题已通过公开置信门槛
Google Gen AI Python SDK Releases一手来源API 更新

Google Gen AI Python SDK v2.21.0 发布

Google 发布了 Gen AI Python SDK 的 v2.21.0 版本,新增了文件下载到磁盘或文件类对象的目标参数、支持 audio/webm MIME 类型、为 GEAP 添加翻译配置支持,以及为 Interactions API 添加视频理解支持。同时修复了 Interactions SDK 中 ProcessingCallStep 和 Pr

正文结构化主题已通过公开置信门槛
智东西模型发布

DeepSeek-V4多模态模型开源,多项基准超越Opus-4.8

DeepSeek于8月31日开源了其V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,该模型基于V4-Flash架构并集成视觉模块,解锁了视觉理解能力。在多项基准测试中,该模型在纯文本智能体任务和多模态智能体能力上表现优异,部分指标超越Opus-4.8,但在复杂数据科学任务上仍有差距。此前该模型已于8月21日上线DeepS

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
智东西产品发布

海信发布家庭AIOS系统JUOS,搭载星海大模型

海信于8月31日发布其首个AIOS系统JUOS,面向家庭场景,适配电视、投影等终端,搭载自研星海大模型和系统级AI智能体“超级小聚”。该系统旨在实现家庭AI交互从被动响应到主动服务,支持多用户识别、个性化桌面和跨设备内容流转。海信视像科技总裁李炜表示,家庭AI需识别不同成员和多元场景,JUOS已获人工智能终端智能化分级L3认证,意图识别准确率超95%。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

AI 视频搜索初创公司 Clipto 估值达 2.5 亿美元

Clipto 是一家总部位于旧金山的初创公司,利用 AI 技术帮助用户搜索和整理本地视频、音频、图片及文档等文件,近期完成了 1500 万美元融资,估值达 2.5 亿美元。该公司已拥有超过 3000 万用户和数十万付费订阅者,年经常性收入达 1500 万美元,并保持盈利。Clipto 最近支持了 MCP 协议,允许 AI 应用在用户授权下访问索引数据,所有处

8月31日周一 · 1 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

海信发布家庭智能伴侣级AIOS JUOS,实现从被动响应到主动懂家

海信于8月31日发布行业首个家庭智能伴侣级AIOS——海信JUOS,该系统面向家庭全场景,适配电视、闺蜜机、投影等多终端,搭载自研星海大模型与四大原生引擎,实现从被动响应到主动服务的代际跃迁。JUOS通过超级小聚、AI个性桌面、小聚妙联等核心体验升级,并获人工智能终端智能化分级L3认证,计划9月起推送至首批机型。

另有 1 家信源报道