返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月8日周六 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

KVAE:多模态生成模型的新一代 Tokenizer 系列

Kandinsky Lab 发布了 KVAE 系列 tokenizer,涵盖音频、图像和视频,专为文本条件下的潜在扩散模型生成设计。KVAE-Audio 支持 48 kHz 全频带,KVAE-3D 提供两种视频压缩方案,KVAE-2D 实现 8 倍图像压缩。实验表明,KVAE 在重建和生成指标上达到或超越 Wan-2.2、HunyuanVideo-1.5、F

8月7日周五 · 17 条
正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

llama.cpp 支持多种小型 OCR 模型,可在低端设备运行

llama.cpp 现已支持多种小型 OCR 模型,可在低端设备(如 4GB VRAM 的 GPU 或 CPU)上运行。文章介绍了如何使用 llama-cli 和 llama-server 运行这些模型,并通过 REST API 集成到应用中。支持的模型包括 GLM-OCR、Deepseek-OCR 等,并提供了提示词格式、量化选择及减少幻觉的建议。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10311 修复 Qwen3-TTS 重复文本问题

llama.cpp 发布 b10311 版本,修复了 Qwen3-TTS 生成时文本流重复输入的问题。该问题源于非流式预填充与流式覆盖层不匹配,导致模型在生成时重复读取文本。修复后,覆盖层改为与预填充匹配的单个 tts pad 行。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

张一鸣拒绝蒸馏捷径,字节豪赌10万亿参数模型

字节跳动创始人张一鸣在Seed全员会上明确拒绝通过蒸馏方式追赶前沿大模型,坚持从头训练以追求长期技术主权。尽管字节在算力、数据和资金上具备优势,其Seed 2.1 Pro在全球榜单仅列第21位,落后于其他中国模型。字节计划训练10万亿参数的超大模型,并投入超2000亿元建设算力基础设施,以规模跃迁实现技术领先。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

可解释的 MEG 语音解码:皮层源与驱动检索的刺激特征

Hugging Face 每日论文展示了一项关于可解释的 MEG 语音解码研究。研究者重新设计了 MEG 到音频检索架构,将解码器参数减少约 20 倍,同时保持与最先进系统相当的性能(Top-1 准确率 39.75%)。通过将空间注意力替换为球谐函数、减少分支并添加时间滤波,模型权重可映射到皮层源,揭示语音感知网络,并发现左侧分支携带更高频的节律成分。配对

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DataSpace:异构工作区可验证分析的数据代理基准

香港科技大学团队推出 DataSpace 基准,用于评估数据代理在异构工作区(含数据库、文件、视频等)上的可验证分析能力。该基准包含 410 个跨语言任务和 7439 个工件,并作为 KDD Cup 2026 官方评测基准。评测显示最佳准确率仅 66.34%,且多模态证据整合和跨源连接是主要瓶颈,表明该领域仍有很大提升空间。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax H3 FP8 量化模型发布,支持视频音频生成

rzgar 发布了 MiniMax H3 的 FP8 量化版本,包括 MXFP8、FP16attn 和 FP8 E4M3FN 等多种变体,并提供了文件下载。该模型支持图像到视频和音频生成,量化后文件大小从 47.6GB 降至 21GB,同时保留了关键张量的原始精度以保证质量。作者还提供了 ComfyUI 文本增强节点和超分辨率模型,以改善生成效果。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

无辜画面,仇恨故事:多轮视觉故事生成中的仇恨意图评估与检测

该研究指出,前沿文生图系统(如Gemini和GPT-Image)支持多轮对话生成一致的角色和场景,使得制作仇恨性视觉故事(有序图像组)变得廉价且可扩展。作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330个多轮配置,并评估了五个前沿模型,发现所有模型都能完成超过80%的故事,最强模型达到99.0%。现有审核系统在检测组级仇恨含义

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

RIG-RoPE:关系与实例门控的旋转位置编码

该论文提出 RIG-RoPE,一种关系与实例门控的旋转位置编码机制,用于改进多模态大语言模型中的位置编码。它通过模态指示符、视觉实例标识符和持续时间坐标,解决静态多维位置分配中的跨模态空间干扰和时间步长不均问题。该方法无需新增参数,可在平铺注意力内核中实现,但尚未声称经验上的优越性。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

StyleComposer:无需训练的多参考风格组合方法

arXiv 上发表了一篇题为 StyleComposer 的论文,提出了一种无需训练的多参考风格组合方法。该方法通过将颜色、纹理和结构等风格属性分别路由到扩散模型中分离效果最好的表示,并在去噪过程中协调这些路径,从而在无需训练或反转的情况下,同时满足多个参考风格和文本提示。该方法为每个属性提供了强度滑块,比现有方法更接近联合满足三个参考和提示。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

CGTime:通过计算与语言解耦实现多变量时间序列对齐

arXiv 上发布了一篇关于多变量时间序列与语言对齐的研究论文。研究指出,传统方法依赖 LLM 描述时间序列,导致标签质量受限于模型感知能力,且多变量模式难以处理。为此,研究者提出解耦感知与描述的方法,用确定性代码计算统计量,再由 LLM 进行表达,构建了 4B 参数的 CGTime 模型。该模型在多变量理解任务上优于 GPT-4o-mini 和 GPT-5

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

F²Agent:面向多模态交易的金融智能体融合范式

arXiv 论文提出 F²Agent,一种用于多模态金融交易的新型智能体范式。它通过分层专业智能体提取模态特定信号,并引入模态感知自适应融合机制和噪声鲁棒一致性正则化,以捕捉跨模态依赖并生成抗噪交易信号。在六种股票和加密货币资产上的实验表明,F²Agent 在多项交易指标上优于 16 个基线,平均年化收益率相对提升超过 20%,在 GOOG 和 TSLA 上

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里视频大模型Wan3.0公测:文档PPT也能变视频

阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可将文档转化为视频。该模型在生成时长、全能参考、真实世界还原等方面升级,旨在从内容生成工具跃迁为生产力工具。Wan3.0已在多个平台开启公测,API价格按分辨率收费,接口近期全量开放。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

阿里视频大模型Wan3.0公测:支持文档转视频,单次生成30秒

阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可生成教学课件、产品演示等内容。该模型在人物真实感、视频编辑等方面升级,API价格按分辨率不同为0.3至1.2元/秒,已在多个平台开放公测。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

UniME-R1:基于硬负样本的检索中心思维链统一多模态检索

本文提出UniME-R1框架,用于统一多模态检索。该框架通过嵌入器-顾问架构,基于初始检索结果生成检索中心思维链(RC-CoT),以解决LVLM检索器忽略细粒度判别线索的问题。实验表明,UniME-R1在MMEB-V2等多个基准上优于强基线。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ChronoVision:通过潜在状态重建实现时间推理

ChronoVision是一个多模态框架,旨在通过潜在状态重建提升多步时间推理能力。它采用重建视觉头和ROI注意力定位模块进行监督微调,并在后训练中应用强化学习。在Vbvr-VQA数据集上达到74.8%域内和71.6%域外准确率,在IntPhys2上达到55.0%。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Optimum Intel v2.1.0 发布,新增多模型支持

Hugging Face 发布了 Optimum Intel v2.1.0,新增了对多个模型架构的导出和推理支持,包括 Google 的 Gemma 3n 和 Gemma 4 Unified、阿里巴巴的 Qwen3-Omni-MoE 和 Qwen3-VL-Embedding、SmolLM3 以及 Black Forest Labs 的 FLUX.2。该版本通

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SIGNPOST-Bench:多模态大语言模型文本-视觉冲突解决基准

SIGNPOST-Bench 是一个用于评估多模态大语言模型(MLLMs)在文本与视觉信息冲突时仲裁能力的基准。该基准通过将图像转换为原始、空白、相似、随机和对抗五种变体,构建了 5,111 个反事实组和 25,555 个图像变体,并评估了来自七个提供商的 20 个 MLLM。结果显示,对抗性变体使中位定位误差从 282 公里增加到 1,347 公里,提升了

8月6日周四 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax H3 发布 GGUF 量化版本,支持多模态视频生成

Hugging Face 上发布了 MiniMax H3 模型的 GGUF 量化版本(Abiray/MiniMax-H3-GGUF),该模型是 MiniMax 推出的全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该仓库提供了多种量化精度的 UNet 模型(FL2VA 和 Ref2VA 模

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

多模态预训练的物理机制:知识流、模态协同与早期统一

该研究系统探索了多模态预训练的机制,通过合成和真实数据集实验,揭示了知识流、模态协同与竞争、早期统一等关键现象,并提出了高效预训练方案,仅用5%计算预算即可实现强生成性能。研究在13.5B MoE模型和2T tokens上验证了结论,为多模态预训练提供了原则性基础。