KVAE:多模态生成模型的新一代 Tokenizer 系列
Kandinsky Lab 发布了 KVAE 系列 tokenizer,涵盖音频、图像和视频,专为文本条件下的潜在扩散模型生成设计。KVAE-Audio 支持 48 kHz 全频带,KVAE-3D 提供两种视频压缩方案,KVAE-2D 实现 8 倍图像压缩。实验表明,KVAE 在重建和生成指标上达到或超越 Wan-2.2、HunyuanVideo-1.5、F
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Kandinsky Lab 发布了 KVAE 系列 tokenizer,涵盖音频、图像和视频,专为文本条件下的潜在扩散模型生成设计。KVAE-Audio 支持 48 kHz 全频带,KVAE-3D 提供两种视频压缩方案,KVAE-2D 实现 8 倍图像压缩。实验表明,KVAE 在重建和生成指标上达到或超越 Wan-2.2、HunyuanVideo-1.5、F
llama.cpp 现已支持多种小型 OCR 模型,可在低端设备(如 4GB VRAM 的 GPU 或 CPU)上运行。文章介绍了如何使用 llama-cli 和 llama-server 运行这些模型,并通过 REST API 集成到应用中。支持的模型包括 GLM-OCR、Deepseek-OCR 等,并提供了提示词格式、量化选择及减少幻觉的建议。
llama.cpp 发布 b10311 版本,修复了 Qwen3-TTS 生成时文本流重复输入的问题。该问题源于非流式预填充与流式覆盖层不匹配,导致模型在生成时重复读取文本。修复后,覆盖层改为与预填充匹配的单个 tts pad 行。
字节跳动创始人张一鸣在Seed全员会上明确拒绝通过蒸馏方式追赶前沿大模型,坚持从头训练以追求长期技术主权。尽管字节在算力、数据和资金上具备优势,其Seed 2.1 Pro在全球榜单仅列第21位,落后于其他中国模型。字节计划训练10万亿参数的超大模型,并投入超2000亿元建设算力基础设施,以规模跃迁实现技术领先。
Hugging Face 每日论文展示了一项关于可解释的 MEG 语音解码研究。研究者重新设计了 MEG 到音频检索架构,将解码器参数减少约 20 倍,同时保持与最先进系统相当的性能(Top-1 准确率 39.75%)。通过将空间注意力替换为球谐函数、减少分支并添加时间滤波,模型权重可映射到皮层源,揭示语音感知网络,并发现左侧分支携带更高频的节律成分。配对
香港科技大学团队推出 DataSpace 基准,用于评估数据代理在异构工作区(含数据库、文件、视频等)上的可验证分析能力。该基准包含 410 个跨语言任务和 7439 个工件,并作为 KDD Cup 2026 官方评测基准。评测显示最佳准确率仅 66.34%,且多模态证据整合和跨源连接是主要瓶颈,表明该领域仍有很大提升空间。
rzgar 发布了 MiniMax H3 的 FP8 量化版本,包括 MXFP8、FP16attn 和 FP8 E4M3FN 等多种变体,并提供了文件下载。该模型支持图像到视频和音频生成,量化后文件大小从 47.6GB 降至 21GB,同时保留了关键张量的原始精度以保证质量。作者还提供了 ComfyUI 文本增强节点和超分辨率模型,以改善生成效果。
该研究指出,前沿文生图系统(如Gemini和GPT-Image)支持多轮对话生成一致的角色和场景,使得制作仇恨性视觉故事(有序图像组)变得廉价且可扩展。作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330个多轮配置,并评估了五个前沿模型,发现所有模型都能完成超过80%的故事,最强模型达到99.0%。现有审核系统在检测组级仇恨含义
该论文提出 RIG-RoPE,一种关系与实例门控的旋转位置编码机制,用于改进多模态大语言模型中的位置编码。它通过模态指示符、视觉实例标识符和持续时间坐标,解决静态多维位置分配中的跨模态空间干扰和时间步长不均问题。该方法无需新增参数,可在平铺注意力内核中实现,但尚未声称经验上的优越性。
arXiv 上发表了一篇题为 StyleComposer 的论文,提出了一种无需训练的多参考风格组合方法。该方法通过将颜色、纹理和结构等风格属性分别路由到扩散模型中分离效果最好的表示,并在去噪过程中协调这些路径,从而在无需训练或反转的情况下,同时满足多个参考风格和文本提示。该方法为每个属性提供了强度滑块,比现有方法更接近联合满足三个参考和提示。
arXiv 上发布了一篇关于多变量时间序列与语言对齐的研究论文。研究指出,传统方法依赖 LLM 描述时间序列,导致标签质量受限于模型感知能力,且多变量模式难以处理。为此,研究者提出解耦感知与描述的方法,用确定性代码计算统计量,再由 LLM 进行表达,构建了 4B 参数的 CGTime 模型。该模型在多变量理解任务上优于 GPT-4o-mini 和 GPT-5
arXiv 论文提出 F²Agent,一种用于多模态金融交易的新型智能体范式。它通过分层专业智能体提取模态特定信号,并引入模态感知自适应融合机制和噪声鲁棒一致性正则化,以捕捉跨模态依赖并生成抗噪交易信号。在六种股票和加密货币资产上的实验表明,F²Agent 在多项交易指标上优于 16 个基线,平均年化收益率相对提升超过 20%,在 GOOG 和 TSLA 上
阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可将文档转化为视频。该模型在生成时长、全能参考、真实世界还原等方面升级,旨在从内容生成工具跃迁为生产力工具。Wan3.0已在多个平台开启公测,API价格按分辨率收费,接口近期全量开放。
阿里巴巴于8月6日公测视频生成大模型Wan 3.0,支持单次生成30秒视频,并首次支持doc、xls、ppt、pdf、md等文档格式输入,可生成教学课件、产品演示等内容。该模型在人物真实感、视频编辑等方面升级,API价格按分辨率不同为0.3至1.2元/秒,已在多个平台开放公测。
另有 1 家信源报道
本文提出UniME-R1框架,用于统一多模态检索。该框架通过嵌入器-顾问架构,基于初始检索结果生成检索中心思维链(RC-CoT),以解决LVLM检索器忽略细粒度判别线索的问题。实验表明,UniME-R1在MMEB-V2等多个基准上优于强基线。
ChronoVision是一个多模态框架,旨在通过潜在状态重建提升多步时间推理能力。它采用重建视觉头和ROI注意力定位模块进行监督微调,并在后训练中应用强化学习。在Vbvr-VQA数据集上达到74.8%域内和71.6%域外准确率,在IntPhys2上达到55.0%。
Hugging Face 发布了 Optimum Intel v2.1.0,新增了对多个模型架构的导出和推理支持,包括 Google 的 Gemma 3n 和 Gemma 4 Unified、阿里巴巴的 Qwen3-Omni-MoE 和 Qwen3-VL-Embedding、SmolLM3 以及 Black Forest Labs 的 FLUX.2。该版本通
SIGNPOST-Bench 是一个用于评估多模态大语言模型(MLLMs)在文本与视觉信息冲突时仲裁能力的基准。该基准通过将图像转换为原始、空白、相似、随机和对抗五种变体,构建了 5,111 个反事实组和 25,555 个图像变体,并评估了来自七个提供商的 20 个 MLLM。结果显示,对抗性变体使中位定位误差从 282 公里增加到 1,347 公里,提升了
Hugging Face 上发布了 MiniMax H3 模型的 GGUF 量化版本(Abiray/MiniMax-H3-GGUF),该模型是 MiniMax 推出的全模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该仓库提供了多种量化精度的 UNet 模型(FL2VA 和 Ref2VA 模
该研究系统探索了多模态预训练的机制,通过合成和真实数据集实验,揭示了知识流、模态协同与竞争、早期统一等关键现象,并提出了高效预训练方案,仅用5%计算预算即可实现强生成性能。研究在13.5B MoE模型和2T tokens上验证了结论,为多模态预训练提供了原则性基础。