Ex-Omni-2D:具有原生视觉呈现的全模态对话模型
Ex-Omni-2D 是一个全模态对话框架,能够生成协调的文本、个性化语音和参考条件视频响应。该模型通过视觉思维计划和蒸馏的流式视频生成器,实现了视觉呈现的对话能力。其共享声学-时间接口支持从异构数据中学习,避免了大规模查询-文本-语音-视频监督的需求。在四步推理下,完整的四 GPU 流水线实现了 1.293 的端到端 RTF,提供了实用的质量-效率平衡点。
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Ex-Omni-2D 是一个全模态对话框架,能够生成协调的文本、个性化语音和参考条件视频响应。该模型通过视觉思维计划和蒸馏的流式视频生成器,实现了视觉呈现的对话能力。其共享声学-时间接口支持从异构数据中学习,避免了大规模查询-文本-语音-视频监督的需求。在四步推理下,完整的四 GPU 流水线实现了 1.293 的端到端 RTF,提供了实用的质量-效率平衡点。
Hugging Face 每日论文发布了一篇题为《ComBodied Agents: a New Paradigm of Human-Centric Agentic AI》的论文,提出了一种名为 Combodied Agents 的新范式,将数字代理和具身代理整合到一个闭环框架中,以建模个体人类状态轨迹并提供基于同意、适度的支持。该框架通过事件驱动的多模态感
本文提出了一种名为“Signpost Watermarking”的方法,通过联合优化训练不可感知的视觉水印,使其能与独立部署的其他水印系统共存。作者首先实证发现视频水印也具备图像水印中的共存特性,然后引入解码器感知的训练目标,在保持水印鲁棒性和视觉质量的同时,显著提升共存性能。该方法支持分层溯源信号,为内容真实性和版权保护提供了实用路径。
arXiv 论文提出 Sequential Modality Dropout (SMD),一种针对多模态序列推荐模型的训练时模态随机丢弃方法。SMD 在训练时独立地以一定概率擦除整个用户交互历史中的图像或文本模态,使模型学会不依赖单一模态进行预测。在四个骨干模型和四个 Amazon 数据集上,SMD 将文本保留率提升 1.0 到 3.2 个点,且几乎不损失全
P3CA是一种编码器无关的方法,通过空间探测解释视觉基础模型嵌入。它利用用户选择的区域估计特征归一化和主协方差方向,并将投影应用于整个张量,以可视化局部信息方向。该方法在EmbedVision中实现,并在自然图像、病理学基础模型嵌入和空间转录组数据上进行了评估。
Gated Hindsight Distillation (GHD) 是一种改进移动 GUI 代理训练的方法,利用未来截图作为特权信息,在标准模仿失败时恢复正确的推理。该方法在 AndroidWorld 和 AndroidLab 上,通过两种视觉语言模型,相比 GRPO 提高了任务成功率。代码和检查点将公开。
Lightricks 发布了 LTX-2.3 模型,这是对 LTX-2 的重大更新,显著提升了音频和视觉质量以及提示遵循能力。该模型基于 DiT 架构,能够在一个模型中生成同步的视频和音频,并提供了多种检查点,包括完整版、蒸馏版和 LoRA 版本。LTX-2.3 支持本地运行,并提供了 ComfyUI 集成和 PyTorch 代码库,旨在实现实用的本地执行。
该论文提出一个三阶段多模态框架,用于在图像创作对话中推荐后续编辑建议。框架结合监督微调、多目标强化学习和视觉验证器,在百万级用户的A/B测试中将视觉不一致率从3.7%降至0.9%,并显著提升推荐点击率、图像采纳率和平均对话轮数。
TNG公司(慕尼黑软件咨询公司)在Hugging Face博客上分享了将NVIDIA Nemotron 3.5 Lightning模型扩展为多模态视觉模型的实验。他们采用GLM-5.2 Vision的方法,仅训练一个小的MLP适配器,将现成的视觉编码器(如Kimi K2.6 Vision Tower或NVIDIA C-Radiov4-H)注入模型,在RTX
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并
另有 1 家信源报道
Google Research 与 Google DeepMind 在首次研究中展示了其医疗 AI 系统 AMIE 的实时临床视频咨询能力。该系统基于 Gemini 和 Project Astra 构建,采用多智能体架构,能够解读视觉和听觉线索,指导虚拟体检并进行实时诊断推理。在模拟咨询的随机研究中,临床评估者对其病史采集、诊断准确性、管理适当性和沟通质量给
另有 1 家信源报道
苹果正在开发一项名为“Apple Reference Image”的iOS功能,可在拍摄时向iPhone照片嵌入来源元数据,以帮助用户证明照片非AI伪造。该功能在iOS 27测试版中被发现,默认关闭,用户需手动启用,并通过苹果的Private Cloud Compute服务器进行验证。苹果未采用C2PA标准,而是自建系统,这可能为在线平台标记人类创作内容提供
Pixieset 通过 Amazon Bedrock 开发了 AI 图像替代文本生成功能,解决了摄影师为大量图片手动编写 alt text 的痛点。该功能在 4 个月内从概念到上线,首周为超过 75 万张照片生成了替代文本,并实现了 35% 的用户采用率。Pixieset 采用逐步信任的设计,让用户逐张审核 AI 生成的描述,并利用 Bedrock 的跨区域
微软研究院发布了 CARE-X,一个面向胸部 X 光片解读的统一视觉语言模型,旨在通过生成式与判别式结合、奖励对齐学习和工具增强测量来提升临床实用性。该模型在 Narayana Health 的真实印度临床数据上验证,覆盖 ICU 罕见病理和 CT 确认的增大病症。研究还探索了将 Qwen3-VL-4B-Instruct 与确定性测量工具结合,以改善依赖测量
NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发
NeuroPilot是一个多智能体系统,将神经影像处理、质量控制和数据管理数字化为三个LLM可调用的技能。该系统在17个队列(超过123,000名受试者)中部署,覆盖从婴儿到老年的多种MRI模态。QC代理筛选了558名生产受试者,婴儿处理流程在QC验证输入上实现了100%的完成率,并将传统2-3个月的训练和数据处理时间压缩到一周。
arXiv 发布论文介绍 PragyaDoc,一个面向低资源环境的多语言医疗文档理解框架。该框架通过四层流水线(并行集成 OCR 提取、几何词汇融合、确定性领域结构化、双 LLM 医学推理与定位)解决印度 22 种官方语言导致的医疗文档可访问性障碍。其目标用户包括农村人口、ASHA 工作者和患者家属,旨在提升医疗信息的可理解性。
DocAtlas 是一个将长文档理解视为可变状态交互过程的系统,通过外部环境管理文档信息的搜索、读取、存储和展示。该系统结合了自改进检索、选择性证据访问和主动工作记忆,在固定上下文预算下运行。使用 GPT-5.4 时,DocAtlas 在 MMLongBench-Doc 上达到 71.4% 的准确率,超过人类专家参考水平;用 Qwen3.5-4B VLM 进
这篇arXiv论文对多模态大语言模型(MLLMs)的安全格局进行了系统性综述,提出了基于多模态的威胁分类法,涵盖对抗攻击、数据投毒、越狱和幻觉等威胁,并分析了威胁模型的变化。文章还总结了更新的安全假设和近期安全策略进展,最后讨论了开放挑战和未来方向,以推动多模态系统更规范、可扩展的安全机制发展。
一项发表在 arXiv 上的研究评估了多种多模态大语言模型(MLLMs)在结直肠息肉光学诊断中的表现。研究使用 PRIME 数据集,比较了 Claude Opus 4、Gemini 2.5 Pro、GPT-o3、GPT-4o 和 GPT-5 的分类准确性。结果显示,所有模型在区分肿瘤性与非肿瘤性息肉方面 F1 分数均高于 0.9,但 Gemini 2.5 P