返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 11 条
正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布14

我创建了自己的交互式数字分身,你可以和它对话

TechCrunch记者在数字人公司Synthesia纽约新办公室体验了为其定制的AI数字分身,包括可朗读脚本的个人分身和仅围绕其风险投资欺诈报道训练的交互式分身。Synthesia估值达40亿美元、年经常性收入超1亿美元,其技术栈整合语音转文字、语言、文字转语音及自研视频模型,并推出Sessions等企业交互产品。记者借此探讨数字分身对新闻业信任基础及未来

正文结构化主题已通过公开置信门槛
量子位模型发布14

索辰科技与美梦空间发布具身模型及物理测评标准

索辰科技与战略投资企业美梦空间在第五届全球数字贸易博览会上联合发布Physical-WAM物理-世界动作模型和RoboTwin-Phys物理漂移评测基准。Physical-WAM通过PhysLens、PhysDream、PhysAct三个模块插入物理Token表征,让机器人具备摩擦、重量、重心等物理感知与预判能力;RoboTwin-Phys新增13类物理扰动

正文结构化主题已通过公开置信门槛
THE DECODER研究6

GPT-6 Astra 在宜家家具组装错误识别基准上达 80%

Epoch AI 推出家具组装基准 FAB,用三张宜家家具组装照片(含故意错误)测试模型识别装配错误的能力。2025 年 11 月最佳模型 Claude Opus 4.5 得分 28%,十个月后 OpenAI 的 GPT-6 Astra 达到 80%(每张照片耗时三分钟),Claude Fable 5.1 为 70%,Claude Opus 5 为 61%,

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布23

Qwen3.6-35B无审查Genesis版GGUF发布

Hugging Face 用户 LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Final-GGUF 模型,基于 HauhauCS 的无审查版本进行后训练数据再生与校准。作者提出名为 Genesis 的算法,利用 Marchenko–Pastur 分布和自定义 SVD 修复 GGUF 模型张量中的训练噪声

正文结构化主题已通过公开置信门槛
量子位商业7

米哈游千亿AI野心:从AI帕姆到自进化Agent

米哈游在云栖大会上由《崩坏》系列AI NPC与Gameplay负责人郑银河分享了其AI游戏布局:AI帕姆接入对话能力后一周对话超6000万次,采用策略增强RAG、情绪标签与三层记忆实现「活人感」;内部EchoX平台托管代码Agent与MCP工具用于研发提效,并探索AI Gameplay与自进化Agent。米哈游联合创始人大伟哥称未来三年AI投入最多达1000

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究9

SpaFactor:轻量级空间上下文基因程序建模用于组织学-转录组推断

清华大学深圳国际研究生院等机构提出 SpaFactor,一种轻量级低秩形态-程序-基因分解框架,用于从常规 H&E 染色图像推断空间转录组基因表达。该方法融合中心位点视觉表征与多尺度邻域上下文,用残差 MLP 学习组织微环境到低维潜在基因程序的非线性映射,再通过共享基因载荷解码多基因表达。在五个公开队列上取得最佳综合性能,对空间可变基因提升尤为明显,并能更忠

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究9

SMILESGNN:SMILES-图交叉注意力融合的可解释临床毒性预测

研究者提出 SMILESGNN,一种通过交叉注意力融合 SMILES Transformer 编码器与 GATv2 图编码器的多模态架构,用于药物毒性预测,并保留显式图分支以支持 GNNExplainer 解释。在 ClinTox 上以仅 0.4M 参数取得 AUC-ROC 0.987、F1 0.906,优于所有图单模态基线;其预训练变体 SMILESGNN

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源12

Ling-3.0-flash-VL 多模态模型 GGUF 量化版发布

Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash-VL 的 GGUF 量化版本,基于 llama.cpp 运行。该模型为 124B 总参数、每 token 仅激活 5.5B 的 MoE 多模态模型,支持图像和视频输入,原生 128K 上下文,可通过 YaRN 扩展至 256K。llama.cp

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源9

llama.cpp b11190 修复 LFM2 音频 mel 预处理器

llama.cpp 发布 b11190 版本,修复了 LFM2 音频模型(lfm2a)的 mel 预处理器。原实现导致英语测试语句 4.5%、日语 6.5% 的贪心转录结果与参考实现不一致,日语中部分差异甚至改变整个词。修复采用 log(x + 2^-24) 替代对数下限截断、对称 Hann 窗,并将归一化 epsilon 加到标准差而非平方根内,仅 lfm

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源开源8

Xinference 发布 v3.5.0:新增多模型支持与请求日志可观测性

Xinference 发布 v3.5.0,新增 AuK、Irodori TTS、YuE2、Spark-X2.5、Qwen-Image-2.1、MinerU2.5 等多种音频、图像与 LLM 模型支持,并加入模型请求日志、审计与可观测性功能。性能方面优化了 embedding/rerank 的 vLLM 批处理与 API 启动开销,同时修复了流式工具调用、客户

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程4

在 SageMaker HyperPod 上用 SkyRL 加速多模态 RL 训练

AWS 博客介绍在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL 进行多模态强化学习训练。方案以 Qwen3-VL-8B 视觉语言模型为策略模型,采用 GRPO 算法训练其走 2D 迷宫,从 VisGym SFT 检查点出发,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。HyperP

9月25日周五 · 9 条
正文结构化主题已通过公开置信门槛
The Verge AI产品发布5

Apple Home 摄像头 AI 功能实测:能否胜过亚马逊和谷歌?

The Verge 记者实测 Apple 随 iOS 27 在 HomeKit Secure Video 上推出的 Apple Intelligence for Home 摄像头 AI 功能,并与 Amazon Ring、Google Nest 的同类功能对比。Apple 可生成文字描述、自然语言视频搜索、合并相关事件并减少通知,但需搭配 iCloud Pl

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源7

ggml-org 发布小米 MiMo-V2.6-Flash-RL 的 GGUF 量化版

ggml-org 在 Hugging Face 上发布了小米 MiMo-V2.6-Flash-RL 的 GGUF 量化版本,支持通过 llama.app 运行。该版本提供 MXFP4、Q2 K 等多种量化输出,并附带用于投机解码的 MTP 与 DFlash drafter sidecar,以及面向视觉和音频编码器的 Q8 0 mmproj。模型由 ggml-

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布11

GLM-5.3-Flash W4A16 INT4 量化版发布,体积减70%

canada-quant 发布了 GLM-5.3-Flash 的 W4A16(INT4)量化版本,仅对 36,288 个路由专家 GEMM 做 GPTQ 对称 INT4 量化,注意力、路由、共享专家、嵌入、视觉塔和 MTP 头保持 BF16。模型体积从约 599 GiB 降至 177.7 GiB(-70%),可在 H100、H200、RTX PRO 6000

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

Pistis多模态大模型技术报告:IDRL后训练框架与PAH系统

该技术报告介绍了Pistis多模态大语言模型系列,包含基于Qwen3.6的27B和基于Qwen3.5的9B两个规模,采用通用可扩展的后训练框架。框架先进行大规模多模态监督微调,再提出交错蒸馏与强化学习(IDRL)新范式,在单一训练循环中交替进行同策略蒸馏和强化学习,提升知识迁移、优化稳定性和长程智能体轨迹的信用分配。模型分为Pistis-Thinking和P

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究4

跨国语码混合的生成式推荐框架 CMRec

该论文提出 CMRec,一个面向跨国电商场景的生成式推荐框架。由于各国用户与商品 ID 空间彼此独立,现有生成式推荐仅在参数层面共享知识,数据层面缺乏跨国监督。CMRec 借鉴多语言 NLP 的语码混合思路,先学习跨模态内容与行为共现的共享语义码本,再通过满足静态(内容)与动态(价格、受众、热度)双重约束的 token 级替换合成跨国序列,并引入上下文感知损

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布8

RedHatAI 发布 Qwen3.8-27B-NVFP4 量化模型

RedHatAI 发布了 Qwen3.8-27B-NVFP4,这是对 Qwen/Qwen3.8-27B 的混合精度量化版本,采用 FP4/FP8 方案,MLP 投影量化为 FP4,注意力投影和最终 MLP 层量化为 FP8,KV 缓存量化为 FP8,语言模型头保持全精度。该模型使用 LLM Compressor 结合 AWQ 与 GPTQ 在 perfect

正文结构化主题已通过公开置信门槛
Latent Space模型发布5

Runway 发布 GWM Worlds 2 与 WorldPrompt 实时世界模型

Runway 推出 GWM Worlds 2 研究预览版,将高保真视频与音频生成转变为实时交互式模拟,并引入 WorldPrompt 输入格式用于指定生成世界及其中动作。该模型采用自回归扩散架构,通过微调、后训练和蒸馏实现 720p/24fps 视频与 48kHz 音频的实时流式生成。Runway CTO 与首席研究科学家在采访中讨论了 WorldPromp

正文结构化主题已通过公开置信门槛
The Verge AI产品发布6

Google Gemini 3.8 Live 推出 Live Avatar 功能

Google 发布 Gemini 3.8 Live 更新,新增 Live Avatar 功能,让用户在与模型对话时看到实时动画 AI 形象进行唇形同步和表情反馈。该功能目前仅面向 Gemini Enterprise 客户,支持 97 种语言切换且不降低视频保真度,并允许企业创建自定义形象。输出带有 SynthID 隐形水印及身份保护措施。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布3

PrismML 将微型 LLM 带入高通芯片智能眼镜

由加州理工学院研究人员创立、UC Berkeley 的 Ion Stoica 担任顾问的 AI 实验室 PrismML,为搭载高通 Snapdragon 芯片的智能眼镜开发了其微型语言模型版本。在高通 Snapdragon 峰会上,高通展示了 PrismML 的 1-bit Bonsai LLM,可在基于 Snapdragon AR1 Gen 1 平台的 A