返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月21日周一 · 1 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

阿里开源 Qwen-Image-2.1:70 亿参数图像模型称超越闭源

阿里巴巴 Qwen AI 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,其视觉生成组件仅 70 亿参数,团队称在自家基准上超过多数闭源模型,但独立评测尚未出炉。该模型可在 3090 等消费级 GPU 上运行,原生支持 RGBA 透明图像生成与编辑,最多可同时处理十张参考图,并通过架构调整与 KV 缓存复用加速推理。模型已在 Hugging

9月20日周日 · 10 条
正文结构化主题已通过公开置信门槛
THE DECODER研究

腾讯 Gander:边对话边后台处理任务的实时智能体模型

腾讯混元语音团队与多所大学研究者提出 Gander 模型,可在后台处理复杂任务的同时保持实时对话,同时处理语音、图像和文本,用户可随时打断。该模型采用「小脑」负责逐秒对话、「大脑」负责复杂智能体任务的可替换架构,大脑可换成 Codex 或 Claude Code 等系统而无需重训对话模型。测试中 Gander 在 Full-Duplex-Bench v3 上

正文结构化主题已通过公开置信门槛
量子位产品发布

剪映发布Hub与助手Agent,打通AI生视频与AI剪辑

剪映在抖音创作者大会上发布剪映Hub、剪映助手Agent等新功能,将AI视频生成与AI剪辑打通,用户可在无限画布生成素材后直接跳转多轨道剪辑界面继续编辑。PC端面向专业创作,提供Hub、剪映助手、AI后编辑、专业调色、杜比全景声及插件生态(首期计划上线20余个官方Skill);手机端则集成创作、剪辑、营销助手,支持随拍成片和语音操作。此举将原本分散的策划、生

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

剪映发布剪映Hub、AI助手小映等多项AI新能力

剪映于9月20日举办“AI新创作发布会”,推出专业版一站式创作工作台“剪映Hub”、智能创作Agent“剪映助手”及移动端AI创作助手“小映”,并升级“剪同款”模板范式与创作者生态。剪映Hub由无限画布与多轨道编辑器构成,可调用即梦、小云雀等平台生成素材;“小映”集成AI创作、剪辑与营销能力。剪映同步上线“AI Ultra会员”,并宣布每年投入约1.5亿元用

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Comfy-Org 发布适配 ComfyUI 的 Qwen3-VL 重打包模型

Comfy-Org 在 Hugging Face 上发布了 Qwen3-VL 的重新打包版本,将 Qwen/Qwen3-VL-4B-Instruct 和 Qwen/Qwen3-VL-8B-Instruct 转换为适配 ComfyUI 的单文件模型。该仓库提供 bf16、fp8 scaled、int8 convrot 和 nvfp4 等多种量化格式,用户需将文

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Swift-Qwen3.8-27B 去审查版 GGUF 量化模型发布

Hugging Face 用户 ajgazin 发布了 Swift-Qwen3.8-27B-Uncensored-Dynamic-MTP-GGUF,这是对已去审查(abliterated)的 Swift-Qwen3.8-27B 模型进行 GGUF 量化的版本。该模型采用 Unsloth Dynamic 3.0 量化布局,包含 MTP 头以支持 llama.c

正文结构化主题已通过公开置信门槛
ElevenLabs Blog一手来源产品发布

ElevenLabs 在 ElevenCreative 中推出 Ads Engine

ElevenLabs 在其 ElevenCreative 产品中推出 Ads Engine,首个能力是广告本地化:连接 Google Ads 和 Meta Ads 账户,拉取现有广告素材与效果数据,自动完成文本翻译、图像适配和视频配音(Dubbing V2 保留原说话人语气、情感与节奏),并将本地化版本推回 Google、Meta、LinkedIn。该产品旨

正文结构化主题已通过公开置信门槛
Runway Research一手来源模型发布

Runway 发布 Gen-4.5 视频生成模型,称登顶文生视频基准

Runway 发布视频生成模型 Gen-4.5,官方称其在 Artificial Analysis 文生视频基准上以 1247 Elo 分排名第一,在运动质量、提示词遵循和视觉保真度上达到领先水平。该模型基于 NVIDIA Hopper 和 Blackwell GPU 构建,在预训练数据效率与后训练技术上取得进展,并保持与 Gen-4 相当的速度、效率和订阅

正文结构化主题已通过公开置信门槛
Runway Research一手来源模型发布

Runway 发布通用世界模型 GWM-1 及机器人 SDK

Runway 发布通用世界模型 GWM-1,基于 Gen-4.5 构建,可逐帧实时生成并接受相机姿态、机器人指令、音频等交互控制。GWM-1 包含 GWM Worlds、GWM Avatars、GWM Robotics 三个变体,分别面向可探索环境、对话角色和机器人操作。Runway 同时发布 GWM-1 Robotics SDK,并宣布 Gen-4.5 新

正文结构化主题已通过公开置信门槛
Runway Research一手来源研究

Runway Research 发布多项世界模拟与生成式界面研究

Runway Research 发布了一系列研究成果,涵盖实时交互式世界模拟、生成式界面和实时对话角色等方向。其中 GWM Worlds 2 可将高保真视频与音频生成转化为实时交互模拟,支持 720p/24fps 视频与 48kHz 音频;Solaris 提出逐帧生成交互式 UI 的界面世界模型;Runway Characters 能从单张图像生成实时对话视

正文结构化主题已通过公开置信门槛
智东西商业

智元参投的千觉机器人再融数亿元,加码触觉具身模型

上海具身触觉公司千觉机器人宣布连续完成两轮数亿元战略融资,投资方包括蓝驰创投、中金资本旗下基金、靖亚资本等,此前已获高瓴创投、理想汽车、智元机器人等投资。资金将用于高精度视触觉传感器迭代与规模化交付、真实交互数据采集与触觉仿真数据集建设,以及触觉具身模型和触觉世界模型研发。公司已形成传感器、XTac数据采集、Xense Sim仿真、TacVerse数据集和X

9月19日周六 · 6 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Qwen3.8-Omni-Flash 以更低价格对标 Gemini Flash 多模态能力

Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可同时处理音频与视频并自主调用工具完成视频剪辑、短视频翻译、电影摘要等任务,上下文窗口达一百万 token。官方称其在音视频任务上接近 Gemini 3.8 Flash 的水平,但 API 定价更低:输入每百万 token 0.15 美元、输出 0.47 美元,音频输入每

正文结构化主题已通过公开置信门槛
智东西商业

IDC预测AI数据基础设施2035年达万亿,OceanBase卡位对标Databricks

IDC在2026外滩大会发布研究,重新划定AI数据基础设施市场边界,预测中国该市场将从2025年约149亿美元增长至2030年738亿美元,2035年达约1万亿人民币。报告建议企业采用“小模型微调+多模态数据底座”路径落地生产级AI。OceanBase以湖库一体AI数据库Lakebase、DataPilot等产品卡位该市场,并推进首轮A轮融资,目标对标Dat

正文结构化主题已通过公开置信门槛
量子位商业

虎鲸文娱启动鲸锐AI创作大赛,千万奖池最高单项200万

虎鲸文娱于9月17日正式启动虎鲸AI人才计划,并同步推出鲸锐AI创作大赛,设立1000万元总奖金池、265个获奖名额,其中最高单项奖金达200万元。大赛不限创作团队规模、AI工具和故事题材,要求用AI创作至少10分钟的原创首发完整故事作品,征集截止至11月22日。获奖者可入选虎鲸AI人才计划,并获得导演指导、行业沙龙、展映会等资源,旨在发掘兼具AI技术与内容

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.34.3 发布:API 展示思考控制,支持 Nemotron H 视觉模型

Ollama 发布 v0.34.3 版本,GET /api/show 接口现在会返回每个模型的思考控制选项及默认值(如 low/high/max)。该版本还新增对 Nemotron H 视觉模型在 Apple Silicon 上通过 MLX 的支持,修复了从 HuggingFace 拉取模型的问题,并改进了 macOS 应用窗口行为。

正文结构化主题已通过公开置信门槛
One Useful Thing观点

能力悬置:现有 AI 已足够强大,但几乎无人真正用起来

《One Useful Thing》作者指出,AI 发展速度远超人类制度与流程的适应能力,形成「能力悬置」——现有模型(如 GPT-6 Astra、Fable 5.1)已能可靠完成数周人类工作量,但绝大多数人几乎未加利用。作者以让 AI 将 1977 年文字冒险游戏 Zork 改造成 3D 动作游戏、用 Blender 为翁贝托·埃科书房做 3D 重建、以及

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布

Kimi K3 上线 Amazon Bedrock

Moonshot AI 的 Kimi K3 模型在 Amazon Bedrock 上线,据 Moonshot AI 称这是其最强模型,也是首个达到 2.8 万亿参数的开源模型,具备原生视觉能力和 100 万 token 上下文窗口,相比 Kimi K2 扩展效率提升约 2.5 倍。Kimi K3 是 Bedrock 上首个支持显式提示缓存的开源权重模型,可降

9月18日周五 · 3 条
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

Google 携手设计师用 AI 共创时装周造型与秀场工具

Google 的 Envisioning Studio 在 Google Labs 支持下,与设计师 Jane Wade 和 Sergio Hudson 合作,利用 AI 创意工作室 Google Flow 打造了两款定制工具:Styling Suite 帮助 Jane 在制作实体样衣前虚拟完成整体造型搭配,Runway Visualization 帮助 S

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

BAT的AI云销售,困在MaaS内卷战中

雷峰网报道称,2026年国内云厂商为冲刺MaaS收入,将销售人均MaaS指标推高至千万元级,并数周内要求日均Token收入翻数倍,导致某区域团队十几人集体离职,被内部定性为管理事故。由于自研模型竞争力不足,销售转向转售智谱、Seedance等第三方模型,引发国产模型折扣战与云资源券补贴,Codex的额度重置机制又进一步截走客户预算。文章还描述了销售在批折扣、

正文结构化主题已通过公开置信门槛
量子位研究

阿里达摩院通用医疗影像AI模型RADAR登上Science

阿里达摩院联合浙大一院等机构研发的通用医疗影像AI模型DAMO RADAR登上Science,该模型可一次性识别腹部18种解剖结构的146种疾病,在近3.9万例内部队列中平均AUC达0.913,外部8家医院2.4万例验证AUC为0.895。人机对比中RADAR准确率超过26名放射科医生中的23名,医生在AI辅助下读片敏感度提升约10%、阅片时间减少30%以上