返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月17日周一 · 12 条
正文结构化主题已通过公开置信门槛
量子位模型发布

HelixWorld 1.0发布:实时可交互音视频世界模型,将完全开源

Noiz AI联合香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员发布了实时可交互音视频世界模型HelixWorld 1.0,支持24 FPS画面和48kHz立体声实时生成,画面与声音由原生Transformer架构统一生成。该模型通过四步技术路线实现声画同步响应动作,并将在未来几周完全开源。团队认为这补上了世界模型在声音方面的短

正文结构化主题已通过公开置信门槛
Qwen Model Repository Activity一手来源模型发布

Qwen3.8开源:首次推出Qwen-Max级模型,强化智能体与编码能力

Qwen团队在GitHub上发布了Qwen3.8系列模型,包括Qwen3.8-27B和Qwen3.8-2.4T-A95B,首次将Qwen-Max级模型开源。该系列在编码、专业工作、研究和长程智能体任务上性能显著提升,并支持推理深度调节和思考上下文保留。同时,Qwen3.6和Qwen3.5的更新也增强了智能体编码和全球语言覆盖。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

RA-Bench:AI生成视频检测基准揭示现有检测器在危机事件中的不足

Hugging Face 每日论文页面发布了一篇关于AI生成视频检测的论文,提出了新基准RA-Bench,包含17,886个视频,评估了多个检测器和生成器。研究发现当前检测器在真实危机事件视频上泛化能力差,且社交媒体传播会降低检测可靠性。该研究强调了开发更鲁棒检测器的必要性。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog产品发布

Markdown SVG 渲染器新增 MP4 转换功能

Simon Willison 更新了他的 markdown-svg-renderer 工具,新增了将 SVG 动画转换为 MP4 视频的功能。该工具在浏览器中运行,利用 ffmpeg.wasm 将 SVG 渲染为帧并编译成 MP4,便于在不支持 SVG 动画的平台上分享。此前该工具已支持将 SVG 渲染为 PNG 和 JPEG 格式。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

Qwen 3.8 27B评测:性能出色但默认过度思考

阿里Qwen实验室发布Apache 2.0许可的Qwen 3.8 27B视觉语言模型,作者Simon Willison在本地设备上测试后发现其默认推理强度为xhigh,导致模型对简单任务过度思考,生成耗时极长。作者建议用户将推理强度调低或关闭,并展示了模型在生成SVG和边界框标注方面的优秀能力。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

AtomicChat 发布 Qwen3.8-27B GGUF 量化模型

AtomicChat 发布了 Qwen3.8-27B 的 GGUF 量化版本,基于 Qwen 原始权重并使用自己的重要性矩阵进行量化。该模型支持文本生成和多模态(图像)输入,提供了多种量化级别,并附有详细的量化分析、运行指南和速度测试。用户可通过 llama.cpp 或 Atomic Chat 应用本地运行该模型。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Nail-Qwen3.6-35B-A3B-GGUF:高效量化模型,提升推理速度与对话质量

peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF,这是基于 Qwen3.6-35B-A3B 的 4-bit 量化模型,采用改进的聊天模板和强制系统提示,旨在减少过度思考、工具调用失败和冗长输出。在基准测试中,Nail 在响应速度和多轮对话质量上优于 Qwen3.6-27b 及其微调版本,但在长上下文任务中,其密集版

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节发布Seedream 5.0 Pro:多模态图像生成模型实现四大能力突破

字节跳动旗下Seed Research团队正式发布多模态图像生成模型Seedream 5.0 Pro,相比前代在图文对齐、结构连贯性、文本渲染和视觉美学等基础能力上全面提升,并引入复杂信息可视化、交互式精准编辑、真实感图像与肖像纹理、原生多语言输入与生成四大核心能力突破。该模型能生成高密度信息图表、支持像素级编辑操作,并可直接处理十多种语言的输入与高质量渲染

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节跳动发布 Seed Audio 1.0 场景级音频生成模型

字节跳动旗下 Seed Research 团队发布了 Seed Audio 1.0 音频生成模型,该模型能在统一框架内生成语音、音效、环境音等场景级音频元素,支持 20 多种语言、最长两分钟的单次生成,并具备 100 毫秒级别的对话时序控制能力。该模型旨在帮助创作者从拼接音频片段转向导演式的声音场景创作,提升叙事音频、视频配音、游戏本地化等场景的制作效率。

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源商业

字节跳动Seed启动2027届基础模型校招

字节跳动Seed团队宣布2027届校招正式启动,面向2026年9月至2027年8月毕业的本硕博学生及2027年9月后毕业的实习生。招聘方向涵盖基础模型、视觉智能、语音智能、机器学习系统、LLM应用和具身智能等领域。团队强调提供充足算力、数据和工程资源,并设有针对AI人才的额外激励计划。工作地点包括北京、上海、深圳、杭州、新加坡、圣何塞和西雅图。

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节发布 SeedRealtime 音视频全双工大模型,实现多模态自然交互

字节跳动旗下 Seed Research 正式发布 SeedRealtime,一款原生音视频全双工大语言模型。该模型采用统一架构原生融合音频、视频和文本,实现实时多模态交互,具备联合音视频理解、主动交互和自然对话节奏三大突破。端到端评估显示,相比级联模型,其音视频对话节奏问题减半,并已在行业率先实现大规模部署。

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节跳动发布Seedance 2.5视频生成模型,支持30秒长叙事与多模态参考

字节跳动旗下Seed Research正式发布新一代视频生成模型Seedance 2.5,支持单次生成30秒高质量音视频片段,并可通过多轮扩展生成数分钟的长视频。该模型在多模态参考(最多30张图片、10个视频和10个音频片段)和编辑能力(如时间戳级控制、绿幕、镜头视角)上实现重大升级,旨在提升长叙事、创意控制和生产力。Seedance 2.5已在即梦AI、豆

8月16日周日 · 5 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LuffyTheFox 发布基于 Qwen3.6 的无审查多模态 MoE 模型 GGUF 版

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 GGUF 版本,采用其自研的 Genesis 算法进行张量噪声修复,并融合了 Hermes 微调数据以增强 agent 能力。该模型支持中英文,旨在提升指令遵循和上下文清晰度,并提供了量化脚本和推荐配置。

正文结构化主题已通过公开置信门槛
量子位观点

李飞飞访谈:AI是能力放大镜而非替代者

李飞飞在Huberman Lab访谈中表示,AI不是人类的替代者,而是个人能力的放大镜。她回顾了视觉在AI发展中的基石作用,从ImageNet到Sora的演进,并指出AI缺乏私人情感体验和真正的共情。她强调AI在医疗等领域的辅助价值,主张全社会共同参与AI治理,而非仅由科技企业决定。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Lightricks 发布 LTX-2.3 开放权重音视频生成模型

Lightricks 发布了 LTX-2.3,这是其 LTX-2 联合音视频基础模型的重大更新,提升了音频和视觉质量以及提示遵循能力。该模型基于 DiT 架构,可生成同步的视频和音频,并提供多种检查点,包括完整版、蒸馏版和上采样器。模型权重开放,支持本地运行,并提供了 ComfyUI 和 PyTorch 代码库等集成方式。

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.32.14 发布:修复 WebP 图像转码与 Qwen 渲染器

Ollama 发布了 v0.32.14 版本,主要修复了 llama-server 对 WebP 图像的转码问题,并让 Qwen 渲染器能容忍非开头的系统消息。该版本更新了变更日志,用户可通过 GitHub 查看完整变更。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-35B-A3B 未审查多模态模型 Genesis Hermes V7 发布

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的未审查多模态 MoE 模型 GGUF 版本,名为 Genesis Hermes V7。该模型通过其自研的 Genesis 算法对张量进行噪声修复,并融合了 Hermes 微调数据,旨在提升模型稳定性和指令遵循能力。模型支持多语言和视觉任务,并提供了量化脚本和推荐配置。

8月15日周六 · 3 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

MiniMax H3 量化权重集合发布,支持消费级 GPU 本地运行

Hugging Face 上出现了一个社区整理的 MiniMax H3 量化与剪枝权重集合,支持 INT4、INT8、混合精度及 NVFP4 格式,旨在让消费级 GPU(16-24GB 显存)用户通过 ComfyUI 本地运行 MiniMax H3 的多模态视频生成模型。该集合提供了针对不同显卡的下载指南,并包含文本编码器和 VAE 文件。MiniMax H

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源产品发布

Xinference v3.2.0 发布:新增多模型支持与副本扩展功能

Xinference 发布 v3.2.0 版本,新增多项功能,包括在 /v1/chat/completions 中支持 logprobs、支持部署 R3-embedding-0.6b 和 R3-rerank-0.6b 模型、支持 jina-reranker-v3.5 的 listwise API、OCR API 支持 PDF 输入、新增 DeepDoc OC

正文结构化主题已通过公开置信门槛
THE DECODER研究

新基准测试显示AI模型视觉感知能力仍差

Moonshot AI 推出了 PerceptionBench 基准测试,用于独立评估多模态模型的视觉感知能力,不涉及逻辑推理和外部知识。测试结果显示,包括 GPT-5.6 Sol、Kimi K3 和 Claude Fable 5 在内的所有领先模型均表现不佳,最高准确率仅为 59.7%。作者指出,许多所谓的推理错误实际上源于视觉感知缺陷。该基准测试基于真实