返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月24日周一 · 3 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

智象未来发布原生全模态世界模型HiDream-O1-World,登顶WBench

在世界机器人大会期间,智象未来创始人梅涛发表演讲,提出高IQ不等于全能,强调世界模型需融合理解、生成与交互能力。公司发布了原生全模态交互式世界模型HiDream-O1-World,基于自研UiT架构,在WBench Navi分榜登顶,支持文本、图像和交互式操控输入,具备漫游、编辑、交互能力。该模型旨在推动具身智能仿真和AI互动影游等应用,并计划通过数据、模型

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

阿里视频大模型Wan3.0正式上线,主打稳定真实有质感

阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,支持单次生成30秒视频及多种文档格式输入,在生成时长、真实世界还原等维度升级。企业用户反馈其表现稳定、真实、有质感,已进入短剧、影视、广告等生产流程。即日起可通过阿里云百炼等平台体验,并推出限时7折优惠。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10598 发布:改进图像缩放算法并优化速度

llama.cpp 发布 b10598 版本,主要更新为 mtmd 模块使用更精确的 Pillow 图像缩放算法,并修正了所有模型的 resize algo 参数,同时进行了速度优化。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO

8月23日周日 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化

protoLabsAI 发布了 Ornith-1.5-9B 模型的 GGUF 量化版本,内置蒸馏 MTP 草稿头,支持 llama.cpp 的无损多 token 自推测解码,无需单独草稿模型。该版本针对不同硬件提供多种量化档位,其中 NVFP4 在 Blackwell 上速度最快(299 tok/s),IQ4 XS 适合 6GB 显存,但 IQ2 M 在长文

正文结构化主题已通过公开置信门槛
量子位产品发布

匿名模型Ox Alpha身份成谜,社区通过技术指纹猜测智谱或谷歌

匿名模型Ox Alpha(昵称“牛来大模型”)在OpenRouter上线后引发身份猜测,社区通过Tokenizer、视频token消耗和API报错等证据,认为其与智谱的GLM系列高度相似,也有人怀疑是谷歌Gemini 3.5 Pro。该模型拥有104.86万token上下文,支持多模态输入,在代码和Agent任务上表现亮眼,但评测结果存在分歧。目前身份尚未揭

8月22日周六 · 9 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10580 发布:支持 dots3-note 视觉与音频

llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、Ope

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen-3.8-27B 去审查版 8 位 MLX 量化发布

junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

RayNeo 发布无摄像头 AI 眼镜,专注文本叠加

RayNeo 发布新款 AI 眼镜 RayNeo iO,无摄像头和扬声器,通过绿色波导显示屏在视野中叠加文字,透明度 97%,亮度约 1300 尼特。眼镜可监听对话、总结内容、提取行动项并建议日历条目,用户可通过点头确认,还支持提词器模式和 40 种语言的语音转文字翻译。设备内置四个麦克风和骨传导传感器,麦克风激活时 LED 亮起。出厂预装 RayNeo A

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

SenseNova-U1-8B-MoT-Merger-gguf 模型发布,支持 ComfyUI 8G 显存

Hugging Face 上发布了 SenseNova-U1-8B-MoT-Merger-gguf 模型,该模型基于 SenseNova-U1-8B-MoT,支持在 ComfyUI 中运行,并针对 8GB 显存进行了优化。模型提供 Q4 和 Q6 量化版本,并展示了文本到图像生成的测试效果。

正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.18 发布:新增多模型支持与性能优化

SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 编码专用 GGUF 量化系列发布

quimmedes 发布了 Qwen3.8-27B 的 GGUF 量化版本(XYZ 系列),专注于编码任务,提供从 Q1Q 到 Q8 及 ULTRA 的多种量化档位,并支持 MTP 投机解码和视觉投影。该系列通过每张量量化配方保留关键张量精度,并针对代码测试套件优化,但明确不追求通用知识性能。用户可通过 llama-server 使用 OpenAI 兼容 A

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Deepseek发布实验性视觉模型,智能体基准接近Opus 4.8

中国AI公司Deepseek发布了实验性多模态模型V4-Flash-Vision-Exp,在图像理解基础上保持文本性能,其内部基准测试显示在智能体任务上接近Opus 4.8。该模型支持多种图像输入方式,并兼容OpenAI和Anthropic的API,同时更新了Harness框架。定价与V4-Flash一致,单次请求最多可处理600张图像。

正文结构化主题已通过公开置信门槛
智东西商业

阿里多模态模型全面开花,跻身全球第一梯队

阿里巴巴在过去一个月密集发布大语言、图像、语音、视频、音乐等多模态模型,性能均跻身国际第一梯队,其中Qwen3.8-Max在Agentic榜单登顶全球第一,Qwen系列全球下载量突破30亿次。多模态模型已进入商业化场景,带动阿里云AI相关收入快速增长,AI相关产品收入连续12个季度三位数同比增长。阿里正通过全栈AI底座和多模态布局,推动AI从技术投入转化为规

正文结构化主题已通过公开置信门槛
智东西模型发布

DeepSeek发布多模态模型V4-Flash-Vision-Exp,API价格低至0.001元/图

DeepSeek于8月21日发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并上线API平台,支持图像理解,单张图片最高费用0.001152元。该模型在视觉Agent基准上接近Opus 4.8,同时兼容多种API格式,并推出免费的Files API。此举补齐了DeepSeek在多模态API方面的空白,可能降低多模态应用的成本门

8月21日周五 · 6 条
正文结构化主题已通过公开置信门槛
Strands Agents SDK Releases一手来源产品发布

Strands Agents SDK TypeScript v1.14.0 发布

Strands Agents SDK 发布了 TypeScript 版本的 v1.14.0 更新,包含多项新功能、修复和文档改进。主要新功能包括音频内容块、文件内存存储、上下文管理器卸载策略、工具上下文中的执行范围取消、代理作为工具委托、MCP 客户端 OAuth 认证以及 Anthropic 提示缓存支持。修复了多个与 Bedrock 缓存、多代理令牌计数

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

商汤开源SenseNova U1.5 Lite:支持超长指令与原生4K视觉创作

商汤科技正式开源轻量级多模态大模型 SenseNova U1.5 Lite,该模型支持3-4k超长指令、原生4K输出和精细图像编辑,旨在提升真实视觉创作任务的稳定性和可控性。模型采用NEO-unify统一架构和MOPD蒸馏技术,以8B参数实现高性价比,并已在GitHub、Hugging Face等平台开放。

正文结构化主题已通过公开置信门槛
Spring AI Releases一手来源产品发布

Spring AI 2.0.1 发布:新增音频流与工具调用限制支持

Spring AI 发布 2.0.1 版本,包含多项新功能和错误修复。新功能包括支持 OpenAI 音频流、可配置工具调用限制、Google GenAI 的 ToolChoice 支持、Google 图像生成支持等。错误修复涉及 Redis 聊天内存、PDF 文档读取、OpenAI 流关闭等问题。该版本还移除了弃用的 Mistral AI 聊天模型,并更新了

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Hugging Face 发布 tiny-random-gemma4 测试模型

Hugging Face 上出现了一个名为 optimum-intel-internal-testing/tiny-random-gemma4 的测试模型,基于 google/gemma-4-E2B-it 生成,用于内部测试。该模型通过脚本配置了极小的隐藏层大小和注意力头数,并包含文本、音频和视觉模块。脚本还演示了使用 OpenVINO 和 Optimum

正文结构化主题已通过公开置信门槛
FastGPT Releases一手来源产品发布

FastGPT v4.16.1 发布:沙盒镜像更新与工具 Schema 迁移

FastGPT 发布 v4.16.1 版本,主要更新包括:Agent Sandbox 镜像地址改为完整运行态镜像,并支持自定义 apt 源;MCP/HTTP 工具的 JSON Schema 统一为字符串存储,需按顺序执行迁移脚本;新增第三方发布渠道支持多模态文件、音频转录和引用,支持团队安装系统插件(进程模式)。此外,优化了 S3 key 命名、修复了多个工

正文结构化主题已通过公开置信门槛
量子位产品发布

明略科技携手海康机器人亮相世界机器人大会,布局具身智能

明略科技与海康机器人联合参展2026世界机器人大会,展示餐饮清洁、工业物流、智能巡逻等商业服务场景的具身智能解决方案。明略科技正式布局具身智能赛道,其CEO吴明辉在大会主论坛发表演讲,强调机器人下半场的关键是“大脑”,并计划通过开源平台Octo实现人机协同的组织智能。此次合作旨在将数字世界的Agent能力延展至物理世界机器人,推动商用服务机器人的规模化应用。