百度千帆更新:新增视觉模型、RAG增强及工作流优化
百度千帆平台于2025年10月24日发布多项更新,包括支持InternVL3.5-14B模型导入部署,上线Qwen3-VL系列视觉理解模型,并增强deepseek-v3.2的FIM补全和前缀续写功能。同时,知识库检索API简化参数并支持知识图谱开关,新增法律法条解析模板,以及高中作文打分和AI绘本组件。此外,工作流对话接口超时限制延长至30分钟,并新增撤销/
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
百度千帆平台于2025年10月24日发布多项更新,包括支持InternVL3.5-14B模型导入部署,上线Qwen3-VL系列视觉理解模型,并增强deepseek-v3.2的FIM补全和前缀续写功能。同时,知识库检索API简化参数并支持知识图谱开关,新增法律法条解析模板,以及高中作文打分和AI绘本组件。此外,工作流对话接口超时限制延长至30分钟,并新增撤销/
Google 在 Gemini API 中公开发布了 Veo 3.1 和 3.1 Fast 模型,新增了视频扩展、多图像参考和首尾帧生成等功能,并提供了更多视频时长选项。同时宣布旧版 Veo 3.0 预览模型将于 2025 年 11 月 12 日关闭。
Gemini API 于 2025 年 9 月 25 日发布 Gemini Robotics ER 1.5 模型预览版,用于机器人应用。同时推出 gemini-2.5-flash-preview-09-2025 和 gemini-2.5-flash-lite-preview-09-2025 两个预览模型。
Gemini API 于 2025 年 9 月 23 日发布新原生音频模型 gemini-2.5-flash-native-audio-preview-09-2025,用于 Live API,改进了函数调用和语音截断处理。该模型旨在提升实时音频交互体验,相关指南已更新。
阿里巴巴推出Qwen-Image-Edit,基于20B参数的Qwen-Image模型,结合Qwen2.5-VL和VAE编码器,实现语义和外观编辑,支持中英文精确文本编辑。在多个公开基准上达到SOTA性能,已在Qwen Chat上线。该模型可应用于IP创作、物体旋转、风格迁移、背景调整等场景,并通过链式编辑逐步修正图像细节。
Gemini API 于 2025 年 7 月 17 日发布了 veo-3.0-generate-preview,这是 Veo 系列的最新更新,支持生成带音频的视频。同时,Imagen 4 Standard 和 Ultra 的速率限制已提高,更多详情可参考官方文档。
GLM 平台于 2025 年 6 月 18 日接入两个 Vidu 视频生成模型:Vidu Q1 和 Vidu 2。Vidu Q1 聚焦高质量视频创作,输出 5 秒 1080P 内容,优化画质和首尾帧转场;Vidu 2 平衡速度、质量与成本,支持图生视频和首尾帧功能,输出 4 秒 720P 内容,增强语义理解与多参考图一致性。这两个模型分别适用于影视、广告、动
Gemini API 于 2025 年 5 月 20 日发布多项更新,包括支持自定义视频预处理、多工具使用、异步函数调用及实验性 URL 上下文工具。同时发布了多个新模型,如 gemini-2.5-flash-preview-05-20、TTS 模型、实时音乐生成模型、原生音频对话模型以及 Gemma 3n 预览版。这些更新增强了 API 的功能性和模型多样
Google 于 2025 年 3 月 12 日发布 Gemini API 更新,推出支持图像生成和编辑的实验性 Gemini 2.0 Flash 模型,并发布 Gemma 3 系列中的 gemma-3-27b-it 模型,可通过 AI Studio 和 Gemini API 使用。API 新增对 YouTube 链接和小于 20MB 内联视频的支持。
谷歌发布了 Gemini 2.0 Flash 实验版,该模型速度是 Gemini 1.5 Pro 的两倍,支持双向流式传输、多模态响应生成(文本、图像和语音)以及内置工具使用(如代码执行、搜索和函数调用)。此次发布标志着 Gemini 系列在性能和功能上的重大升级。
Google 在 Gemini API 中发布了 Gemini 1.5 Pro 预览版,以及新的文本嵌入模型 text-embeddings-004,支持弹性嵌入尺寸。API 新增了 File API 用于临时存储媒体文件,并支持多模态提示、系统指令(测试版)、函数调用模式和 JSON 响应格式。这些更新增强了开发者的灵活性和功能。
Gemini API 于 2023 年 12 月 13 日发布更新,推出 gemini-pro、gemini-pro-vision、embedding-001 和 aqa 等新模型,并更新 API 版本和功能。新增 GenerateContent 统一端点、流式支持、多模态图像输入、函数调用和 AQA 等测试版功能,但暂不支持模型调优。
Chip Huyen 在其博客文章中深入探讨了多模态与大型多模态模型(LMMs)的概念,指出自然智能需要处理多种数据模态,并介绍了多模态系统的类型、基础训练方法(如 CLIP 和 Flamingo)以及当前的研究方向(如生成多模态输出和适配器)。文章强调了多模态在医疗、机器人等领域的必要性,并提及了 GPT-4V 等模型。