AgentScope v2.0.7.post1 发布:新增 GoalPipeline 与多模态支持
阿里 AgentScope 发布 v2.0.7.post1 版本,包含多项修复和功能更新。主要改进包括:从媒体类型自动推导音频格式、排除 Gemini 工具执行 token、支持原生多模态工具输出、新增 GoalPipeline 管道模块、达到最大迭代次数后生成最终文本摘要、修复 WebUI 会话隔离、追踪中断的聊天响应、保留 OpenAI Response
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
阿里 AgentScope 发布 v2.0.7.post1 版本,包含多项修复和功能更新。主要改进包括:从媒体类型自动推导音频格式、排除 Gemini 工具执行 token、支持原生多模态工具输出、新增 GoalPipeline 管道模块、达到最大迭代次数后生成最终文本摘要、修复 WebUI 会话隔离、追踪中断的聊天响应、保留 OpenAI Response
AWS 博客介绍了如何通过 Amazon Quick 和 fal 构建代理式创意工作流。Amazon Quick 作为代理工作区和编排层,fal 提供超过 1000 个生成式媒体模型,两者通过 Model Context Protocol (MCP) 标准接口连接。该方案支持故事板和音乐视频概念原型制作,通过 Skills 编码可复用流程,并在关键创意节点引
AWS宣布Amazon Bedrock在印度支持OpenAI GPT-5.6模型(Terra和Luna),通过印度地理跨区域推理,确保数据在印度境内处理,满足金融、医疗和公共部门的数据驻留要求。模型支持100万token上下文窗口,可处理文本和图像输入。文章介绍了如何使用推理配置文件、控制台和API(包括OpenAI Responses API和Bedroc
Google Research 推出行星预测引擎(PPE),作为 Earth AI 计划的一部分,该实验性研究系统能自主执行从数据发现到模型训练的完整地理空间建模流程。在公共卫生、粮食安全、环境风险和社会经济等领域的测试中,PPE 相比人工专家流程显著提升了预测精度,例如将疾病健康指标的 R² 从 60.0% 提升至 76.8%,并将建模时间从数周缩短至数分
谷歌发布了Gemini Omni 1.1 Flash视频生成模型,支持场景扩展、风格参考和关键帧控制,并新增360p草稿模式,速度提升60%,成本降低至720p的三分之一。该模型通过Google AI Studio和开发者文档提供,定价按秒计算,从360p的0.03美元到4K的0.30美元不等。
Google DeepMind 发布了 Gemini Omni 1.1 Flash,这是一套面向开发者的生成式视频工具,通过 Gemini API 在 Google AI Studio 中提供。新功能包括场景扩展(支持最多 10 秒上下文,可延长至 40 秒)、首尾帧指定、360p 快速预览(比 720p 快 60% 且成本低三分之一)、最高 4K 分辨率放
麻省理工学院、香港科技大学(广州)和清华大学的研究团队提出了一种基于视觉语言模型(VLM)的自动多粒度图表示方法,用于从建筑平面图图像中构建任务自适应的图结构。该方法通过节点识别、边推断、文本解析和图粗化等步骤,在147个学术图书馆平面图上验证了有效性,生成的图与人工标注高度一致,且不同粒度的图在不同任务中表现各异。该研究将平面图转化为知识表示,有望提升建筑
NVIDIA 以 130 亿美元收购 HuggingFace,约为其 1.5 亿美元 ARR 的 80 倍,较 2026 年 1 月 70 亿美元的报价近乎翻倍。同时,Z.ai 正式发布 GLM-5.3-Flash(即 Ox Alpha),这是一个 320B 总参数、18B 激活参数的 MIT 许可多模态模型,支持 1M 上下文,完全运行在中国 AI 芯片上
Gemini API 发布了 Gemini Omni Flash 的正式版(GA),该模型支持快速、对话式的视频生成与编辑。新功能包括视频扩展、首尾帧插值以及分辨率控制(最高支持 4K)。现有预览端点将于 2026 年 9 月 30 日弃用。
Qwen 发布了新的开源权重模型 Qwen3.8-Flash-Next,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览。模型总参数为 125B,但仅有 6B 激活,性能显著提升。作者 Simon Willison 在 DGX Spark 上使用 Unsloth 量化版本进行了测试,并分享了初步体验。
阿里巴巴发布了Qwen3.8-Flash-Next模型权重,作为Qwen4架构的预览,供开发者实验和评估。该模型是一个多模态MoE模型,主模型125B参数,附加51B N-gram嵌入,每token激活6B参数,原生上下文窗口262,144 token,可通过YaRN扩展到1M。NVIDIA提供了Day 0功能支持,包括SGLang、vLLM和TensorR
Google DeepMind 发布了 Gemini 3.5 Transcribe,一款高精度语音转文字模型,支持实时流式与预录音频处理,具备智能转录、函数调用、自定义词汇、85+ 语言及多说话人识别等功能。该模型已集成到 Gemini API、Google AI Studio 及 Gemini Enterprise Agent Platform,并应用于
Hugging Face 发布 Transformers 库 v5.16.1,重点支持 GLM-5.3-Flash 模型。该模型是 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数,性能超越 GLM-5.2,价格仅为十分之一,在编码和智能体基准上接近 Claude Opus 4.8。此外,该版本还包含若干小修复,如恢复张量并行
Hugging Face Transformers 库发布 v5.16.0,新增多个模型支持,包括 Qwen4-Exp、GraniteSpeech5、Step3p7、CohereCompass 以及 ESMC 和 ESMFold2。这些模型覆盖了混合架构、语音识别、视觉语言、蛋白质语言与折叠等领域,提升了 Transformers 对前沿模型的支持能力。
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安
本文提出VIB-ICL框架,基于信息瓶颈原理解释多模态上下文学习中视觉上下文何时有效或被忽视。作者引入跨模态信息增益(CMIG)量化视觉信息的额外贡献,并证明视觉忽视在信息冗余时是最优解。实验显示该方法在五个基准上提升准确率最高4.7%,并减少35%的演示需求。
腾讯微信视觉团队发布了WeMM-Embedding,一个支持文本、图像、视频和交错输入的多模态嵌入模型系列,包含2B、4B和9B三种规模。该模型在MMEB-v2基准上,2B版本已超越此前领先的8B开源基线,9B版本以80.6分创下新纪录。模型已在微信视频号、公众号、朋友圈和电商等场景大规模部署,并在14个在线A/B测试中表现一致提升。模型权重和代码已在Git
智谱AI发布了GLM-5.3-Flash原生多模态模型,该模型具备视觉能力,能主动观察界面、渲染与交互反馈,实现代码、浏览器与图形界面的协同闭环。模型采用线性注意力与稀疏注意力混合架构,总参数320B,激活18B,计算量与KV缓存较GLM-5.3大幅降低。此外,该模型拓展至Office文档与金融研究工作流,能自主拆解复杂目标、调用工具并优化输出。
另有 1 家信源报道
Google 发布了 Gen AI Python SDK 的 v2.20.0 版本,新增了音频转录配置模式、环境文件支持、Scotty 文件下载辅助功能,并在 VideoContent.MimeType 枚举中添加了 JPEG2000 类型。这些更新增强了 SDK 的多媒体处理能力和文件管理功能。
Google Research 发布了 AgentHands,一个基于 LLM 的 XR 原型系统,通过同步的、富有表现力的手部手势为对话代理提供空间锚定的指导,以弥合心理映射差距并增强用户在物理任务中的参与度。该系统利用眼动追踪和场景重建进行对象注册,并构建了包含指示性、象形性和表达性三类手势的库,通过词级时间戳实现语音与手势的同步。在 CHI 2026