智象未来 vivago R1 全球上线,国内版「够搭」升级发布
智象未来(HiDream.ai)于2026年9月8日全球上线内容创作智能体 vivago R1,国内版本「够搭」同步升级发布。R1 主打一次性稳定输出5分钟高质量视频并支持无限次多轮延长,通过主/子 Agent 协同完成脚本、分镜、角色、场景与音效,并依托自研 HD-AgentOS 将内容有效可用成功率提升至85%。产品采用 Chat-First 对话式创作
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
智象未来(HiDream.ai)于2026年9月8日全球上线内容创作智能体 vivago R1,国内版本「够搭」同步升级发布。R1 主打一次性稳定输出5分钟高质量视频并支持无限次多轮延长,通过主/子 Agent 协同完成脚本、分镜、角色、场景与音效,并依托自研 HD-AgentOS 将内容有效可用成功率提升至85%。产品采用 Chat-First 对话式创作
在ECCV 2026上,中国科技公司钛动科技牵头举办了唯一聚焦Agentic Commerce方向的MARS2 Workshop,牛津、MIT等机构学者参与分享多模态AI前沿研究。配套的MARS2多模态AI挑战赛设置三条赛道,基于3108支广告视频构建的M-CAR数据集,吸引64支全球团队提交超1060份方案,奖金池10万美元。结果显示模型整体理解广告内容尚
另有 1 家信源报道
在ECCV 2026上,中国公司钛动科技牵头发起了MARS2 Workshop,这是本届大会唯一由中国科技公司牵头举办的Agentic Commerce方向Workshop。该Workshop同期举办多模态推理挑战赛,设置10万美元奖池,吸引全球64支团队提交超1060份方案,并开源了M-CAR基准数据集及代码库。赛事结果表明当前多模态模型在System 2
另有 1 家信源报道
ECCV 2026 将于 2026 年 9 月在瑞典马尔默开幕,共接收 2883 篇论文(接收率 27.5%),86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,密度为 ECCV 历史之最,Yann LeCun、Jürgen Schmidhuber 等将作 keynote。文章认为这标志 AI 竞
腾讯云 AI 团队在开发者社区介绍其文档智能教育产品线,将作业批改链路拆为切题、识别、批改、回显四步,并封装为试题批改 Agent 与作文批改 Agent,覆盖 K12 全学科及中英文手写作文,输出正误、得分、知识点与错误坐标等结果。作文批改走异步接口(SubmitMarkEssayAgentJob),默认并发限制 2 次/分钟,底座为千亿参数多模态大模型与
腾讯云文档智能推出试卷切题原子能力 QuestionSplitOCR,可将整页试卷按题目边界自动拆分,并输出题干、选项、答案、图形、表格五类带四角坐标的语义区域,同时直接返回切好的题目图片和 LaTeX 公式。接口提供默认模型与多模态推理模型两种选择,分别偏向结构化全面与坐标精准,并支持切边增强、弯曲矫正、PDF 解析等拍照预处理开关。该能力面向题库建设、在
IDC中国企业软件市场研究经理王楠在2026 Inclusion·外滩大会论坛上分享研究,预测中国AI数据基础设施市场2025年至2030年将以37.7%的复合增速增长,2030年规模达738亿美元,2035年有望达1548亿美元。报告将市场划分为AI数据平台、AI数据智能和AI数据服务三大领域,其中AI数据智能增速最快。文章指出AI瓶颈正从模型能力转向企业
OpenAI发布新一代生图模型ChatGPT Images 2.5,主打生成更快、细节更好、改图更可控。相比Images 2.0,生成延迟最多降低50%,新增xhigh和max质量档位,并支持在图片上直接批注修改、用草图作为参考图以及多轮编辑一致性。面向开发者同步推出GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst两个AP
另有 2 家信源报道
OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I'm Not a Robot》全部 48 关,从图片识别到拖拽、停车、节奏控制等动态任务,形成视觉理解、GUI grounding、状态保持与动作执行的闭环。Astra 在 ScreenSpot-Pro 达 92.7%、OSWorld 2.0 达 72.6%
DeepSeek 正式发布 DeepSeek-V4.1-Flash 模型,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,并公布了 GPQA Diamond、HLE、Codeforces 等多项基准成绩。该模型已同步上线 DeepSeek API,调用模型名改为 deepseek-flash,旧版 V4 Flash 与 V4 Flash
另有 1 家信源报道
Qwopus3.8-27B-Flash 是基于 Qwen3.8-27B 微调的多模态模型,旨在降低推理成本与响应时间,提升智能体任务的效率。模型通过两阶段训练(SFT 和 NeMo-RL+GSPO 强化学习)实现 12.8% 的加速解码和 80.7% 的 MTP 接受率,但 MMLU-Pro 分数略低于基础模型。该模型支持视觉、工具调用和代码生成,已知问题为
腾讯云 AI 团队发布一篇开发者社区文章,系统讲解腾讯云文字识别 OCR 的发票识别接口选型与实操。文章区分了通用票据识别、增值税发票识别、OFD 发票识别、增值税发票核验、银行回单识别、医疗票据识别等接口的适用场景,并给出 SDK 代码示例、QPS 限制、常见报错处理,以及专业 OCR 与大模型多模态识别在字段定位、结构化稳定性、成本上的对比。
字节跳动提出 AgenticGen,一个面向广告视频生成的奖励引导智能体框架,将生成过程拆解为策略选择与草稿生成两个可训练推理阶段。该方法从在线投放反馈中学习基于表现的奖励模型,并结合人工标注的评分标准奖励模型,先通过 DPO 对齐在线偏好,再用 GRPO 以过程与结果奖励进一步优化。在 TikTok 广告系统的在线 A/B 实验中,相比 SFT 基线,CT
该论文提出一种无需训练的多智能体推理框架,用于从口语对话中推断说话人之间的关系。框架包含两种设计:多角色多智能体辩论(MRMAD)为智能体分配互补角色或社会理论视角;多智能体竞争(MAC)通过成对裁决比较假设并淘汰较弱候选。在 Seamless Interaction 数据集上的实验表明,这些方法在多数情况下优于零样本和现有多智能体基线,但声学线索仍未被当前
UT Southwestern 等机构的研究者发布 OASIS,一个基于评分量规(rubric)的多模态评估平台,可用大语言模型对视频、音频和文本进行结构化打分。平台提供命令行工具与集成栈,支持托管 API 或通过 Ollama、vLLM 等自托管开源模型,并具备量规版本管理、执行溯源和人工复核状态。该系统自 2023 年秋季起在 UT Southweste
研究提出 M2LG-DG,一个仅用源域数据的多模态局部-全局域泛化框架,用于跨站点重性抑郁障碍(MDD)分类。该框架采用双流 rs-fMRI 编码器(全局自注意力与局部图约束聚合),将影像与非影像表征分解为共享与私有成分,并通过双向交叉注意力与模态门控融合,同时用跨站点监督对比目标构建正样本对。在四个留出的 REST-meta-MDD 站点上取得 69.48
该研究提出一个融合框架,将RAD-DINO的单模态视觉表征与BioViL-T的视觉-语言表征在潜在空间中分别精炼后归一化并跨三分支融合,用于MIMIC-CXR-JPG数据集上14类胸部X光多标签分类。实验显示RAD-DINO单独使用时优于BioViL-T,而早期融合进一步提升结果,表明两种嵌入来源包含互补信息;混合融合在潜在空间精炼后相比早期融合有一致且统计
该论文提出 Show-Harness,一种通过离散语义动作单元将视觉语言模型(VLM)与机器人控制连接起来的具身接口,由特定于本体的解释器将语义动作确定性地映射为本地机器人动作。Show-Harness 证明了两点可行性:直接解锁闭源前沿 VLM 实现零样本机器人控制,以及仅用少量 GPU 小时微调小规模开源 VLM 实现低成本部署。作者还开发了 GUMI(
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-VL-4B-Thinking 仓库,将 Qwen 的 40 亿参数稠密视觉语言模型 Qwen3-VL-4B-Thinking 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LL
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-VL-2B-Instruct 仓库,将 Qwen 的 2B 参数稠密视觉语言模型 Qwen3-VL-2B-Instruct 与 Furiosa 可执行包(FXB)打包,使其可在 FuriosaAI RNGD 加速卡上通过 Furiosa-LLM 运行。该模型支持图像/