智象发布首款物理规律导向视频模型HD-V1,双榜进入全球第一梯队
智象未来(HiDream.ai)发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本、图片、视频等多模态输入,可直出5-20秒1080p视频,并强调物理规律理解、叙事规划与音画一体化生成。该模型在 Artificial Analysis 图生视频(含音频)榜单排名全球第四、Arena.ai 图生视频盲测排名第八。发
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
智象未来(HiDream.ai)发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本、图片、视频等多模态输入,可直出5-20秒1080p视频,并强调物理规律理解、叙事规划与音画一体化生成。该模型在 Artificial Analysis 图生视频(含音频)榜单排名全球第四、Arena.ai 图生视频盲测排名第八。发
苹果在多年延期后发布全新重建的 Siri(Siri AI)测试版,基于 Google Gemini 模型,部分在设备端处理、部分通过 Private Cloud Compute 云端处理,可读取屏幕内容与个人上下文并跨应用执行任务。该功能随 2027 年 iOS 27 等系统发布,初期仅支持英文,暂不在欧盟和中国上线。早期测试者认为实用性有提升,但仍存在误解
阶跃于9月15日发布新一代语音大模型 StepAudio 3 系列,一次性推出 Realtime、ASR、TTS、Gen 和 Music 五款模型,覆盖实时语音交互、语音识别、语音生成和音乐创作等场景。多款模型在 Artificial Analysis 榜单中位列全球第一,其中 Realtime 在 Conversational Dynamics 榜单以 9
IDC 发布《Worldwide Managed Edge Services 2026 Vendor Assessment》报告,腾讯云凭借边缘安全加速平台 EdgeOne 首次入选领导者类别,是本次唯一入选领导者类别的中国及亚太厂商。IDC 指出传统 CDN 正加速向托管边缘服务演进,竞争焦点转向边缘侧 AI 推理能力。腾讯云 EdgeOne 推出边缘 A
清华大学教授丁文伯于2025年成为Xspark AI(无界智航)联合创始人兼首席科学家,提出机器人触觉需要一套独立的“触觉原生智能”,类比人体脊髓,强调低延迟的接触反馈而非与视觉竞争。他认为视觉已解决机器人感知世界99%的问题,触觉应在视觉失效时补充接触后的信息,并提出“慢脑VLM—快脑VTLA+TWAM—脊髓VTA”三层架构。他同时指出触觉智能面临硬件一致
该论文提出 PCGNet(个性化兼容图网络),一个多目标图学习框架,用于时尚搭配推荐。它通过对比互信息最大化来提取并对齐共享信息与视图特定模式,统一建模商品兼容性与用户个性化偏好,并引入相关性感知邻居采样和可学习全局图增强以缓解数据稀疏与噪声问题。在两个基准数据集上,PCGNet 在四项评价指标上均显著优于现有方法。
该论文提出了一种名为 CSGR(Counterfactual Search for Grounding Regions)的自动标注流程,通过分割模型提出候选区域、用修复模型扰动这些区域,并测量其对模型答案分布的影响,从而识别出对答案起关键作用的「模型因果视觉证据」区域。CSGR 在多个评判模型间聚合证据以减少偏差,生成细粒度像素级标注。实验将该标注接入注意力
研究者提出 TestHallVQA,一个面向大型视觉语言模型(LVLM)的多图像文档级 VQA 基准,数据来自科学考试试卷,包含超过 1 万条问答对和 7000 张试卷图像。该基准可控制地注入多级冗余上下文,并配套提出 F1-R2 指标,同时衡量模型的推理能力与对文档级冗余的证据检索鲁棒性。实验显示主流 LVLM 在多个维度存在潜在缺陷,为后续研究提供方向。
该研究将视觉语言模型(VLM)的 affordance 预测拆分为「定位操作部件」与「知道该部件所需动作」两步,在 19 个铰接物体上测试了来自三家开发商的八个模型。开放提示下 push 动作在 64 次评估中仅正确出现一次,八个模型中有七个从未输出 push,表面看像是动作知识缺失。但检查输出发现模型实际在描述与评分不同的部件,在提示中明确命名目标部件后,
9月14日,比亚迪在腾势N8L纯电上市发布会上推出超级智能体“迪迪虾”,并宣布与阿里云深化AI合作,将千问大模型接入比亚迪座舱体系。千问参与多轮对话、意图识别、任务编排与长期记忆,并协同车控、音乐、视频、搜索及飞猪、淘宝闪购等生态Agent执行任务,使车机从被动应答转向主动办事。双方自2023年起已在辅助驾驶、智能座舱等领域合作,此次将合作从云基础设施、数据
ByteShape 在 Hugging Face 发布 Qwen3.8-27B 的 GGUF 量化版本,使用其 ShapeLearn 方法为每个张量学习最优数据类型,以在极低位宽下保持质量。该版本取代此前的 ShapeLearn-Lite 量化,包含 5 个 GPU 优化模型(2.56–3.84 bpw,8.8–13.1 GB),并在数学、编程、指令遵循和智
该论文提出 Omni-Streaming Thinking(OST)方法,用于改进流式全模态推理。针对模型在音频尚未完整时过早将视觉解读固化为事实、导致后续即使音频矛盾仍持续传播的「跨模态过早承诺」问题,OST 生成包含已观察证据、未来证据预测和基于证据的声明等结构化输出,声明初始标记为待定并绑定未来验证区间,音视频证据分开存储,在验证区间结束时进行跨模态核
NVIDIA 发布了 Muse-Glimmer-30B 的 NVFP4 量化版本,该模型基于 Meta Superintelligence Lab 的 Muse-Glimmer-30B 稠密因果 Transformer,带有专用感知编码器,支持文本与图像交错输入,面向本地智能体任务。量化使用 NVIDIA Model Optimizer v0.46.0,采用
Google 在 Gemini API 发布说明中宣布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款音频到音频模型正式可用(GA),面向使用 Live API 的实时语音应用。Gemini 3.8 Live 是低延迟语音代理与实时对话的默认选项,具备交错推理、默认异步函数调用和完整会话客户端内容
另有 2 家信源报道
llama.cpp 发布 v0.4.1,新增 Maple 20B-A1B 三元 MoE、腾讯 Hy 4 预览版和 Spark2.5 模型支持,并改进 JSON schema 处理、聊天解析、日志和服务器子进程管理。核心变更包括修复 DeepSeek2、GLM-MoE 等模型的 MTP KV 缓存分配,以及 Qwen/Kimi/GLM 的 GDN 归一化问题。
TechCrunch 作者在 iOS 27 公测版上长期使用后表示,新版 Siri 基于 Google Gemini 模型构建,能力大幅提升,可处理多步复杂指令、读取屏幕上下文、调用文件/信息/邮件内容,并新增独立 App 与相机接入。文章还介绍了 Apple Intelligence 带来的自然语言创建快捷指令、Safari 自定义提醒、照片重构图与扩展、
AI 时尚发现应用 Daydream 推出两项新功能,利用苹果 iOS 27 开发者工具与 Apple Intelligence,让 iPhone 用户无需打开应用即可将相册中的穿搭照片转化为可购买商品,并通过 Siri 进行自然语言搜索。该应用可识别图片中的单品并匹配其约 300 万件商品目录,若原商品已下架则推荐相似款式。Daydream 表示这是其构建
mlx-optiq 发布了 mlx-community/gemma-4-12B-it-qat-OptiQ-4bit,这是基于 Google 量化感知训练(QAT)版 Gemma-4 12B 的 4-bit 混合精度 MLX 量化模型。它采用敏感度引导的逐层比特分配(157 个组件用 8-bit,171 个用 4-bit,平均 5.25 bits-per-we
研究者提出 TRACE,一个面向火灾后物体理解的变换感知基准,包含 21.4K 真实图像衍生的合成火灾场景和 499 个物体从完好到逐步退化的配对轨迹,覆盖 189 个类别。实验显示现有检测器、编码器和 VLM 在物理退化下性能大幅下降,如 RF-DETR mAP 相对下降 71%,InternVL3.5 检索 R@1 从 93.85 降至 28.11。为此
研究者提出 Latent-Attention Masked Autoencoders(LAMAE),一种多模态、结构感知的掩码自编码器,在自监督预训练阶段通过共享的潜在注意力模块在 study–view–entity 层级上直接交换信息,联合学习患者级表征。该模型在超过 120 万条 MIMIC-IV 住院记录上预训练,在多模态住院任务(院内死亡率、ICD-