九识建成首个L4万卡集群,APEX大模型迈向千亿级
九识CEO孔旗于9月10日宣布战略升级为「城市级物理AI」,CTO庄立于9月17日首次披露公司已建成业内首个L4级万卡集群,总规模近1.5万卡。该集群用于训练正从百亿级迈向千亿级的APEX多模态基座大模型,支撑车云协同架构与安全员Agent等能力。九识目前拥有超3万台车队、覆盖20多个国家300多座城市、累计真实运营里程超2.7亿公里,试图以真实物理世界数据
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
九识CEO孔旗于9月10日宣布战略升级为「城市级物理AI」,CTO庄立于9月17日首次披露公司已建成业内首个L4级万卡集群,总规模近1.5万卡。该集群用于训练正从百亿级迈向千亿级的APEX多模态基座大模型,支撑车云协同架构与安全员Agent等能力。九识目前拥有超3万台车队、覆盖20多个国家300多座城市、累计真实运营里程超2.7亿公里,试图以真实物理世界数据
Dropbox 将内部文件预览服务 Riviera 演进为通用内容处理平台,支持 300 多种文件格式和 100 多种转换能力,每秒执行数十万次转换,并支撑 Search、Replay、Sign、Dash 等产品。该平台通过可组合的转换流水线、异步执行和缓存机制,让 AI 工作负载复用既有内容处理基础设施。Dropbox 还通过公开 API 暴露文档转 Ma
MinerU 发布 4.0.0 大版本,围绕分档解析质量、原生多格式文档解析、面向 Agent 阅读的本地文档库以及统一 SDK/API/服务工具进行重构。新版本将原有 pipeline/vlm/hybrid 后端替换为 flash、basic、standard、advanced 四档质量,支持 PDF、Office、EPUB、HTML 等原生多格式解析,并
蚂蚁阿福于9月16日发布“AI饮食分”功能,用户拍摄餐食照片后,AI可自动识别食物种类、计算营养热量并给出评分,评分参考中国营养学会“合理膳食指数”,由阿福与营养学会专家组共同研发。该功能针对减重、三高等慢病人群及孕妇、老人等提供个性化饮食建议。同时,蚂蚁阿福为“科学减重一亿斤”活动加码,将发放一亿颗鸡蛋,用户坚持使用AI拍饮食即可1分钱包邮领取。
火山引擎宣布豆包 2.1 Pro 模型更新至 0915 版本,新模型 API 已在火山方舟全量上线并接入豆包工作。新版在多模态理解、编程能力、通用 Agent 能力上均有增强,可调度多个子 Agent 并行开发,在开源游戏 Luanti 约 38.7 万行代码仓库的 1000 个真实历史 Issue 中,近 36 小时内将 83% 的问题修复至可合并级标准。
北京航空航天大学、香港中文大学和新加坡国立大学的研究者提出 OmniHarness 框架,通过符号策略学习实现可泛化的视觉生成。该方法将验证过的执行过程抽象为面向视觉生成任务族的符号策略,保留共享流程与适用条件,并在执行中通过中间验证进行纠错与恢复。在 ComfyBench 创意任务上,OmniHarness 达到 95.0% 的解决率,超过最强基线 27.
研究团队提出 HyCLoST,一种用于空间转录组学的双曲对比学习框架,通过双曲几何与基因到图像的蕴含损失,捕捉基因表达与组织形态之间的层级和非对称关系。该方法基于 UNI2-h 与 Geneformer 预训练模型提取特征,并在 SpaRED 基准的 26 个数据集上评估,相比此前方法平均 MSE 降低 6%、PCC 提升 8%。源代码已公开。
论文提出 ProtoLIP,一种轻量级原型中介证据层,用于解决视觉语言模型中对象级查询仍保留共现对象和共享上下文证据的问题。ProtoLIP 将可复用视觉原型组织为文本衍生的语义族,并通过查询依赖的族路由约束哪些原型可提供证据,无需空间标注也不重训骨干网络。在冻结的 ItemizedCLIP 上仅增加 1.48% 可训练参数,Pointing 和 Energ
研究者提出 SceneBench,一个面向 3D 场景视觉语言理解的分层基准,包含 966 个用 Gaussian Splatting 重建的逼真 3D 场景,并通过人机协同流程(约 1500 人工小时)标注了超过 18.3 万个带文本描述和 3D 边界框的层级语义节点。基准定义了存在性问答、空间智能问答和需跨语义层级多步推理的 Grounded QRA 三
研究者提出 MechReason,一个面向机械工程的多图像多跳推理基准,源自真实机械工程论文,包含 12k 问答对、21k 视觉材料和显式推理链标注,覆盖解释、预测、设计、诊断四个维度共八类任务。该基准采用四阶段构建流程,通过遮蔽后验验证信息来防止模型走捷径,并经过多模态质量验证。实验显示最先进的多模态大模型仅达到 62.89% 准确率,错误主要来自推理链缺
生数科技发布Vidu S2视频生成模型,包含S2-Avatar实时交互模型和S2-Editing实时视频编辑模型,支持数字人实时互动、动作指令执行、中途参考图注入,以及边播边改的换装、换人、换背景、换风格能力。S2-Avatar输出分辨率从540p提升至720p,并新增实时空间视频生成与编辑,可送入VR头显观看。模型发布当天全量开放,距Vidu S1发布仅6
另有 1 家信源报道
OpenAI 状态页面报告,API 中使用 gpt-image-2.5-flare 的图像生成与编辑请求出现错误率升高。团队已实施缓解措施并监控恢复情况,随后宣布所有受影响服务已完全恢复。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音模型,形态类似 OpenAI 的 GPT-Live 系列。作者用 GPT-6 Astra Extra High 参考文档构建了一个网页 UI,可选择模型和语音预设、输入系统提示词,并通过浏览器进行可打断的语音对话。该实现不依赖任何库,直
Hugging Face 用户 esatapedico 发布了 DavidAU 的 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored 模型的六个 GGUF 量化版本,采用 NVFP4(W4A16,FP8 缩放,组大小 16)格式,面向 Blackwell sm 120 架构。六个文件共享字节完
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖 97 种以上语言;Extended
另有 2 家信源报道
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款面向近实时语音交互的新模型。前者主打规模化与成本效率,支持近实时视觉输入、97 种语言自动切换及后台工具调用;后者面向高复杂度任务,可边推理边说话,在 Artificial Analysis 语音到语音质量指数上以
另有 2 家信源报道
Meta 推出名为 Meta One 的订阅服务,在 Facebook、Instagram 和 WhatsApp 上提供扩展的 AI 使用额度及高级功能,包括 Muse Image、Muse Video 生成图片视频,以及 Instagram 的 AI Restyle 编辑工具。该服务面向 AI 重度用户、企业和创作者,分为 Core(7.99 美元/月)、
另有 1 家信源报道
Google 宣布其技术与产品已支持 300 多种语言,覆盖全球 86% 人口。公司通过 Gemini 3.5 Live Translate(70 种语言实时语音翻译)、Gemini 3.5 Transcribe、Universal Speech Model 及 1000 种语言计划等推进原生音频理解与低资源语言支持。同时 Google 与 Makerere
Hugging Face 用户 ChrisColeTech 发布了 LTX-2.5-uncensored-v1.1-FP8,这是基于 Lightricks/LTX-2.5 的预合并量化版本,将 Eros10 NSFW、DMD 蒸馏、IC-LoRA、IC-LoRA Detailer 和 Img2Vid 五个微调 LoRA 直接烘焙进权重。模型提供 GGUF 与
荣耀发布MagicOS 11,其AI助手YOYO经过底层架构重做,推出系统级智能体框架YOYO Harness,将模型与手机感知、规划、工具调用整合。YOYO任务执行步骤从14步提升至100步以上,任务闭环率达90%,可调用工具从400个增至700个,并支持跨品牌智能家居、汽车控制及条件触发任务。荣耀同时开放MCP、A2A、Skills、GUI等接口,接入超