阿里吴泳铭:坚定投入AI模型、AI芯片、AI云三大基石
在2026杭州云栖大会上,阿里巴巴集团CEO吴泳铭宣布阿里将坚定投入AI模型、AI芯片和AI云三大基础设施建设,作为长期战略选择。他提出机器思考总量未来将达到人类的1000倍以上,并披露Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模新模型。芯片方面,平头哥发布国产AI芯片真武V900,算力为真武M890的3倍,单集群可扩展至50万卡;
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
在2026杭州云栖大会上,阿里巴巴集团CEO吴泳铭宣布阿里将坚定投入AI模型、AI芯片和AI云三大基础设施建设,作为长期战略选择。他提出机器思考总量未来将达到人类的1000倍以上,并披露Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模新模型。芯片方面,平头哥发布国产AI芯片真武V900,算力为真武M890的3倍,单集群可扩展至50万卡;
阿里巴巴集团CEO吴泳铭在2026杭州云栖大会上发表演讲,提出机器智能时代三大基石为AI模型、AI芯片和AI云,并判断未来机器思考总量将达到人类的1000倍以上。他宣布Qwen团队在递归式自我改进RSI方面取得进展,计划训练5-10T参数规模模型;平头哥发布最强国产AI芯片真武V900,算力为M890的3倍,单集群可扩展至50万卡;阿里云目标到2032年全球
非侵入AI脑机接口公司华超神控(BCI-Sonics)宣布完成2亿元人民币Pre-A轮融资,由红杉中国与云启资本联合领投,比邻星投资、元禾控股、徐汇科创投、德石投资跟投,老股东经纬创投、德联资本持续加注。公司成立于2025年,总部位于上海,以低强度经颅聚焦超声神经调控、多模态神经读取与AI神经解码构建「写脑—读脑—解码」闭环,布局科研、临床、科技三条产品线,
Hugging Face 上发布了 m-a-p/SheetSage2 模型,可将音乐录音转写为可编辑的乐谱(ABC 格式)和带时间标注的 MIDI。该模型基于 MERT-v2-FullSong 构建,支持旋律、和弦、节拍、调性和结构提取,并可导出嵌入与 token 预测。用户可将转写结果传入 YuE2 用于翻唱生成,模型采用 cc-by-nc-4.0 许可。
Hugging Face 用户 avar6 发布了基于 zai-org/GLM-5.3-Flash 的实验性 GGUF 量化模型,支持视觉功能,需配合 timkronos 的 llama.cpp 分支使用。量化从 bf16 safetensors 生成,提供 IQ2 XXS 至 Q3 XL 等多种精度方案,并持续更新 mmproj 与混合精度量化。作者表示
智东西对商汤日日新SenseNova U1 Pro进行多轮实测,覆盖音乐节海报、漫剧人物设定、潮玩概念图、公众号配图、企业秋招成套物料,以及换装、多图融合和局部修改等任务。测试显示U1 Pro能围绕完整任务组织创作流程,兼顾信息准确、风格统一与修改可控。该模型正式版已上线商汤小浣熊,并面向企业客户提供API服务。
另有 1 家信源报道
vivo在上海发布X500系列手机,包括X500、X500 Pro、X500 Pro Max三款机型,起售价5499元起。vivo宣布将动态影像提升至公司级战略高度,首次完整落地由传感器、芯片、算法三层构成的蓝图动态影像技术栈,并推出专为动态影像设计的蓝图光御900传感器。X500 Pro系列全球首发2nm天玑9600 Pro芯片,OriginOS 7带来A
研究团队提出 TALON,一个面向放射学报告生成(RRG)的时间感知纵向框架,通过双通道时间融合模块(DCTFM)分别建模当前检查与各历史检查之间的相似性和变化,并自适应估计每个历史检查的相关性。在 MIMIC-CXR 数据集上,TALON 在临床效能指标和 RadGraph-F1 上超越当前最优方法,且当可用历史检查更多时性能进一步提升。该工作旨在解决现有
该论文提出 APCL(Adaptive Preference with Contrastive Learning)框架,用于个性化时尚搭配推荐。APCL 通过相关性引导的自适应聚合机制显式构建间接的用户-物品与物品-物品关系,并引入功能视图对比学习策略对齐直接与间接的偏好及兼容性表示,同时融合多模态视觉与文本信息。在两个基准数据集上的实验表明,APCL 持续
研究者提出 MemeTAG,一种关键词驱动的双目标多模态框架,用于有害网络迷因分类。该方法先用预训练视觉语言模型生成描述性关键词,再通过聚合标签推理网络(ATIN)将关键词蒸馏为语义嵌入,并以此作为辅助重建损失的目标,促使视觉与文本特征深度对齐。配合三阶段训练策略,MemeTAG 在 HarMeme、Hateful Memes Challenge 和 Pri
该论文提出 MAGIC,一种无需训练的事后压缩方法,用于提升视觉文档检索(VDR)效率。针对 ColPali 等多向量检索系统中 patch 级向量带来的存储与 MaxSim 计算开销,MAGIC 通过估计检索需求并构建双边际熵最优传输问题,在压缩时优先保留高使用率 patch 并均衡保留 facet 的使用。在 ViDoRe 基准上,MAGIC 在多种保留
该论文提出 Bio-MF,一种无需预训练、无潜变量的单步 MeanFlow 框架,用于在混合运动想象脑机接口中由 EEG 条件生成 fNIRS 信号。Bio-MF 直接预测干净 fNIRS 信号并转化为 MeanFlow 速度监督,单次网络评估即可完成推理,并整合时空交互 4D 编码、跨模态无分类器引导和噪声级门控 FFT 正则化。在 Dataset 1 上
研究者提出 BirdsongChat,一个混合多智能体框架,用于多模态具身行为模拟。该框架通过统一参数表示(UPR)将基于 LLM 的推理智能体与物理模拟智能体连接,把多模态输入转化为可解释的行为状态和控制参数,从而生成同步的 3D 运动、空间化声音和环境行为。原型系统以鸟类行为模拟为测试平台,在文本和图像引导场景中取得跨模态一致性 94.4%、情感一致性
百曜科技发起、《麻省理工科技评论》中国团队调研撰写的《AI虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》于9月21日在中关村科学城管理委员会指导下发布。报告将AIVC定义为AI时代生命科学的新型基础设施,梳理了从分子层面走向细胞层面的研究范式,并提出模型泛化能力、私有与新生产数据、干湿闭环三大产业趋势。百曜科技同时介绍了其基于LLM-JEPA架构
比亚迪发布汽车行业首个AI超级智能体「迪迪虾」,首搭腾势N8L纯电车型。该智能体基于比亚迪璇玑架构2.0,将智能座舱升级为AI OS,支持端云协同与多模态感知,并接入飞猪、高德、淘宝闪购、豆包、千问等十余个生态合作伙伴智能体。腾势D9、N8L闪充版、Z9GT、N9闪充版等车型将陆续通过OTA推送该功能。
joyfox 发布了基于 Qwen3.8-27B 的未审查变体模型,通过 abliteration 技术降低拒绝率,同时保留原生架构、视觉栈和 MTP 权重。该模型在 800 个良性提示上实现 0% 拒绝率,能力得分与官方版持平,并提供多种 GGUF 量化版本。
总部位于帕洛阿尔托的初创公司 ScrollEd 推出了一款应用,可将 PDF、教科书等文本文件转化为类似 TikTok 或 Instagram Reels 的竖屏信息流,内容以 AI 生成的视频、音频、文本或互动测验形式呈现。该公司正在 TechCrunch Disrupt 的 Startup Battlefield 200 竞赛中亮相,目标客户包括教育机构
Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学、清华大学发布视触世界模型DexTouch-WM,面向灵巧手部交互,可同步预测未来视频画面与双手全覆盖精细触觉信息。该模型采用冻结预训练视频编解码网络、解剖感知触觉分词器与双模态联合注意力机制,并采集约100小时人类双手交互数据(50项任务)。评测显示,叠加100小时人类数据后触觉PS
启元机器人(稚晖君团队)在上海发布两款面向家庭场景的个人机器人Q1和T1,售价19999元起,10月1日起按订单顺序发货。Q1身高88厘米,支持图形化编程、外壳与性格定制及100多项原子能力开放;T1采用双足四足双形态设计,具备自主跟随、回充与英语陪练等功能。同时发布PrimeMotion、PrimeGo、PrimeVista三大机器人模型,并披露每2.5分
阶跃星辰发布新一代MoE旗舰模型Step 5 Preview,总参数600B、激活参数27B,支持100万Token上下文与原生文本、视觉输入,专为真实世界Agentic任务打造。该模型在Artificial Analysis Intelligence Index得分44分,位居开源模型第三,仅次于Qwen3.8 Max与GLM-5.3。其单任务成本约为Cl