乐享以太大模型:能量驱动重塑具身智能解题范式
乐享科技发布以太大模型(Energy-Driven 能量驱动架构),用于具身智能机器人决策,并在上海烧烤店进行近一小时公开直播,让两台机器人自主完成接单、烤串、上菜等任务,接受观众实时干扰测试。文章称该架构以能量函数替代 VLA/WAM 的预测范式,将任务目标与物理约束写入目标函数,并配合神经元分配实现实时计算。此前乐享曾指控 OpenAI 的 GPT-6
另有 1 家信源报道
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
乐享科技发布以太大模型(Energy-Driven 能量驱动架构),用于具身智能机器人决策,并在上海烧烤店进行近一小时公开直播,让两台机器人自主完成接单、烤串、上菜等任务,接受观众实时干扰测试。文章称该架构以能量函数替代 VLA/WAM 的预测范式,将任务目标与物理约束写入目标函数,并配合神经元分配实现实时计算。此前乐享曾指控 OpenAI 的 GPT-6
另有 1 家信源报道
岚图全新旗舰MPV梦想家9正式上市,售价41.99万~52.99万元,全系搭载华为乾崑智驾ADS 5与鸿蒙座舱HarmonySpace 6,基于全域L3级冗余架构开发,配备896线激光雷达、三腔空气悬架、双阀EDC及双向10°后轮转向。纯电版搭载120kWh电池,CLTC续航701km;插混版综合续航1500km并支持5C快充。该车将高端MPV竞争从舒适配置
苹果硬件工程副总裁Tom Marieb公开表示不建议用户给iPhone贴屏幕保护膜,称团队在屏幕耐刮耐磨方面投入大量研发,希望用户直接体验原厂屏幕,此番言论引发网友热议。此外,DeepSeek将向联合国安理会介绍AI风险,月之暗面等中国企业也受邀参会;Meta个人AI助手Muse上线两周下载量超250万次,登顶美国iOS免费榜,带动Meta股价单日上涨11.
Geometric-AI 与 Lucebox 在 Hugging Face 发布了面向 128GB AMD Strix Halo 系统的 DeepSeek-V4-Flash-0731 量化 GGUF 文件,单个 98.29GB 文件在 92 题评测中取得 82/92 分,平均每权重约 2.766 比特。同时还发布了支持图像输入的 DeepSeek-V4-Fl
llama.cpp 发布 b11112 版本,主要更新是 server 端在 function call output 中支持 input image,即函数调用输出可以携带图像输入。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。这一
小米大模型团队发布并开源新一代原生全模态模型Xiaomi MiMo-V2.6系列,包含MiMo-V2.6-Pro与MiMo-V2.6-Flash,并预告将开放速度提升20倍的MiMo-V2.6-Pro-UltraSpeed。该系列押注大规模强化学习扩展,进行了开源模型迄今最大规模的单次RL训练,并同步开源RL训练环境、框架及技术报告。MiMo-V2.6-Pr
在2026云栖大会上,阿里云集中发布全模态模型矩阵,包括Qwen3.8-Max、Qwen3.8-Flash、Qwen3.8-Omni、Qwen-Image-3.1、Happy Shrimp 1.1、HappyOyster 2.0 Preview、Qwen-Audio-3.1、Qwen3.8-LiveTranslate等,并预告下一代视频模型将于11月发布。导
AWS 发布博客,介绍如何将 Amazon Bedrock Data Automation 与 Model Context Protocol (MCP) 结合,把公共部门机构中的执法记录仪视频、监控录像、扫描文档等非结构化证据转化为结构化洞察。方案通过 S3 事件触发 Lambda 和 Bedrock Data Automation 异步处理多模态数据,结果
llama.cpp 发布 b11103 版本,为 HunyuanOCR 目标模型增加 DFlash 投机解码支持,在 Hunyuan 图构建中注册层输入张量,修复了此前因张量为空导致的断言中止问题。同时修复了针对 HunYuan 目标转换 DFlash 草稿模型时的词表处理错误,包括缺失的 fix special tokens 方法和配置读取错误。测试显示图
9月22日云栖大会上,千问办公发布企业级Agent基础设施“企业上下文”(Enterprise Context)和名片大小的AI硬件QwenNote A2。Enterprise Context将群聊、文档、知识库和业务系统中的企业信息压缩、结构化并按需调用,QwenNote A2则通过录音转写补上线下对话这一外部上下文来源。千问办公CEO陈宇森认为模型能力已
商汤科技正式发布图像生成模型 SenseNova U1 Pro,可在小浣熊平台使用,并已通过 API 和 SenseNova Studio 向企业客户开放。文章通过多轮实测展示其能力:风格重构、局部精修、多图合成、连续多轮修改、八格连续动作生成以及自主检索资料制作科普海报。作者认为该模型具备可交付性,能支撑从需求理解到检查修正的完整创作流程。
另有 1 家信源报道
哈工大校友、WebArena作者Shuyan Zhou宣布今年年初离开杜克大学教职,加入Meta超级智能实验室(MSL),核心工作是开发AI浏览器。她此前在CMU攻读博士期间主导了WebArena、VisualWebArena和OSWorld等网页与计算机智能体评测基准,谷歌学术引用达9569次。此次加入的MSL成立于2025年6月,已推出多模态推理模型Mu
该论文提出 RoboDawn,一种通过离散平移、旋转和夹爪命令将视觉语言模型(VLM)接入机器人控制的接口,使 VLM 能以闭环方式观察、推理并执行动作。作者引入上下文学习(ICL)方案,用少量演示让 VLM 掌握接口使用与任务策略。在 RoboTwin 2.0 C2R 和 RoboDojo 基准上,零样本即超越多个专用训练策略,单样本演示后成功率分别从 5
昆仑万维旗下 SkyProduction(天工工作台)于 9 月 22 日上线短剧质检功能,用户上传成片和字幕后可自动从字幕、音画、内容底线三个维度逐集检测,输出可下载、可回填的质检报告。该功能覆盖三十多个检查项,按视频时长和勾选维度计费,三项全开约 12.41 元/100 分钟。官方称业界主流竞品尚未将此类验收能力产品化,SkyProduction 抢先首
小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数(46),训练成本约 300 万美元。小米同时开源 RL 环境、训练配方与代码,并披露 RL 训练细节(130 小时、75B tokens、约 260 万美元)。此举被视为中国前沿实验室开源发布潮的一部分,也凸显
9月22日,千问在云栖大会首次集中亮相新一代全系列AI硬件,包括千问AI眼镜N1、N1 Pro及千问AI耳夹式耳机,三款新品当天开启线上预约,将于10月13日现货发售。N1系列搭载5000万像素传感器,支持第一视角拍摄,N1 Pro支持眼动追踪和虹膜支付;耳夹式耳机结合Bose调音与AI助理能力,支持面对面翻译、AI听记和语音办事。千问AI硬件总经理宋刚表示
Meta AI 提出 Summarize-Judge-Refine(SJR)双模型架构,将多模态内容理解与政策分类解耦:多模态 Content Model 生成结构化文本摘要,纯文本 Policy Model 依据政策定义对摘要分类。通过 GRPO 迭代协同训练和文本空间增强,在误导性广告检测任务上,SJR 相比零样本思维链基线非误导类 F1 相对提升 23
该论文提出一种通用多模态基础模型,旨在解决现有融合模型只能处理预定义模态和单一任务的问题。作者基于结构多模态因果模型(SMCM)构建大规模合成多模态数据集进行训练,使模型学习可迁移的多模态关联模式,而非依赖特定模态。模型扩展自表格基础模型 TabPFN,通过统一 token 生成机制将异构模态映射到统一空间,并在推理时利用上下文示例激活任务相关关联,无需参数
在9月22日云栖大会上,阿里巴巴公布千问大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5计划扩展至5-10T参数;Qwen3.8-Max通过递归自我改进(RSI)在人类零参与下自主迭代超1个月、完成33轮迭代,Artificial Analysis得分从40升至45。阿里同时发布Qwen3.8-Flash、Qwen3.8-
在2026云栖大会上,阿里巴巴公布大模型最新进展:Qwen3.8-Max在编程与办公领域表现强劲并登顶多个榜单,基于下一代架构的Qwen4已投入训练,未来Qwen4.5、Qwen5参数将扩展至5到10万亿。阿里还发布Qwen-Image-3.1、Qwen-Audio-3.1、Wan3.0、HappyOyster 2.0 Preview等多模态模型,并披露大模