HSI-Road重标注:表面感知的道路场景分割
该论文对HSI-Road数据集进行了重新标注,将原本的二分类(背景/道路)扩展为六类路面材质分类:背景、沥青、混凝土、泥土、水和草地,并提供了RGB到NIR的配准流程。研究在四种输入配置(原始RGB、配准低分辨率RGB、NIR、RGB-NIR通道堆叠)下评估了六种语义分割模型,使用逐类和平均IoU及F1分数进行报告。结果显示,在匹配的192×384分辨率下,
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文对HSI-Road数据集进行了重新标注,将原本的二分类(背景/道路)扩展为六类路面材质分类:背景、沥青、混凝土、泥土、水和草地,并提供了RGB到NIR的配准流程。研究在四种输入配置(原始RGB、配准低分辨率RGB、NIR、RGB-NIR通道堆叠)下评估了六种语义分割模型,使用逐类和平均IoU及F1分数进行报告。结果显示,在匹配的192×384分辨率下,
中国公司深度机智于2026年9月9日发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5综合均分,位居开源模型首位,与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距收窄至1分以内。该模型围绕其提出的Physical Loop物理智能循环架构,将具身理解、动作生成与未来状态预测统一在同一训练框架中,并
该论文提出 Latent Interface Training(LIT),一种与框架无关的两阶段训练策略,用于提升机器人基础模型在视觉分布偏移下的动作泛化能力。第一阶段在不使用图像的情况下,基于语言、机器人状态和末端执行器 SE(3) 位姿训练动作先验;第二阶段引入受位姿监督的潜在接口,作为预训练动作专家唯一的视觉条件通路。在 Pi0.5、MolmoAct2
9月14日,豆包手机助手消费者版本正式发布,以豆包App为基础与手机厂商在系统层面合作,强调稳定性和日常可用性。该版本支持语音、AI键等多种唤醒方式,具备屏幕问答、本地记忆检索和任务执行能力,并以Beta版开放“操作手机”功能,同时推出屏幕自动化操作声明协议(SAEP)并启动30天规则公示。首个消费者版本将搭载于努比亚NaviX Ultra手机,9月16日正
新加坡国立大学 Show Lab 负责人寿政教授在 ECCV 2026 上介绍了 Show-o 系列统一多模态模型,该架构在单个 Transformer 中融合自回归预测与离散掩码扩散生成,解决文本离散性与视觉连续性难以统一的问题。团队进一步提出循环一致性监督实现理解与生成的双向反哺,并通过 3D Tokenizer 与时空双向注意力提升连续视频生成质量。研
开发者 jcbtc 在 Hugging Face 发布了 Qwen3.8-Flash-CIRU-STRIX-IU4 v4.0.0,这是面向 128 GB AMD Strix Halo(Ryzen AI Max+ 395)机器的 Qwen3.8 Flash 量化包,支持长上下文文本生成、OpenAI 兼容 API、Web UI 和可选图像输入。该包基于 Qwe
智谱在港交所公告配售新H股并发行201.4亿元人民币零息可转债,合计预计净募约393亿港元,上市不到九个月累计净募约755亿港元。约60%资金将投入下一代GLM基础模型和“完全自训练”体系研发,该体系被定义为递归式自我改进闭环,涵盖数据自产、环境自造、基础设施自我优化三个维度。公告还预告GLM-6.0将提升有效规模、原生多模态统一建模和长程任务强化学习能力,
Hugging Face 用户 koongrizzly 发布了 MiniMax H3 的量化模型合集,包含来自 Winnougan 的 INT4/W4A8 ConvRot 量化 transformer 与文本编码器,以及自行转换的混合 FP16/FP32 Video VAE,并整合了 Turbo LoRA。该仓库面向消费级 GPU 的本地低显存推理,官方适配
AMAImedia 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 FP8 GGUF 量化版本,基于 deepseek-ai/DeepSeek-V4.1-Flash 原始模型转换而来,属于 NOESIS 多语言配音自动化平台的一部分。该模型为 552B 参数的多模态 MoE 架构,支持百万级上下文,通过 CED 架构、CSA
蚂蚁数科在2026 Inclusion·外滩大会上围绕绿色能源、智能终端、酒店文旅、数字内容等领域达成31项AI合作,携手多家签约单位推动AI智能体、区块链、可信数据等技术落地。合作覆盖AI数智降碳、AI量化电力交易、AI工业机器人、具身智能机器人售卖亭、酒店AI云管家、文旅票务智能体等场景。此外,蚂蚁数科与阜博集团联合共建版权大模型,面向文生视频、AI短剧
亮源新创在一个多月内连续发布LightParkour、LightNav-0和Light REACT三项技术,分别面向复杂接触技能扩展、通用导航和全身韧性控制。LightNav-0通过Real2Sim2Real数据引擎将2000+真实场景转为仿真环境,生成4000+小时训练经验,并零样本迁移到人形、四足、轮式和飞行机器人。三项技术共同指向其“规模化预训练、规模
量子位报道了米羊科技在外滩大会路演中推出的桌面Agent产品白艾莉(Alice),提出「关系型生产力Agent」概念,将生产力任务交付与人格化陪伴结合。白艾莉具备自研AI人格系统(四层架构)、世界模拟引擎(接入高德地图API、330个真实场馆)以及专业子Agent协作能力,并支持朋友圈互动、拉黑等关系化行为,官方称次日留存73%、7日留存45%、90日留存1
bartowski 发布了 Qwen3.8-27B 的 GGUF 量化版本,使用 llama.cpp b10896 进行 imatrix 量化,支持文本与图像输入(需 mmproj 文件)以及 MTP 推测解码。该版本于 2026-11-09 更新,采用新的 tensor-layout 重新上传,并提供了各量化档位的文件大小、bpw、PPL 与 KLD 等指
OpenAI 的 GPT-6 Astra 在一个名为 StationeryBench 的新机器人基准测试中展现出空间推理能力的显著提升。该测试让 Astra 与 Ai2 的 MolmoAct2 在相同双臂 YAM 机器人上完成五类桌面物体任务,共 200 次试验。Astra 完整完成 7/100 任务,MolmoAct2 为零;Astra 中位进度分 46,
9月11日,蚂蚁集团在2026 Inclusion·外滩大会宣布将GPASS智能终端可信连接技术框架升级为“灵影”,定位为面向AI眼镜等新终端的Agent原生操作系统及开放平台,提供自然交互、智能体运行、多端协同和安全可信等底层能力,并向芯片伙伴、硬件厂商和开发者开放。蚂蚁集团资深副总裁周志峰表示蚂蚁不做硬件,而是把身份、安全、支付和端云协同能力沉淀为基础设
生数科技发布世界模型Motus2,在前代基础上将行动、预测、评估三种能力整合进同一模型,形成「生成动作→预测后果→评估结果→更新策略」的闭环,初步探索递归自我改进(RSI)。模型新增触觉专家模块与记忆机制,并基于约13万小时人类第一视角Ego数据加百小时级机器人数据训练,部署于22自由度Sharpa Wave等灵巧手平台。真机测试中,规划与基于模型的强化学习
9月11日,蚂蚁灵波科技在2026外滩大会举办具身智能论坛,围绕通用大脑、数据飞轮与场景落地三场圆桌展开讨论。蚂蚁灵波首席科学家沈宇军提出通用大脑需具备表征提取、多模态融合与动作生成能力,并以部署成本和长期稳定运行作为模型进步尺度;首席数据科学家黄用韬指出数据飞轮未转起来的关键是真实场景机器人太少。蚂蚁灵波CEO朱兴认为难点已从'一'转向'多',公司聚焦通用
DeepSeek 发布开源旗舰模型 V4.1-Flash,采用全新的因果编码器-解码器架构,总参数 763B,输入/prefill 激活 8B、输出/decode 激活 16B,支持 1M 上下文与文本+图像输入,MIT 许可。Artificial Analysis 测得其在智能指数上以 40 分超过 V4 Pro 0813,定价为每百万输入 token 0
2026年外滩大会期间,OceanBase高级副总裁翁睿、CEO杨冰等提出AI时代数据底座需向一体化、多模态演进,让Agent成为新的数据用户。OceanBase发布湖库一体的AI Lakebase,并展示在银行、财险、航空、平安产险、快看漫画及成都武侯区医疗健康等场景的落地案例。IDC预测到2035年中国AI数据基础设施市场规模将达1548.3亿美元,数据
斯坦福 MIMI 团队在 Hugging Face 发布 Merlin,一个面向计算机断层扫描(CT)的 3D 视觉-语言基础模型,利用结构化电子健康记录(EHR)和非结构化放射报告进行预训练。仓库提供模型权重、示例图像以及放射报告生成和五年疾病预测等任务的权重,并配套 GitHub 代码与 pip 安装包 merlin-vlm。相关成果已发表于 Natur