返回全部动态

TAPe+ML:面向多任务视觉的紧凑结构化表示

原标题:TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision

arXiv cs.CV一手来源研究质量 71

AI 摘要

俄罗斯 Comexp Research Lab 提出 TAPe+ML v3 计算机视觉架构,用 TAPe(主动感知理论)结构化表示替代原始像素张量作为统一感知空间,覆盖分类、检测和分割任务。在 ImageNet-1k 上以不到 10 万参数达到 88.1% Top-1 准确率,COCO 上 mAP50 为 84.7%,并在视频场景检测中实现 1 小时视频 10-11 秒索引、索引体积小于 1MB。作者主张强视觉性能不仅来自扩大参数和预训练规模,也可来自更具信息量的底层表示。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[Page 1] TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision Sergey Kurinov, Alexey Upatov Comexp Research Lab, TAPe + ML Project Nizhniy Novgorod, Russia Correspondence: tape@tape.net Project page: ml.comexp


发布时间:2026-09-21 12:00
抓取时间:2026-09-21 12:51
来源机构:arXiv
阅读原文arxiv.org