TAPe+ML:面向多任务视觉的紧凑结构化表示
原标题:TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
AI 摘要
俄罗斯 Comexp Research Lab 提出 TAPe+ML v3 计算机视觉架构,用 TAPe(主动感知理论)结构化表示替代原始像素张量作为统一感知空间,覆盖分类、检测和分割任务。在 ImageNet-1k 上以不到 10 万参数达到 88.1% Top-1 准确率,COCO 上 mAP50 为 84.7%,并在视频场景检测中实现 1 小时视频 10-11 秒索引、索引体积小于 1MB。作者主张强视觉性能不仅来自扩大参数和预训练规模,也可来自更具信息量的底层表示。
正文节选
[Page 1] TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision Sergey Kurinov, Alexey Upatov Comexp Research Lab, TAPe + ML Project Nizhniy Novgorod, Russia Correspondence: tape@tape.net Project page: ml.comexp