从五月份的时候,我就准备开始一个新的课题——边缘开放语义感知系统。
由于我一直以来都是做的 YOLO 相关的工作,所以第一时间我就开源了YOLO-CLIPOpenVocDetection。
具体工作原理是: Image → YOLO26m (candidate boxes) → CLIP ViT-L/14@336px (zero-shot classification)
不过由于 YOLO 和 CLIP 模型是解耦的,在 VOC 数据集上只能达到 0.665 mAP@0.5(YOLO26m + ViT-L/14@336px)。比 YOLO26m fine-tuned (100 epochs)的 0.724 mAP@0.5 还有一段距离。
当时的想法是换用 Chinese-CLIP 模型,用中文做开放语义检测,也算是一个卖点。然后就是换用更大更强的 CLIP 模型,但是很快也被我自己否定了,毕竟我的落地场景是端侧,换用更大的 CLIP 模型很明显违背了我的初衷。
所以,方向上的瓶颈,也因为我自己的各种琐事,这个研究也很顺理成章的卡了两个星期。我都有点想直接鸽了。
然后是,今天看到NVIDIA的一篇论文《LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding》。
初见感觉非常不错,特别是这个名字起的,让我想起了港大的那个CliAnything,是我很喜欢的命名方式。
接下来的计划是精读一下这个论文,希望能给我带来一系列的启发吧。