CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification
CLIP 学到的是图文匹配,而不是连续数值回归。能否重新表述计数问题,让它的识别知识仍然有用?

01 / 研究问题
这项工作试图解决什么?
标准分块分类先对点标注做高斯平滑,把整数人数变成实数,并让相邻分箱共享脆弱边界。这类分箱既难以形成适合 CLIP 的自然语言提示(例如“3.14 个人”),单独优化分类损失也不等价于降低重建计数图上的 MAE 或 RMSE。
02 / 核心想法
关键的技术直觉是什么?
增强分块分类用整数分箱替代平滑后的实数分箱,把噪声较大的高计数长尾合并进同一分箱,并将分类损失与密度图计数损失结合。CLIP-EBC 冻结文本编码器,通过视觉提示 token 适配图像编码器,再按局部特征与“这里有 3 个人”等提示的相似度完成分类。
03 / 研究证据
现有结果说明了什么?
在 UCF-QNRF 上,把三项 EBC 改进全部用于 VGG16,可将 MAE 从 140.6 降至 77.9,即提升 44.5%,且另外五种骨干也得到改善。采用 ViT-L/14 的 CLIP-EBC 在 NWPU-Crowd 测试集报告 58.2 MAE 和 268.5 RMSE,整体实验覆盖四个人群计数数据集。
04 / 边界与版本
这项工作的边界在哪里?
尽管使用了语言提示,CLIP-EBC 仍是带有数据集特定分箱和视觉提示学习的监督式计数器,并不是零样本或开放词汇计数结果。论文也没有检验跨数据集迁移或域偏移下的稳健性。