返回研究档案
发表日期
发表来源
ICME 2025

CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification

CLIP 学到的是图文匹配,而不是连续数值回归。能否重新表述计数问题,让它的识别知识仍然有用?

作者Yiming Ma, Victor Sanchez, Tanaya Guha

CLIP-EBC 方法概览
CLIP-EBC 方法概览。 图像来自论文;完整原始图注、符号说明与上下文请参阅原文。点按图片可查看原始尺寸。

01 / 研究问题

这项工作试图解决什么?

标准分块分类先对点标注做高斯平滑,把整数人数变成实数,并让相邻分箱共享脆弱边界。这类分箱既难以形成适合 CLIP 的自然语言提示(例如“3.14 个人”),单独优化分类损失也不等价于降低重建计数图上的 MAE 或 RMSE。

02 / 核心想法

关键的技术直觉是什么?

增强分块分类用整数分箱替代平滑后的实数分箱,把噪声较大的高计数长尾合并进同一分箱,并将分类损失与密度图计数损失结合。CLIP-EBC 冻结文本编码器,通过视觉提示 token 适配图像编码器,再按局部特征与“这里有 3 个人”等提示的相似度完成分类。

03 / 研究证据

现有结果说明了什么?

在 UCF-QNRF 上,把三项 EBC 改进全部用于 VGG16,可将 MAE 从 140.6 降至 77.9,即提升 44.5%,且另外五种骨干也得到改善。采用 ViT-L/14 的 CLIP-EBC 在 NWPU-Crowd 测试集报告 58.2 MAE 和 268.5 RMSE,整体实验覆盖四个人群计数数据集。

04 / 边界与版本

这项工作的边界在哪里?

尽管使用了语言提示,CLIP-EBC 仍是带有数据集特定分箱和视觉提示学习的监督式计数器,并不是零样本或开放词汇计数结果。论文也没有检验跨数据集迁移或域偏移下的稳健性。