返回研究档案
发表日期
发表来源
Preprint

ZIP: Scalable Crowd Counting via Zero-Inflated Poisson Modeling

当人群密度图中超过 95% 的局部分块都是空的,平方误差回归还是合适的统计模型吗?

作者Yiming Ma, Victor Sanchez, Tanaya Guha

ZIP 方法概览
ZIP 方法概览。 图像来自论文;完整原始图注、符号说明与上下文请参阅原文。点按图片可查看原始尺寸。

01 / 研究问题

这项工作试图解决什么?

即使把点标注聚合到分块,大多数基准中仍有超过 95% 的标准 8 x 8 分块为零。这些零会淹没有人区域的监督信号;高斯平滑还会引入依赖核宽的标签噪声,而 MSE 又用连续高斯残差描述本质上离散、非负且零值过量的目标。

02 / 核心想法

关键的技术直觉是什么?

ZIP 为每个分块预测两个量:结构零概率用于背景、身体部位和其他非头部中心区域,泊松率用于可能包含头部中心的区域。整数计数分箱用于稳定泊松率预测,联合似然则直接从点标注中学习区分结构零与抽样零。

03 / 研究证据

现有结果说明了什么?

在相同 VGG19 骨干下,ZIP 在 ShanghaiTech A/B、UCF-QNRF 与 NWPU-Crowd 验证集上相对 EBC 将 MAE 降低 3.2%-14.2%。从 0.81M 到 105.60M 参数的五个版本随规模单调提升;ZIP-B 在 UCF-QNRF 达到 69.46 MAE,并在 NWPU-Crowd 测试集达到 60.1 MAE / 0.104 NAE。

04 / 边界与版本

这项工作的边界在哪里?

当前预印本针对不同数据集设置了不同的计数分箱、分块大小和训练分辨率。失败分析仍发现模型会把人形物体误报为人,也会漏掉低对比度头部;在 NWPU-Crowd 测试集上,RMSE 具有竞争力但并非最佳。