
01 / 研究问题
这项工作试图解决什么?
即使把点标注聚合到分块,大多数基准中仍有超过 95% 的标准 8 x 8 分块为零。这些零会淹没有人区域的监督信号;高斯平滑还会引入依赖核宽的标签噪声,而 MSE 又用连续高斯残差描述本质上离散、非负且零值过量的目标。
02 / 核心想法
关键的技术直觉是什么?
ZIP 为每个分块预测两个量:结构零概率用于背景、身体部位和其他非头部中心区域,泊松率用于可能包含头部中心的区域。整数计数分箱用于稳定泊松率预测,联合似然则直接从点标注中学习区分结构零与抽样零。
03 / 研究证据
现有结果说明了什么?
在相同 VGG19 骨干下,ZIP 在 ShanghaiTech A/B、UCF-QNRF 与 NWPU-Crowd 验证集上相对 EBC 将 MAE 降低 3.2%-14.2%。从 0.81M 到 105.60M 参数的五个版本随规模单调提升;ZIP-B 在 UCF-QNRF 达到 69.46 MAE,并在 NWPU-Crowd 测试集达到 60.1 MAE / 0.104 NAE。
04 / 边界与版本
这项工作的边界在哪里?
当前预印本针对不同数据集设置了不同的计数分箱、分块大小和训练分辨率。失败分析仍发现模型会把人形物体误报为人,也会漏掉低对比度头部;在 NWPU-Crowd 测试集上,RMSE 具有竞争力但并非最佳。