01 / 研究问题
这项工作试图解决什么?
透视变化会让同一场景中的人呈现出差异很大的图像尺度。以往方法在编码器之后增加额外分支或空间金字塔模块,但这些模块增加计算量、只覆盖少数预定义感受野,也忽略了浅层和中间层编码特征中已有的多尺度信息。
02 / 核心想法
关键的技术直觉是什么?
FusionCount 收集 VGG-16 第一次池化之后的特征,覆盖 6 到 192 像素的感受野。在每个分辨率组内,特征差异生成空间权重并进行自适应平均;得到的四组特征再从粗到细解码。并行的空洞卷积与逐点卷积模块在压缩通道的同时保留显著上下文。
03 / 研究证据
现有结果说明了什么?
在 ShanghaiTech B 上,FusionCount 报告 6.9 MAE 和 11.8 RMSE,在所比较的 VGG 系模型中 MAE 最佳、RMSE 并列最佳;在更困难的 ShanghaiTech A 上则是具有竞争力而非最佳,为 62.2 MAE / 101.2 RMSE。论文按 1920 x 1080 输入统计 815.0G 次乘加,低于对比中的 CSRNet、CAN、BL 和 DM-Count。
04 / 边界与版本
这项工作的边界在哪里?
实验只覆盖 ShanghaiTech A 与 B,效率指标也是乘加次数,而不是实际延迟、显存或能耗。解码器第二阶段仍使用简单相加进行融合;论文把带上下文的解码融合留作后续工作。