
ZIP: Scalable Crowd Counting via Zero-Inflated Poisson Modeling
当人群密度图中超过 95% 的局部分块都是空的,平方误差回归还是合适的统计模型吗?
核心想法
ZIP 为每个分块预测两个量:结构零概率用于背景、身体部位和其他非头部中心区域,泊松率用于可能包含头部中心的区域。整数计数分箱用于稳定泊松率预测,联合似然则直接从点标注中学习区分结构零与抽样零。
任务 · 人群计数方法 · 概率模型目标 · 可扩展性
多模态学习 · 计算机视觉 · 医学影像
我目前专注于医学影像 AI 中的多模态学习:研究模型如何融合不同影像模态与互补信息,形成可靠的表征与预测。我的既有工作还涉及计算机视觉、人群计数、视觉–语言学习与以人为中心的感知。这里会从问题与直觉出发,讲清每项工作的证据与局限。
“操千曲而后晓声,观千剑而后识器。”
— 刘勰,《文心雕龙·知音》 ↗
01 / 代表性研究
3 篇精选工作,完整档案收录 6 篇论文。
查看全部出版物
当人群密度图中超过 95% 的局部分块都是空的,平方误差回归还是合适的统计模型吗?
ZIP 为每个分块预测两个量:结构零概率用于背景、身体部位和其他非头部中心区域,泊松率用于可能包含头部中心的区域。整数计数分箱用于稳定泊松率预测,联合似然则直接从点标注中学习区分结构零与抽样零。
CLIP 学到的是图文匹配,而不是连续数值回归。能否重新表述计数问题,让它的识别知识仍然有用?
四路异构视频信息应该如何融合?当其中一路或多路失效时,同一个模型还能否继续工作?
02 / 我的随笔
第一篇真实长文现已发布,中英文内容一一对应。
03 / 关于