ZIP: Scalable Crowd Counting via Zero-Inflated Poisson Modeling
当人群密度图中超过 95% 的局部分块都是空的,平方误差回归还是合适的统计模型吗?
一句话用零膨胀泊松似然分开结构性空区域与离散计数,不再依赖分割掩码或高斯平滑标签。
任务 · 人群计数方法 · 概率模型目标 · 可扩展性
阅读完整讲解研究档案
这里整理了我的论文和项目,并简要说明每项工作解决什么问题、采用什么方法,以及有哪些局限。
当人群密度图中超过 95% 的局部分块都是空的,平方误差回归还是合适的统计模型吗?
一句话用零膨胀泊松似然分开结构性空区域与离散计数,不再依赖分割掩码或高斯平滑标签。
只看一秒钟的第一人称视频,智能体能否判断谁会与它互动、态度是积极还是消极,以及下一步会发生什么社交动作?
一句话把面部、身体和手部关键点建成图,建模它们的时序变化,再通过链式任务层级联合预判意图、态度和动作。
CLIP 学到的是图文匹配,而不是连续数值回归。能否重新表述计数问题,让它的识别知识仍然有用?
一句话把局部人数变成无歧义的整数类别,让 CLIP 的局部图像特征匹配自然语言计数提示,再从类别概率恢复密度图。
四路异构视频信息应该如何融合?当其中一路或多路失效时,同一个模型还能否继续工作?
一句话用带信息源标识的自注意力融合顶视/前视与深度/红外特征,并在训练中随机遮挡特征块以模拟视角或模态缺失。
如果车内视频的相邻帧几乎相同,驾驶员监控系统还需要 3D 视频模型和所有传感器数据流吗?
一句话每个 16 帧片段只使用最后一帧,再系统测量顶视/前视与深度/红外在准确率和延迟之间的权衡。
如果编码器已经产生了多种感受野尺度的特征,为什么还要额外搭建一个多尺度模块?
一句话复用 VGG-16 的 15 层中间特征,从特征差异中学习随空间变化的融合权重,再用保留显著性的轻量通道压缩模块完成解码。
没有匹配这一标签的出版物。