Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention
四路异构视频信息应该如何融合?当其中一路或多路失效时,同一个模型还能否继续工作?

01 / 研究问题
这项工作试图解决什么?
把各传感器分支的最终分数直接平均,会丢失不同信息源之间的时空关系,也无法学习某个动作更依赖哪一路信息。部署时还存在第二个问题:只用完整四路输入训练的模型,可能过度依赖其中任意一路,一旦相机或模态失效便明显退化。
02 / 核心想法
关键的技术直觉是什么?
四路同步视频分别由独立的 R3D-18 编码;特征块加入信息源与位置嵌入后进入多头自注意力,使融合模块能够跨视角、模态、空间和时间比较语义。SuMoCo 提供显存友好的监督式对比学习,随机特征块遮挡则同时承担正则化与模拟部分信息源失效的作用。
03 / 研究证据
现有结果说明了什么?
使用全部四路信息时,MHSA 在非驾驶活动二分类上达到 97.0% AUC-ROC 和 97.8% mAP;在排除测试集中未见过的活动后,细粒度分类达到 91.6% mAP。在分别移除一、二或三路输入的实验中,提高训练遮挡比例能持续减小性能退化,其中 90% 遮挡的模型最稳健。
04 / 边界与版本
这项工作的边界在哪里?
论文明确指出过拟合和严重类别不均衡:正常驾驶占训练数据的 84.7%,细粒度评估还排除了训练中未见的活动。传感器缺失通过干净地移除信息源来模拟,并不等同于真实故障噪声;作者也指出驾驶员面部视频带来的群体不均衡与隐私风险。