Real-Time Driver Monitoring Systems through Modality and View Analysis
如果车内视频的相邻帧几乎相同,驾驶员监控系统还需要 3D 视频模型和所有传感器数据流吗?
01 / 研究问题
这项工作试图解决什么?
既有系统在同步的多视角、多模态视频片段上运行 3D CNN,但 DAD 中的相邻帧具有近乎相同的直方图和很高的结构相似度。这种冗余会成倍增加计算;同时,原始 DAD 测试集只提供正常/异常标签,无法评估具体发生了哪一种分心行为。
02 / 核心想法
关键的技术直觉是什么?
所提出的 MobileNet-V2 与 ResNet-18 系统舍弃时间维度,只对最后一帧做带通道注意力的分类;多路输入则通过扩展后的注意力融合模块组合顶视/前视与红外/深度特征。研究还重新标注 DAD 测试视频,将具体活动和汇总的“未见类别”纳入评估,以便逐类分析不同传感器选择。
03 / 研究证据
现有结果说明了什么?
图像式 MobileNet 在双视角红外输入下达到 97.5% AUC-PR;作为单一信息源,顶视红外达到 92.4% 二分类准确率和约 96% AUC-PR。在测试使用的 M1 Pro 与 AMD 5900X 平台上,2D 模型报告的速度约为 3D 基线的 10 倍,并满足数据集相机的实时帧间隔。
04 / 边界与版本
这项工作的边界在哪里?
效率结论主要建立在二分类异常检测上,而细粒度分类的最高准确率只有 75.7%,多种分心行为仍会被误判为正常驾驶。顶视红外更优是 DAD 配置下的结论;换用其他座舱布局、传感器或活动分布后,排序可能改变。