Interact with me: Joint Egocentric Forecasting of Intent to Interact, Attitude and Social Actions
只看一秒钟的第一人称视频,智能体能否判断谁会与它互动、态度是积极还是消极,以及下一步会发生什么社交动作?

01 / 研究问题
这项工作试图解决什么?
社交智能体应在互动真正开始前做好准备,尤其是在视野中同时出现多个人时。既有工作通常把意图、态度或动作分开研究,而原始 JPL 数据集只标注互动者已经完成的动作,没有覆盖画面中所有人的互动状态。
02 / 核心想法
关键的技术直觉是什么?
SocialEgoNet 分别用图卷积网络处理面部、身体和手部关键点,通过多头注意力融合空间线索,再用双向 LSTM 建模 30 帧序列。链式分类器让信息从意图传递到态度和动作。配套的 JPL-Social 标注把 200 段视频扩展为 290 条人物轨迹,并为三项任务逐人标注。
03 / 研究证据
现有结果说明了什么?
SocialEgoNet 的意图、态度和动作准确率分别为 88.10%、91.11% 和 70.24%,平均为 83.15%。其任务模型只有 3.18M 参数,明显小于 MS-G3D 的 12.82M,关键点提取后的推理延迟也更低;但 MS-G3D 的平均准确率仍最高,为 85.08%,高于 SocialEgoNet 的 83.15%。
04 / 边界与版本
这项工作的边界在哪里?
JPL-Social 仅包含 16 名参与者在六种实验室场景中的 200 段视频,因此尚未验证真实开放环境中的泛化。论文报告的网络延迟从全身姿态提取之后开始计算;端到端速度和准确性仍取决于人物跟踪与关键点质量。