返回研究档案
发表日期
发表来源
ICME 2025

Interact with me: Joint Egocentric Forecasting of Intent to Interact, Attitude and Social Actions

只看一秒钟的第一人称视频,智能体能否判断谁会与它互动、态度是积极还是消极,以及下一步会发生什么社交动作?

作者Tongfei Bian, Yiming Ma, Mathieu Chollet, Victor Sanchez, Tanaya Guha

Interact with me 方法概览
Interact with me 方法概览。 图像来自论文;完整原始图注、符号说明与上下文请参阅原文。点按图片可查看原始尺寸。

01 / 研究问题

这项工作试图解决什么?

社交智能体应在互动真正开始前做好准备,尤其是在视野中同时出现多个人时。既有工作通常把意图、态度或动作分开研究,而原始 JPL 数据集只标注互动者已经完成的动作,没有覆盖画面中所有人的互动状态。

02 / 核心想法

关键的技术直觉是什么?

SocialEgoNet 分别用图卷积网络处理面部、身体和手部关键点,通过多头注意力融合空间线索,再用双向 LSTM 建模 30 帧序列。链式分类器让信息从意图传递到态度和动作。配套的 JPL-Social 标注把 200 段视频扩展为 290 条人物轨迹,并为三项任务逐人标注。

03 / 研究证据

现有结果说明了什么?

SocialEgoNet 的意图、态度和动作准确率分别为 88.10%、91.11% 和 70.24%,平均为 83.15%。其任务模型只有 3.18M 参数,明显小于 MS-G3D 的 12.82M,关键点提取后的推理延迟也更低;但 MS-G3D 的平均准确率仍最高,为 85.08%,高于 SocialEgoNet 的 83.15%。

04 / 边界与版本

这项工作的边界在哪里?

JPL-Social 仅包含 16 名参与者在六种实验室场景中的 200 段视频,因此尚未验证真实开放环境中的泛化。论文报告的网络延迟从全身姿态提取之后开始计算;端到端速度和准确性仍取决于人物跟踪与关键点质量。