多图融合场景理解模型

机器人主动任务认知

该模型结合多图注意力融合编码器和多任务场景理解解码器,从视觉图像中联合建模物体、任务和场景语义,使服务机器人能主动推理可执行任务。

Yongcheng, Cui · 田国会 · Zhengsong, Jiang · 张梦洋 · Yu, Gu · Yifei, Wang

IEEE Transactions on Circuits and Systems for Video Technology 2023

技术优势

主动发现任务

模型使机器人能够根据当前视野内图像推理可执行的服务任务,无需用户预先指定,从而更自然地融入家庭环境。

融合多源语义

通过多图注意力融合编码器最大程度捕获图像中物体、任务和场景的集成特征,比单一语义建模更全面地表示任务相关信息。

可解释推理

基于注意力的多任务场景理解解码器能够高效利用融合特征,并提供可解释性的任务推理过程,便于分析和调试。

应用场景