机器人主动任务认知
该模型结合多图注意力融合编码器和多任务场景理解解码器,从视觉图像中联合建模物体、任务和场景语义,使服务机器人能主动推理可执行任务。
Yongcheng, Cui · 田国会 · Zhengsong, Jiang · 张梦洋 · Yu, Gu · Yifei, Wang
IEEE Transactions on Circuits and Systems for Video Technology 2023
模型使机器人能够根据当前视野内图像推理可执行的服务任务,无需用户预先指定,从而更自然地融入家庭环境。
通过多图注意力融合编码器最大程度捕获图像中物体、任务和场景的集成特征,比单一语义建模更全面地表示任务相关信息。
基于注意力的多任务场景理解解码器能够高效利用融合特征,并提供可解释性的任务推理过程,便于分析和调试。