端到端可解释
用大语言模型处理视频和文本,同时输出控制信号和驾驶理由,让自动驾驶决策不再难以理解。
Xu, Zhenhua · Yujia, Zhang · 谢恩泽 · Zhen, Zhao · Yong, Guo · Wong, Kwan Yee Kenneth · Li, Zhenguo · Zhao, Hengshuang
IEEE Robotics and Automation Letters 2024
模型对每一帧预测的低层控制信号,都会生成对应的自然语言解释,让研究者可以追踪决策依据。
无需额外部署解释模块,同一网络同时产生控制信号和文本解释,简化系统集成。
在领域数据上微调后,DriveGPT4 在自动驾驶相关任务的 grounding 表现上接近或优于 GPT4-V,证明小模型领域微调的价值。