上下文感知元驾驶模型

快速适应新城市路况

通过历史行为增强的上下文表示与两阶段约束适应,实现从多任务元训练到新驾驶任务的快速迁移,在保持性能的同时提高学习效率与泛化能力。

Qi, Deng · Li, Ruyang · Hu, Qifu · Zhao, Yaqian · Li, Rengang

IEEE Transactions on Vehicular Technology 2023

技术优势

样本效率提升

通过历史行为增强的上下文感知状态表示提高学习效率和鲁棒性,从而减少达到最优策略所需的交互数据量。

快速适应新任务

两阶段约束适应策略能够将元模型快速迁移到新任务,同时保持良好性能,避免传统微调中的灾难性遗忘。

数据高效复用

通过基于上下文的倾向性估计复用元训练数据,约束新任务优化目标,从而在新任务上减少对大量新数据的依赖。

应用场景