轨迹预测高可解释
将参数估计建模为马尔可夫决策过程,借助最大似然奖励的试错估计,实现动态更新与预测。
Lan, Bin · He, Wang · Xiaojun, Zhu · Geng, Chen · 潘艳 · Huang, Haifeng
Lecture Notes in Networks and Systems 2025
采用控制机制引导的运动学方程描述轨迹,将机制嵌入模型,避免纯数据驱动黑箱,便于理解与交互。
将参数估计视为马尔可夫决策过程,通过试错和最大似然奖励在线更新模型参数,适应时变特性。
基于机制引导强化学习的轨迹表征,同时给出轨迹预测和跟踪方法,减少单独设计的需要。