免额外训练即泛化
通过解耦环境中的因果因子,该模型在不使用测试环境数据训练的情况下,实现了强化学习策略的分布外泛化。
Huang, Sili · Jifeng, Hu · 陈贺昌 · 崔鹏 · Piao, Haiyin · Sun, Lichao · 杨博
IEEE Transactions on Industrial Informatics 2025
学习到的策略建立了动作与因果因子之间的正确依赖关系,因此可以通过干预因果因子的表征来生成语义动作,使策略行为更可解释和可控。
采用弱监督信号和两阶段约束,确保所有因果因子都被解耦,避免了以往方法中因子纠缠或二值化导致的泛化受限问题。