先验规则+数据混合训练
用规则级先验知识固定的模糊策略网络,训练更快、稳态更稳,还保留了传统控制的可解释性。
Linxiang, Li · 班晓军 · Xie, Shengkun · 邱剑彬
ISA Transactions 2026
T-S 模糊策略在局部线性化区域的后件固定为最优反馈律,减少了需要学习参数的数量,从而提升样本效率。
在倒立摆基准上,Fuzzy-TD3 的稳态调节性能优于神经演员-评论家基线方法。
模糊规则的前件被重新参数化以维持有效划分,并且通过梯度下降训练,因此策略天然具有可解释性。