联合扩散Q学习算法

多模态数据高效学习

在联邦学习框架下,用扩散模型捕获用户行为的多模态分布,仅靠离线数据实现策略学习。

Wen, Jiabao · Huiao, Dai · He, Jingyi · Xi, Meng · Xiao, Shuai · 杨嘉琛

IEEE Transactions on Consumer Electronics 2023

技术优势

不上传原始数据

在联邦学习框架下训练,各客户端仅交换模型参数或梯度,用户行为数据保留在本地,避免隐私泄露。

多模态分布建得准

引入扩散模型对数据集的多模态分布进行建模,能同时拟合不同用户对同一状态的不同动作,避免策略坍缩到单一模式。

离线也能学

采用保守策略估计保证收敛,只需用户生成的离线数据集,无需与环境进行昂贵交互。

应用场景