社会福利升47%
针对区块链联邦学习中设备选择与长期激励的不足,提出基于PPO的激励机制,实现社会福利长期最大化。
Cai, Ting · Ying, Hu · 李翔 · 陈武辉 · Yuxin, Wu · Ye, Zhiwei · 郑子彬
IEEE Transactions on Consumer Electronics 2024
PPO激励机制从长期角度动态选择消费者设备,而非仅追求单轮即时利润,从而持续提升整体社会福利。
设备选择同时考虑数据质量与训练成本,避免单一因素导致的低效,确保模型训练既高质量又经济。
通过预定义阈值的信誉策略,阻止恶意和低质量消费者参与联邦学习,增强系统安全性。
PPO机制能够处理高维系统状态和动态变化的消费者环境,实现高效设备选择。