跨场景策略迁移
通过动作嵌入将离散渗透动作映射到连续语义空间,结合置信上界动作优化与距离感知损失,突破大动作空间下可扩展与可迁移瓶颈。
Zhou, Shicheng · Liu, Jingju · Lu, Yuliang · Yang, Jiahai · Hou, Dongdong · 张月 · Shulong, Hu
IEEE Transactions on Dependable and Secure Computing 2024
将离散动作映射到连续语义嵌入空间,使智能体能够在大动作空间中高效推理。
利用动作间的语义相关性作为先验知识,训练得到的策略能够跨场景迁移。
距离感知损失函数提高了学习效率和泛化性能。
基于置信上界的动作优化方法鼓励高效探索。