自主渗透测试强化学习算法

跨场景策略迁移

通过动作嵌入将离散渗透动作映射到连续语义空间,结合置信上界动作优化与距离感知损失,突破大动作空间下可扩展与可迁移瓶颈。

Zhou, Shicheng · Liu, Jingju · Lu, Yuliang · Yang, Jiahai · Hou, Dongdong · 张月 · Shulong, Hu

IEEE Transactions on Dependable and Secure Computing 2024

技术优势

动作空间可扩展

将离散动作映射到连续语义嵌入空间,使智能体能够在大动作空间中高效推理。

策略可迁移

利用动作间的语义相关性作为先验知识,训练得到的策略能够跨场景迁移。

训练效率提升

距离感知损失函数提高了学习效率和泛化性能。

探索效率高

基于置信上界的动作优化方法鼓励高效探索。

应用场景