LLM强化学习框架

偏好即插即用

用自然语言偏好驱动的迭代优化框架替代传统单点解析,使家庭能源管理策略能持续适应用户变化的需求。

Xiao, Du · Luo, Fengji · Juntao, Hu · 周魏 · 文俊浩

Applied Energy 2026

参数信息

规则符合率
0.84
失败率
5.4 %
加权改进率
0.13

技术优势

离线迭代,不占实时算力

大模型只在离线优化阶段参与偏好解析和策略诊断,部署后的策略独立运行,不依赖在线 LLM 推理,适合算力受限的家庭控制器。

能听懂自然语言偏好

用户用自然语言表达偏好(如“降低电费、优先舒适”),框架能自动转化为奖励函数和状态修改函数,无需手动设定权重。

失败率直降八成

与一次性解析偏好相比,迭代框架将策略失败率从 34.3% 降至 5.4%,显著提高策略对偏好的符合度。

应用场景