摘要(译文):联邦强化学习(FedRL)协调分布式能源而不共享原始数据,但 FedAvg 等标准聚合不顾系统级约束,常导致不安全全局行为。本文提出将局部性能与估计约束违反纳入服务端更新的聚合规则。其中简单惩罚规则 w_i∝R_i−αV_i 提供最可靠的奖励-安全权衡,无需对偶优化或改本地训练。在 DairyGridEnv(多农场电池协调,随机需求+共享电网容量约束)及芬兰/德国真实负荷上评估,相对 FedAvg 大幅减违规提奖励。
作者:Usman Haider, Karl Mason|发布:2026-07-14|原文:arxiv.org/abs/2607.12763
评论区