摘要(译文):机器人学习系统日益依赖稠密进度/价值信号评估中间状态,但此类标签难以规模化获取,常以演示内归一化时间作可扩展替代(后帧=更高进度)。在接触丰富操作中,机器人可能取得进展后又因打滑/抓取失败而丧失,而时间标签单调递增。UR-VC 是离线、免训练方法,利用演示数据中"相似状态跨片段复现但时间戳不同"的规律,检索相似状态聚合其时间标签得校正估计,无需人工标签/奖励标注/额外价值模型。
作者:Lirui Zhao 等|发布:2026-07-14|原文:arxiv.org/abs/2607.12892
评论区