摘要(译文):越狱鲁棒性研究通常用 LLM-as-judge 评估生成响应,敏感于评分流程且仅捕获观测行为。本文提出 JADR(危险识别的雅可比评估),在首个响应 token 前用 J 空间(可言语化概念的工作空间)测量模型内部表征。不调用外部裁判,计算完全在本地、在受评估模型激活上运行,可比较不同模型及同一模型的量化/微调变体。SafetyAUC 指标以统计显著性区分强弱内部安全机制,并捕捉量化区间的实质性差异。
作者:Roman Prosvirnin 等|发布:2026-07-14|原文:arxiv.org/abs/2607.12792
评论区