欢迎回来

登录 EAKE AI,继续您的智能之旅

忘记密码?
还没有账号?立即注册

Silent Alarm:跨模型与量化级别比较危险识别的J空间协议

2026-07-16 · AI 论文

摘要(译文):越狱鲁棒性研究通常用 LLM-as-judge 评估生成响应,敏感于评分流程且仅捕获观测行为。本文提出 JADR(危险识别的雅可比评估),在首个响应 token 前用 J 空间(可言语化概念的工作空间)测量模型内部表征。不调用外部裁判,计算完全在本地、在受评估模型激活上运行,可比较不同模型及同一模型的量化/微调变体。SafetyAUC 指标以统计显著性区分强弱内部安全机制,并捕捉量化区间的实质性差异。

作者:Roman Prosvirnin 等|发布:2026-07-14|原文:arxiv.org/abs/2607.12792

评论区

发表评论