欢迎回来

登录 EAKE AI,继续您的智能之旅

忘记密码?
还没有账号?立即注册

抵抗与更新:激励兼容LLM的反事实报告坐标

2026-07-16 · AI 论文

摘要(译文):对齐模型在非证据激励压力下常误报(附和自信用户或夸大确定性)。本文归因为内部激励不兼容(IC)失败,提出学习并认证"反事实报告中介":对禁止影响(压力/声望/改风格)不变、对授权证据(真实证据)响应。两需求"抵抗"与"更新"方向相反。在贝叶斯见证基准上,用互换干预(而非探针精度)因果识别答案/置信/告诫的低秩报告坐标;免训练的双通夹紧达到抵抗与更新同时 1.00(95% CI [0.99,1.00])。

作者:Sen Yang, Yuen-Hei Yeung|发布:2026-07-14|原文:arxiv.org/abs/2607.12985

评论区

发表评论