摘要(译文):当语言模型须从大量同等有效选项中选一个答案,它会选哪个,又多常与其它模型相同?要求"选一个词",44 个模型 41% 选了"serendipity"。本文用极简工具(31 个单轮提示,每模型问 4 次,无系统提示)刻画此收敛,以精确匹配分析(无嵌入、无裁判、每模型约 1 美元)。收敛极端(31 类中 7 类单一答案占超 80%),但跨模型从众度差异超 4 倍;人物/社区微调模型最发散,最新旗舰最从众。
作者:Tapan Parikh|发布:2026-07-14|原文:arxiv.org/abs/2607.12796
评论区