摘要(译文):思维链(CoT)广泛用于 VLM 的测试时缩放,但尚不清楚 VLM 生成长推理轨迹时扩展了什么。本文提出 Visual Access Sweep 因果干预,沿层深与生成时间遮蔽生成 token 对图像 token 的注意力,定义"视觉访问边界(VAB)"为保持任务精度的最小访问区域。发现 CoT 主要通过扩展语言侧对"图像衍生隐状态"的计算,而非延长图像 token 直接访问;CoT 增益受感知读出限制。
作者:Hiroto Osaka 等|发布:2026-07-14|原文:arxiv.org/abs/2607.12815
评论区