← 返回资讯
大模型 HuggingFace Daily Papers

See2Think:多模态模型是否真正使用了中间视觉状态?

多模态大语言模型在推理过程中越来越多地使用草图、注释、工具和中间图像,但目前尚不清楚它们是否真正依赖这些视觉状态。现有基准测试受限于任务覆盖范围窄或部分文本可解决的样本,以及仅强调最终答案而缺乏对中间视觉状态生成、渲染和使用过程诊断的评估。研究团队提出 See2Think 统一评估框架,包含 See2ThinkBench 和 Visual Action-of-Thought(VAoT),后者包含

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。