主动观察者测试
人类视觉是闭环过程,当前视觉-语言基准无法评估MLLM是否具备主动观察能力。提出ActiveVision基准,包含17项任务分3类,强制模型进行重复视觉感知,以测量MLLM的主动观察能力。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
人类视觉是闭环过程,当前视觉-语言基准无法评估MLLM是否具备主动观察能力。提出ActiveVision基准,包含17项任务分3类,强制模型进行重复视觉感知,以测量MLLM的主动观察能力。
查看原文