文本模板词元是扩散Transformer中的隐式语义寄存器
文生图扩散Transformer(DiT)联合处理文本和图像词元,但其在去噪过程中的内部计算机制仍不清晰。我们为现代大规模DiT引入了一个因果可解释性框架,结合注意力分解与跨词元跨度、头和层的定向干预。利用该框架分离提示内容词元与结构模板词元,发现结构词元在编码器输出时携带的提示特定信息很少。然而令人惊讶的是,它们成为主导的图像到文本注意力汇聚点,并在因果上(原文截断)
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。