HYDRA-X:基于统一视觉分词器的原生多模态模型
HYDRA-X提出统一多模态模型,在单一Vision Transformer内整合图像和视频分词,通过因果时序注意力和分层压缩解决时空重建与语义感知问题。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
HYDRA-X提出统一多模态模型,在单一Vision Transformer内整合图像和视频分词,通过因果时序注意力和分层压缩解决时空重建与语义感知问题。
查看原文