기존의 크로스 어텐션 아키텍처가 아닌 거 같음;;


크로스 어텐션을 썼더라도 보다 상위 계층의 개쩌는 뭔가가 있는 게 분명..


이놈이 DALLE-3가 손을 잘그리고 글씨를 잘 쓰고 반사되는 걸 잘하고 말귀 잘 알아처먹는 원인임..


기존의 그냥 쌩 크로스 어텐션 아키텍처로는 텍스트와 이미지의 정확한 지점을 매칭시키면서 이해(학습)시킬 수가 없음