[논문 리뷰] Meta-Transformer: A Unified Framework for Multimodal Learning
Zhang, Yiyuan, et al. “Meta-transformer: A unified framework for multimodal learning.” arXiv preprint arXiv:2307.10802 (2023).
https://arxiv.org/abs/2307.10802 https://github.com/invictus717/MetaTransformer
Multimodal을 하나의 backbone을 이용해 처리하는 framework.
제목에 비해 Multimodal task 결과가 적어 아쉬움이 있다.
Abstract
- Multimodal learning에 있어 modality 간의 내재된 격차로 인해 다양한 modality 처리를 위한 통합 네크워크 설계는 어려운 과제
- Pair를 이루는 multimodal 학습 데이터 없이도 multimodal perception 가능한 framework 제시
- 다양한 modality를 tokenizer를 통해 공유 공간으로 mapping, Frozen encoder를 활용하여 feature extraction하는 구조
Introduction
각 modality는 고유한 data pattern을 가지며 이로 인해 다른 modality로 학습된 모델 적용에 한계 존재
→ Modality를 encoding하기 위해 그에 맞는 architecture 사용하는 것이 일반적
Meta-Transformer
- Images, natural language, point cloud, audio spectrogram, video, infrared, hyperspectral, X-Ray, IMU, tabular, graph, and time-series data 를 포함하는 12개의 modality를 처리하기 위한 Transformer 기반 framework
- 동일한 parameter set을 사용해 12가지 modality data를 동시에 encoding
Modality-specialist: Data-to-sequence tokenization, 각 modality 입력을 common manifold space 공유하는 token sequence로 변환Modality-shared encoder: Modality 간 representation extraction 위한 frozen shared encoder, token sequence 입력받아 feature extraction 수행Task-specific heads: Downstream task head
Contribution
- 동일한 parameter set으로 여러 modality에서 동시에 representation 추출할 수 있는 framework, Meta-Transformer 제안
- Multimodal network design 위해 다양한 modality 처리에 있어 embedding, tokenize, encoder 등 Transformer의 다양한 요소의 기능 검토 → 모든 modality를 통합할 수 있는 modality-agnostic framework 개발의 방향성 제시
- 다양한 task에서 SoTA급 성능 제시
Method
- Meta-Transformer는 서로 다른 modality를 처리하는 다중 pipeline 통합
- Shared encoder를 통해 12가지 modality를 encoding
- Modality 별 tokenizer 통해 데이터를 shared embedding space로 투영
Preliminary
Multimodal Pipeline
- {X1, X2, · · · , Xn} : n개 modality의 input space
- {Y1, Y2, · · · , Yn} : input에 대응하는 label space
- F : x ∈ X →\hat y ∈ Y : Multimodal mapping function
- x : Inputa data
- \hat y : Model 예측 label
Hypothesis
각 modality에 대해 효과적인 parameter space θi ∈ Θi 있다고 가정
_→ Input _x에 대해 최적의 feature를 encoding할 수 있는 parameter space 존재
Hypothesis: \Theta_1 \cap \Theta_2 \cap \Theta_3 \cap \dots \cap \Theta_n \neq \varnothing→ 모든 modality의 effective parameter space는 교집합을 가짐
Objective
- Meta-Transformer의 본질은 다음을 만족하는 shared \theta^* 찾는 것
각 Modality input을 encoding하는 최적의 parameter space가 존재하고 그 교집합이 공집합이 아닐때, Meta-Transformer는 multimodal input에 대한 최적의 parameter space **\theta^***를 찾는 것이 목표
Data-to-Sequence Tokenization
- 다양한 modality data를 shared manifold space 내의 token embedding으로 변환
Natural Language: WordPiece embeddingImage: 2D patch로 flatten 후 embedding, video 입력의 경우 3D convolution 통해 patchify
⚠️ 다른 모달리티에 대한 embedding 방법들은 paper/appendix 참고
Unified Encoder
Pretraining
Raw input을 token embedding space로 변환 후 frozen된 shared transformer encoder를 통해 각 modality의 token embedding sequence encoding
→ LAION-2B로 학습된 ViT를 backbone으로 고정, ViT-base 사용
Text understanding task에서는 CLIP의 pretrained text tokenizer 사용해 word embedding 추출
Modality-Agnostic Learning & Task-specific Hads
- Modality token embedding 앞에 learnable CLS token 추가
- 1D positional embedding을 element-wise addition으로 결합
- Shared backbone encoder에 입력
각 task 별로 MLP head 구성하며 아래와 같은 학습 objective 가짐
\[\hat{\boldsymbol{y}} = \mathcal{F}(\boldsymbol{x}; \theta^*) = h \circ g \circ f(\boldsymbol{x}), \quad \theta^* = \underset{\theta}{\arg\min} \mathcal{L}(\hat{y}, y)\]- f, g, h : tokenizer, backbone, head
Pretrain된 ViT backbone에 각 task input에 맞는 tokenizer와 head를 붙여 supervised train하는 방식
→ Multimodal input에도 확장 가능하며, 핵심은 하나의 backbone을 여러 modality 또는 multimodal 조합에 사용 가능하다는 것
Experiments
- 위와 같은 task에 대해 각 benchmark 수행
본 review에는 일부 task 결과만 제시
Text Understanding
- F, T는 각각 backbone ViT의 finetuning 여부 표현
- 기존 model에 비해 떨어지는 성능 보임
Image Understanding
Conclusion
Limitations
- O(n^2\times D)의 높은 연산량
- 기존 연구들에 비해 temporal, structural awareness 부족
각 benchmark 특화 모델에 비해 떨어지는 성능을 보이기도 함
하지만 단일 backbone을 통해 다양한 multimodal task를 cover할 수 있다는 장점이 있음
↔ 그럼에도 각 task에 사용되는 modality 별 tokenizer와 head를 따로 두어 학습한다는 한계 존재. Foundation model로의 발달을 위해서는 추가적인 장치가 필요할 듯 함






