SimMIM: a Simple Framework for Masked Image Modeling
1. Introduction

이 논문은 Masked Image Modeling(MIM)을 위한 간단한 프레임워크인 SimMIM을 제안한다. SimMIM 은 최근 제안된 관련 접근 방식들을 단순화하여, 블록 단위 마스킹이나 디스크리트 VAE 또는 클러스터링을 통한 토큰화 같은 특별한 설계를 필요로 하지 않는다는 점에서 차별점을 가진다. SimMIM은 입력 이미지의 무작위 마스킹과 직접 회귀를 통해 원시 픽셀 값을 예측하는데며, 이는 복잡한 설계를 가진 패치 분류 접근 방식과 유사한 성능을 보인다. 또한 가벼운 선형 계층 prediction head를 사용하여 이미지넷-1K 데이터셋에서 최상위 정확도 83.8%를 달성하였고, SwinV2-H 모델을 사용하여 87.1%의 정확도를 기록하였다.
2. Related Work
2-1. Masked Language Modeling (MLM)
MLM은 NLP 분야에서 주요한 자가 지도 학습 접근 방식이다. 문장의 일부 토큰을 마스킹하고, 그 토큰을 예측함으로써 학습한다. 이는 매우 큰 언어 모델의 학습을 가능하게 하여, 다양한 언어 이해 및 생성 작업에서 우수한 성능을 보인다.
2-2. Masked Image Modeling (MIM)
MIM은 NLP의 MLM과 병행하여 발전해왔으나, 오랫동안 주류에 속하지 못했다. 최근 iGPT, ViT, BEiT와 같은 모델들이 이 접근 방식을 현대 비전 트랜스포머에 적용하여 강력한 표현 학습 성능을 보여주었다. 그러나 SimMIM은 이들 복잡한 설계와 달리, 무작위 마스킹과 선형 계층 회귀를 통해 단순하면서도 효과적인 방법을 제시한다.
2-3. Reconstruction Based Methods
재구성 기반 방법들은 주로 오토인코더 접근 방식을 사용하여 원래 신호를 복원한다. 이는 가시 신호 재구성에 중점을 두며, 보이지 않는 신호의 예측을 중점으로 하는 SimMIM과는 다른 철학을 따른다.
2-4. Image Inpainting Methods
이미지 인페인팅은 오래전부터 컴퓨터 비전에서 연구되어 온 문제로, 마스킹된 이미지를 복원하는 것을 목표로 한다. 이는 자가 지도 학습의 전처리 작업으로서 강력한 잠재력을 가지고 있지만, 복원 성능이 반드시 다운스트림 작업의 성능 향상으로 이어지지는 않는다.
2-5. Compressed Sensing
이 접근 방식은 압축 센싱과도 관련이 있다. 대부분의 데이터는 거의 손실 없이 버려질 수 있다는 것을 주장하며, 매우 작은 부분의 입력 이미지 패치만으로도 좋은 시각 표현을 학습할 수 있음을 보여준다.
3. Approach
3.1. A Masked Image Modeling Framework
SimMIM은 입력 이미지의 일부를 마스킹하고, 마스킹된 영역의 원래 신호를 예측하는 프레임워크로 구성된다. 주요 구성 요소는 다음과 같다:
- 마스킹 전략: 이미지의 어느 부분을 마스킹할지 결정하고, 마스킹을 구현
- 인코더 아키텍처: 마스킹된 이미지의 잠재 표현을 추출, 이는 다양한 비전 작업에 전이가 가능함
- prediction head : 잠재 표현을 바탕으로 마스킹된 영역의 원래 신호를 생성
- 예측 대상: 예측할 원래 신호의 형태를 정의. 원시 픽셀 값 또는 그 변형일 수 있음
3.2. Masking Strategy

입력 이미지의 패치를 무작위로 마스킹하는 전략
비전 트랜스포머의 기본 단위인 이미지 패치 단위로 마스킹을 수행하며, ViT와 Swin Transformer를 주요 인코더로 사용
3.3. Prediction Head
prediction head 는 선형 계층과 같은 가벼운 구조를 사용
거운 prediction head 와 비교해도 성능 차이가 없으며, 가벼운 구조는 사전 학습 속도를 크게 향상시킴
3.4. Prediction Targets
원시 픽셀 값 회귀를 사용하여 마스킹된 영역의 RGB 값을 예측한다. 이는 시각 신호의 연속적인 특성과 잘 맞아떨어지며, 복잡한 토큰화나 클러스터링을 사용하지 않고도 우수한 성능을 보인다.
3.5. Evaluation Protocol
Evaluation Protocol 은 주로 이미지넷-1K 데이터셋에서의 미세 조정 정확도를 기준으로 한다. SimMIM은 여러 설정에서 이전의 복잡한 방법들보다 더 나은 성능을 보였다.
4. Experiments
어떤 실험들을 위주로 진행했는지만 간략하게 작성
4.1. Ablation Study
4.1.1 Settings
실험 환경 설정을 통해 다양한 요소들이 모델 성능에 미치는 영향을 분석
4.1.2 Masking Strategy

무작위 마스킹 전략이 가장 효과적임
마스킹 패치 크기와 비율에 따라 성능 변화 실험 진행함
4.1.3 Prediction Head

가벼운 prediction head 가 무거운 prediction head 와 성능 차이가 없음을 확인
4.1.4 Prediction Resolution

다양한 예측 해상도를 실험하여, 높은 해상도가 반드시 성능 향상으로 이어지지 않음을 보임
4.1.5 Prediction Target

마스킹된 영역만 예측하는 방법과 마스킹된 영역과 마스킹되지 않은 영역 모두를 복원하는 대안 방법을 비교
마스킹된 영역만 예측하는 방법이 전체 이미지 픽셀을 복원하는 방법보다 훨씬 더 우수한 성능을 보여줌
-> 원시 픽셀 값을 예측하는 것이 가장 간단하면서도 효과적인 방법임을 확인
4.2. Comparison to Previous Approaches on ViT-B
이전의 복잡한 방법들과 비교하여 SimMIM이 더 나은 성능을 보임을 입증
4.3. Scaling Experiments with Swin Transformer
Swin Transformer를 사용한 실험에서 SimMIM의 확장성을 확인
4.4. Visualization

마스킹된 이미지와 복원된 이미지를 시각화하여 모델의 예측 성능을 직관적으로 보여
'논문 리뷰' 카테고리의 다른 글
| [논문 리뷰] - Playing Atari with Deep Reinforcement Learning (0) | 2024.05.18 |
|---|