Playing Atari with Deep Reinforcement Learning
https://arxiv.org/abs/1312.5602
Playing Atari with Deep Reinforcement Learning
We present the first deep learning model to successfully learn control policies directly from high-dimensional sensory input using reinforcement learning. The model is a convolutional neural network, trained with a variant of Q-learning, whose input is raw
arxiv.org
1. Introduction
해당 논문은 강화 학습을 이용해 고차원 감각 입력에서 직접 제어 미래 보상 예측을 학습함으로써 게임을 플레이할 수 있는 최초의 인공지능 모델을 소개한다. CNN을 베이스로 한 이 모댈은 Q-학습의 변형을 사용하여 원시 픽셀을 입력으로 받고 미래 보상을 추정하는 가치 함수 아웃풋한다. 아케이드 학습 환경의 7개의 Atari 2600 게임에서 테스트된 결과 이전 접근 방식들을 능가하며, 그 중 3개의 게임에서는 인간 전문가를 이기기도 했다.
2. Background
비전이나 음성과 같은 고차원 감각 입력을 통해 에이전트를 제어하는 것은 강화학습의 오랜 도전 과제 중 하나였다. 기존 RL 응용 프로그램은 주로 선형 가치 함수 사람이 수작업으로 하는 특징 추출에 의존해서 이를 해결해왔다. 하지만 최근 딥 러닝의 발전으로 원시 감각 데이터에서 고수준의 특징을 추출할 수 있게 되면서 컴퓨터 비전 및 음성 인식 모델이 크게 발전했다. 해당 논문은 이러한 기술이 RL에도 적용할 수 있는가?에 초점을 맞춘다.
3. Related Work
게임 플레이 모델의 강화학습 관련 선행 연구
TD-Gammon
- 자율학습과 셀프 플레이를 통해 인간을 뛰어넘은 게임 실력 학습
- Q-learning과 유사한 모델 프리 강화학습 알고리즘
- MLP
비선형 함수 근사와 Q-learning의 발산 문제
: 비선형 함수 근사기를 사용한 Q-learning과 off policy 학습이 Q-네트워크의 발산 문제를 일으킬 수 있다는 것이 밝혀진 후 그 후 연구들은 더 나은 수렴을 보장하는 선형 함수 근사에 초점 맞춤
심층 학습과 강화 학습의 결합
최근에는 심층 신경망을 환경을 추정하거나, 제한 볼츠만 기계(RBM)를 사용해 가치 함수나 정책을 추정하는 데 사용하면서 심층 학습과 강화 학습의 결합이 유행하기 시작
아타리 2600 에뮬레이터 플랫폼
아타리 2600 에뮬레이터를 강화 학습 플랫폼으로 사용한 연구들도 있음
4. Deep Reinforcement Learning
Deep Reinforcement Learning (심층 강화 학습)은 심층 신경망과 강화 학습 알고리즘을 결합하여 RGB 이미지를 처리 & 학습한다. Deep Reinforcement Learning의 접근법은 경험 재생(Experience Replay) 기법을 사용한다. 경험 재생 기법이란 에이전트의 경험을 저장하고 무작위로 샘플링하여 재생 (Q-learning 업데이트)을 수행하는 기법을 말하는데 데이터 효율성을 높이고 학습의 안정성을 강화한다는 장점이 있다. 이 기법을 통해 해당 모델은 표본 간의 상관성을 줄여 업데이트의 분산을 줄이고, off policy 학습을 통해 원치 않는 피드백 루프를 반복하는 것을 방지한다.
모델에서는 메모리 한계로 인해 모든 전환을 동등하게 다룬다는 한계점이 있지만, 더 정교한 샘플링 전략을 통해 중요한 전환을 강조할 수 있다는 장점이 있다. 이 방식은 효율성을 극대화한다.

4.1 Preprocessing and Model Architecture
- 원시 Atari 프레임은 210×160 픽셀 이미지로, 128 색상 팔레트를 갖고 있음
- 입력 차원을 줄이기 위한 원시 데이터의 기본적인 전처리 단계 필요
- 원시 프레임을 회색조로 변환
- 110×84 이미지로 다운 샘플링
- 84×84 영역을 크롭하여 최종 입력 표현 생성
- 입력이 네트워크의 Q-함수로 전달됨
5. Experiments
5.1 Training and Stability

5.2 Visualizing the Value Function
가치 함수 시각화 실험
DQN이 학습한 정책이 게임 화면의 다른 영역에 대해 어떻게 다른 가치를 부여하는지 분석
-> 에이전트가 게임 환경에서 어떻게 의사결정을 하는지 이해 가능
5.3 Main Evaluation

'논문 리뷰' 카테고리의 다른 글
| [논문 리뷰] - SimMIM: a Simple Framework for Masked Image Modeling (0) | 2024.05.28 |
|---|