Deep Reinforcement Learning Atari : 에이전트가 모션을 어떻게 이해합니까?
기본 심층 강화 학습 방법은 현재 상태에 대한 이미지를 입력으로 사용하고 해당 이미지에 대해 일부 회선을 수행하고 일부 강화 학습 알고리즘을 적용하면 해결됩니다.
게임 Breakout 또는 Pong을 예로 들어 보겠습니다. 내가 이해하지 못하는 것은 물체가 물체를 향해 움직이거나 멀어 질 때 에이전트가 어떻게 이해 하는가? 나는 그것이 선택하는 행동이이 두 시나리오에서 달라야한다고 믿으며, 입력으로서의 단일 이미지와는 움직임의 개념이 없다.
답변
기사에 깊은 강화 학습과 아타리를 재생 , Mnih 등, 2013 (특히 깊은 Q의 학습) 학습 깊은 강화의 주요 발병을했다, 그들은 네트워크에 마지막 이미지를 공급하지 않습니다. 마지막 이미지 4 개를 쌓습니다.
이 논문의 실험을 위해 알고리즘 1의 함수 φ는이 전처리를 히스토리의 마지막 4 개 프레임에 적용하고이를 스택하여 Q 함수에 대한 입력을 생성합니다.
그래서 그들은 연속성을 통해 움직임을 추가합니다. 다양한 기사와 자신의 코딩 경험에서 이것이 주요 공통 접근 방식 인 것 같습니다. 다른 기술이 구현되었는지 모르겠습니다.
우리가 상상할 수있는 한 가지는 이전 프레임과 마지막 프레임 간의 교차 상관을 계산 한 다음 교차 상관 제품을 그물에 공급하는 것입니다.
또 다른 아이디어는 이전에 CNN을 훈련시켜 일련의 프레임에서 모션 특징을 추출하고 추출 된 특징을 네트워크에 공급하는 것입니다. 이 기사 (인공 신경망을 사용하여 입자 이미지 유속계 수행 : 개념 증명) , Rabault et al, 2017 은 모션 특징을 추출하는 CNN의 예입니다.