Deep Reinforcement Learning Atari : 에이전트가 모션을 어떻게 이해합니까?

Aug 25 2020

기본 심층 강화 학습 방법은 현재 상태에 대한 이미지를 입력으로 사용하고 해당 이미지에 대해 일부 회선을 수행하고 일부 강화 학습 알고리즘을 적용하면 해결됩니다.

게임 Breakout 또는 Pong을 예로 들어 보겠습니다. 내가 이해하지 못하는 것은 물체가 물체를 향해 움직이거나 멀어 질 때 에이전트가 어떻게 이해 하는가? 나는 그것이 선택하는 행동이이 두 시나리오에서 달라야한다고 믿으며, 입력으로서의 단일 이미지와는 움직임의 개념이 없다.

답변

3 16Aghnar Aug 25 2020 at 19:50

기사에 깊은 강화 학습과 아타리를 재생 , Mnih 등, 2013 (특히 깊은 Q의 학습) 학습 깊은 강화의 주요 발병을했다, 그들은 네트워크에 마지막 이미지를 공급하지 않습니다. 마지막 이미지 4 개를 쌓습니다.

이 논문의 실험을 위해 알고리즘 1의 함수 φ는이 전처리를 히스토리의 마지막 4 개 프레임에 적용하고이를 스택하여 Q 함수에 대한 입력을 생성합니다.

그래서 그들은 연속성을 통해 움직임을 추가합니다. 다양한 기사와 자신의 코딩 경험에서 이것이 주요 공통 접근 방식 인 것 같습니다. 다른 기술이 구현되었는지 모르겠습니다.

우리가 상상할 수있는 한 가지는 이전 프레임과 마지막 프레임 간의 교차 상관을 계산 한 다음 교차 상관 제품을 그물에 공급하는 것입니다.

또 다른 아이디어는 이전에 CNN을 훈련시켜 일련의 프레임에서 모션 특징을 추출하고 추출 된 특징을 네트워크에 공급하는 것입니다. 이 기사 (인공 신경망을 사용하여 입자 이미지 유속계 수행 : 개념 증명) , Rabault et al, 2017 은 모션 특징을 추출하는 CNN의 예입니다.