비디오 이해의 트랜스포머

Jan 16 2023
비디오는 어디에나 있으며 시간이 지남에 따라 증가하고 있습니다. 비디오와 관련된 문제를 해결하는 한 가지 방법은 분류를 위해 개별 프레임을 사용하는 것입니다.

비디오는 어디에나 있으며 시간이 지남에 따라 증가하고 있습니다. 비디오와 관련된 문제를 해결하는 한 가지 방법은 분류를 위해 개별 프레임을 사용하는 것입니다. 이 전략은 시간적 변화를 고려하지 않습니다. 공간과 시간에 대한 작업을 위해 기계 학습 연구자들은 많은 솔루션을 제안했으며 최근 기술 중 하나는 변환기를 사용하는 것입니다.

트랜스포머는 자연어 처리에서 도입되었습니다. 이제 변압기는 거의 모든 곳에 있습니다. 이미지나 비디오, 분류, 세분화 또는 생성입니다.

비디오 이해 정의

비디오 이해는 프레임 스택에서 학습된 정보를 추출하는 것을 의미합니다. 기술적으로 우리는 이 학습된 정보를 시공간 정보라고 부릅니다.

영상 인식 영역은 이미지 인식과 병행하여 발전해 왔습니다. 전통적인 아키텍처에는 해당 이미지보다 훨씬 더 많은 계산이 필요한 시공간 3D 컨볼루션 신경망이 포함됩니다. 시공간 정보를 처리하는 또 다른 방법은 고성능 이미지 인식 아키텍처를 사용하여 특징을 추출한 다음 LSTM 및 GRU와 같은 시퀀스 모델에 공급하는 것입니다.

오늘 우리는 비디오 이해에 사용되는 최근 트랜스포머 아키텍처에 대해 배울 것입니다.

비디오 비전 트랜스포머(ViViT)

Arnab 등은 비디오 분류를 위한 변환기 기반 모델을 소개합니다.

그들의 아키텍처에는 네 가지 변형이 있습니다.

시공간 주의

ViViT의 시공간 주의 아키텍처는 프레임 스택에서 3D 튜브릿을 추출하고 고밀도 레이어를 사용하여 투사합니다. 아키텍처의 나머지 부분에는 이러한 패치의 위치 임베딩, 변환기 인코더 및 분류를 위한 다층 퍼셉트론 헤드가 포함됩니다.

아키텍처를 설명하기 위해 논문에서 튜블렛 임베딩 다이어그램을 추가했습니다.

Tubelet Embedding을 사용한 시공간 주의 [출처]

프레임워크의 TensorFlow 구현은 여기에서 볼 수 있습니다 .

아키텍처는 입력 토큰의 수와 관련하여 2차 복잡도를 가집니다.

분해된 엔코더

분해된 인코더에는 독립적인 공간적 및 시간적 상호 작용을 갖는 두 개의 개별 변환기 인코더가 있습니다.

비디오 이해를 위한 ViViT(Factorized Encoder) [출처]

공간 인코더: 동일한 프레임의 다른 토큰과 관련하여 프레임의 토큰만 참석됩니다. 프레임 내의 이러한 상호 작용은 전역 평균 풀링 후 또는 클래스 토큰을 통해 임시 인코더 로 전달됩니다.

시간 인코더: 공간 인코더에서 추출한 토큰은 서로에 대해 주의를 기울입니다.

이러한 독립적인 공간적 및 시간적 유인 토큰은 분류를 위해 다층 퍼셉트론 헤드로 전달됩니다.

Factorized 인코더 아키텍처는 2차의 복잡성도 줄입니다.

인수분해된 자기주의

여기에서 마지막 아키텍처에서와 같이 다른 변환기 인코더를 사용하는 대신 저자는 동일한 인코더에서 독립적인 공간 및 시간 상호 작용을 사용합니다.

트랜스포머 인코더의 self-attention은 먼저 공간적으로(한 프레임 내에서) 상호 작용만 찾은 다음 시간적으로(모든 공간적으로 참석한 토큰) 상호 작용을 찾도록 수정됩니다.

비디오 이해를 위한 ViViT(Factorized Self-Attention) [출처]

인수분해된 내적 주의

더 아래로 내려오면 공간 및 시간 토큰에 대해 별도의 주의 헤드를 갖도록 self-attention을 수정하고 있습니다.

동영상 이해를 위한 ViViT(Factorized Dot Product Attention) [출처]

비디오 스윙 변압기

Video Swin 변환기는 겹치지 않는 로컬 창으로 self-attention을 제한하는 동시에 교차 창 연결도 허용합니다. 이렇게 함으로써 변압기 아키텍처에서 지역성의 귀납적 편향을 추가합니다.

PREVIOUS VIDEO TRANSFORMERS는 공간적 및 시간적 차원에 걸친 인수분해를 사용하여 전역적으로 self-attention을 계산합니다.

비디오 Swin Transformer: [출처]

Locality Inductive Bias: "이미지 픽셀이 로컬로 연관되어 있고 해당 상관 맵이 변환 불변이라는 개념." [ 여기 ML 알고리즘의 귀납적 편향에 대한 좋은 기사 ]

타임스포머

TimeSFormer 의 저자는 다양한 셀프 어텐션 체계를 실험하고 "분할된 어텐션"이 고려된 디자인 선택 중에서 최고의 비디오 분류 정확도로 이어진다고 제안합니다.

어텐션 체계는 Video Vision Transformer의 Factorized self-attention 과 동일합니다 .