설명
V-JEPA, 즉 Video Joint Embedding Predictive Architecture는 Meta AI Research(FAIR)에서 개발한 비디오로부터의 자기 지도 시각적 표현 학습을 위한 공식 PyTorch 코드베이스입니다. 이 방법은 VideoMix2M과 같은 데이터셋의 비디오 픽셀을 수동적으로 관찰하여 강력한 시각적 표현을 학습하는 데 중점을 둡니다. 픽셀 재구성에 의존하는 생성 모델과 달리 V-JEPA는 비지도 특징 예측 목표를 사용합니다. 사전 학습된 이미지 인코더, 텍스트, 부정적 예제, 인간 주석 또는 픽셀 수준 재구성이 필요하지 않아 순수한 비지도 접근 방식입니다.
V-JEPA 방법론의 핵심은 픽셀 디코더가 아닌 잠재 공간에서 작동하는 예측기를 포함합니다. 이 예측기는 관찰된 부분을 기반으로 비디오의 누락된 영역에 대한 예측을 수행합니다. 이러한 예측을 시각화하기 위해 조건부 확산 모델을 사용하여 잠재 공간 예측을 해석 가능한 픽셀로 디코딩합니다. 중요하게도, 이 디코딩 과정 동안 사전 학습된 V-JEPA 인코더 및 예측기 네트워크는 고정되어 학습된 표현이 보존되도록 합니다.
코드베이스는 사전 학습 및 평가를 모두 용이하게 하도록 구성되어 있습니다. `configs` 디렉토리의 구성 파일은 실험 매개변수를 지정하여 사용자가 로그, 체크포인트 및 학습 데이터의 경로를 사용자 정의할 수 있도록 합니다. `app` 디렉토리에는 학습 루프가 포함되어 있으며, `main.py`는 로컬 디버깅용이고 `main_distributed.py`는 submitit 및 SLURM과 같은 도구를 사용하여 클러스터에서 분산 학습을 시작하기 위한 것입니다. `evals` 디렉토리에는 이미지 및 비디오 분류와 같은 작업에 대한 평가 스크립트가 포함되어 있으며 로컬 및 분산 실행도 지원합니다.
데이터 준비에는 비디오 데이터셋에 대한 CSV 파일을 생성하는 작업이 포함되며, 각 줄은 비디오 파일의 절대 경로와 정수 클래스 레이블을 지정합니다(비지도 사전 학습 중에는 무시되지만 지도 평가에는 사용됨). 이미지 데이터셋은 표준 PyTorch ImageFolder 클래스를 사용하여 준비되며 특정 디렉토리 구조가 필요합니다. 이 프로젝트는 K400, SSv2, ImageNet1K, Places205 및 iNat21과 같은 다양한 다운스트림 작업을 위한 ViT-L 및 ViT-H 변형을 포함한 사전 학습된 모델과 주의 프로브를 제공하여 학습된 표현의 다용성을 보여줍니다.
V-JEPA의 핵심 기능
공동 임베딩 예측 아키텍처(JEPA)를 사용한 비디오 자기 지도 학습
잠재 공간에서의 비지도 특징 예측 목표
픽셀 수준 재구성 또는 인간 주석에 의존하지 않음
다운스트림 비디오 및 이미지 작업을 위한 다용도 시각적 표현
제공된 모델 및 구성이 포함된 공식 PyTorch 코드베이스
로컬 및 분산 학습 및 평가 지원
사전 학습된 모델(ViT-L, ViT-H) 및 주의 프로브 포함
비디오 및 이미지 데이터셋을 위한 유연한 데이터 준비
코드베이스에는 사전 학습 및 평가를 위한 스크립트 포함
잠재 공간에서의 조건부 확산 모델을 통한 시각화
V-JEPA 시작하기
리포지토리 복제: GitHub에서 V-JEPA 코드베이스를 가져옵니다.
종속성 설치: Python 환경(예: conda 사용)을 설정하고 필요한 패키지를 설치합니다.
실험 구성: 데이터, 로그 및 체크포인트에 대한 `configs` 디렉토리 내 구성 파일의 경로를 업데이트합니다.
데이터 준비: 지정된 CSV 또는 ImageFolder 구조에 따라 비디오 및 이미지 데이터셋을 형식화합니다.
사전 학습 시작: `app/main.py` 또는 `app/main_distributed.py`를 사용하여 로컬 또는 분산 사전 학습을 실행합니다.
평가 시작: `evals/main.py` 또는 `evals/main_distributed.py`를 사용하여 다운스트림 작업을 위한 로컬 또는 분산 평가를 실행합니다.
사전 학습된 모델 활용: 제공된 사전 학습된 V-JEPA 모델을 다운로드하여 애플리케이션에 통합합니다.
V-JEPA의 사용 사례
- 비디오 표현 학습
- 이미지 분류
- 비디오 분류
- 다운스트림 작업 적응
- 연구 및 개발
- 특징 예측








