설명
TokenFlow는 추가 학습이나 미세 조정 없이 사전 학습된 텍스트-이미지 확산 모델을 활용하여 일관된 비디오 편집을 위한 혁신적인 프레임워크를 제시합니다. 생성 AI의 빠른 발전은 비디오 생성으로 확장되었지만, 현재 최첨단 비디오 모델은 시각적 품질과 사용자 제어 측면에서 이미지 모델에 비해 종종 부족합니다. 이 연구는 텍스트 기반 비디오 편집을 위해 텍스트-이미지 확산 모델의 강력한 기능을 활용하는 방법을 소개합니다.
소스 비디오와 대상 텍스트 프롬프트가 주어지면, TokenFlow는 대상 텍스트와 일치하는 고품질 비디오를 생성하면서 원본 입력 비디오의 공간 레이아웃과 동적 변화를 세심하게 보존합니다. 핵심 혁신은 편집된 비디오의 일관성이 확산 특징 공간 내의 일관성을 강제함으로써 달성될 수 있다는 관찰에 있습니다. 이는 모델 내에서 쉽게 사용할 수 있는 프레임 간 상호 대응을 기반으로 확산 특징을 명시적으로 전파함으로써 달성됩니다. 결과적으로, 이 프레임워크는 어떠한 학습이나 미세 조정 없이 작동하며, 모든 기성 텍스트-이미지 편집 기술과 호환됩니다.
이 구현은 PyTorch로 제공되며, ICLR 2024에서 발표된 "TokenFlow: Consistent Diffusion Features for Consistent Video Editing" 논문의 공식 저장소입니다. 이 프로젝트는 다양한 실제 비디오에서 최첨단 편집 결과를 보여줍니다. 사용자는 제공된 링크를 통해 샘플 결과, 프로젝트 세부 정보 및 기본 연구를 탐색할 수 있습니다. 이 프레임워크는 구조 보존 편집을 위해 설계되었으며, Plug-and-Play, ControlNet, SDEdit과 같은 기존 이미지 편집 기술을 기반으로 합니다. LDM 디코더가 원본 비디오 콘텐츠에 따라 약간의 떨림을 유발할 수 있으므로, 사용자는 선택한 기본 편집 기술과의 호환성을 확인하는 것이 좋습니다.
TokenFlow의 핵심 기능
TokenFlow의 공식 PyTorch 구현
사전 학습된 확산 모델을 사용한 일관된 비디오 편집 가능
추가 학습 또는 미세 조정 불필요
입력 비디오의 공간 레이아웃 및 동적 변화 보존
텍스트 기반 비디오 편집 달성
확산 특징 공간의 일관성 강제
특징 전파를 위한 프레임 간 상호 대응 활용
기성 텍스트-이미지 편집 방법과 호환
최첨단 편집 결과 시연
구조 보존 편집 지원
Plug-and-Play, ControlNet, SDEdit 기술과 함께 작동
TokenFlow 시작하기
클론: GitHub에서 TokenFlow 저장소를 클론합니다.
종속성 설치: conda 환경을 생성하고 `pip install -r requirements.txt`를 사용하여 필요한 패키지를 설치합니다.
전처리: 지정된 데이터 경로와 반전 프롬프트를 사용하여 `python preprocess.py`를 실행하여 비디오를 준비합니다.
구성: 선택한 편집 방법에 대한 YAML 구성 파일을 생성합니다 (예: `configs/config_pnp.yaml`).
실행: 구성 파일을 사용하여 `python run_tokenflow_pnp.py`와 같은 편집 스크립트를 실행합니다.
TokenFlow의 사용 사례
- 텍스트 기반 비디오 수정
- 구조 보존 비디오 편집
- AI 기반 비디오 콘텐츠 제작
- 비디오 품질 향상
- 비디오 AI 연구 및 개발





