설명
DreamTalk은 확산 기반 오디오 구동 표현력 있는 말하는 머리 생성 프레임워크의 공식 구현입니다. 이 도구는 다양한 말하기 스타일과 감정을 정확하게 반영하는 고품질 말하는 머리 비디오를 생성하도록 설계되었습니다. 핵심 기능은 표준 음성, 노래, 다국어 오디오, 심지어 노이즈가 있는 오디오 신호를 포함한 광범위한 입력에 걸쳐 강력한 성능을 발휘하는 것입니다. 또한 DreamTalk은 도메인 외 초상화를 처리할 때 복원력을 보여 다양한 애플리케이션에 대한 다목적 솔루션이 됩니다.
이 프레임워크는 확산 확률 모델을 활용하여 표현력 있고 사실적인 비디오 생성을 달성합니다. 사용자는 PyTorch, torchvision, torchaudio 및 기타 종속성에 대한 특정 버전 요구 사항을 따라 conda와 pip를 사용하여 프로젝트를 설치할 수 있습니다. 설치 프로세스에는 전용 conda 환경을 생성한 다음 요구 사항 파일에서 필요한 패키지를 설치하는 것이 포함됩니다.
사전 훈련된 체크포인트를 얻는 데 관심이 있는 사용자의 경우, 사회적 영향 고려 사항으로 인해 공개 다운로드 액세스가 중단되었습니다. 관심 있는 당사자는 체크포인트를 이메일로 요청해야 하며, 학술 연구 목적으로만 사용한다는 데 명시적으로 동의해야 합니다. 획득한 체크포인트는 지정된 'checkpoints' 폴더에 배치해야 합니다.
DreamTalk을 사용한 추론은 몇 가지 주요 매개변수를 사용하여 Python 스크립트를 실행하는 것을 포함합니다. 여기에는 입력 오디오 파일(wav, mp3, m4a, mp4와 같은 다양한 형식 지원), 참조 스타일 클립, 머리 포즈 시퀀스 및 입력 초상화 이미지에 대한 경로가 포함됩니다. 'cfg_scale'과 같은 추가 매개변수는 말하기 스타일의 강도를 제어하고, 'max_gen_len'은 최대 비디오 생성 기간을 설정합니다. 출력 비디오는 'output_video' 폴더에 저장되며, 중간 결과는 임시 폴더에 저장됩니다.
DreamTalk은 비디오 해상도를 개선하기 위한 임시 솔루션도 제공합니다. 두 가지 방법이 제안됩니다. CodeFormer는 최대 1024x1024 해상도를 제공하지만 속도가 느리고 시간적 불일치 문제가 발생할 수 있으며, MetaPortrait의 Temporal Super-Resolution Model은 512x512 해상도를 더 빠른 성능과 시간적 일관성으로 제공하지만 얼굴 표정 강도를 줄일 수 있습니다. 이 프로젝트는 해당 분야의 선행 연구를 인정하고 이를 기반으로 하며, 관련 연구를 인용하고 학술적 사용을 위한 인용 항목을 제공합니다.
DreamTalk의 핵심 기능
확산 기반 오디오 구동 말하는 머리 생성
다양한 말하기 스타일을 갖춘 고품질 비디오 출력
다양한 오디오 입력(음성, 노래, 노이즈 오디오)에 대한 강력한 성능
도메인 외 초상화 처리
다국어 지원
공식 구현 코드 제공
비디오 생성을 위한 추론 스크립트 포함
해상도 향상을 위한 임시 솔루션 제공(CodeFormer, MetaPortrait)
스타일 강도 및 생성 길이에 대한 조정 가능한 매개변수
CPU 추론 지원
DreamTalk 시작하기
클론: GitHub에서 DreamTalk 리포지토리를 클론합니다.
종속성 설치: conda 환경을 생성하고 제공된 requirements.txt를 사용하여 필요한 패키지를 설치합니다.
체크포인트 다운로드: 학술 연구를 위해 이메일로 체크포인트를 요청하고 'checkpoints' 폴더에 배치합니다.
입력 준비: 입력 오디오, 참조 스타일 클립, 머리 포즈 시퀀스 및 초상화 이미지를 수집합니다.
추론 구성: 추론 스크립트에서 오디오, 스타일 클립, 포즈 및 소스 이미지의 경로와 cfg_scale 및 max_gen_len과 같은 매개변수를 지정합니다.
추론 실행: 추론 스크립트(예: python inference_for_demo_video.py)를 실행하여 말하는 머리 비디오를 생성합니다.
해상도 향상(선택 사항): CodeFormer 또는 MetaPortrait를 적용하여 비디오 해상도를 향상시킵니다.
연구용 활용: 생성된 비디오를 학술 연구 목적으로 사용합니다.
DreamTalk의 사용 사례
- 표현력 있는 말하는 머리 생성
- 오디오-비디오 합성
- AI 애니메이션 연구
- 크로스 언어 말하는 머리
- 얼굴 스타일 전송
- 노이즈 오디오 처리






