설명
Meta AI 연구원들은 Voicebox를 개발했습니다. 이 획기적인 음성용 생성 AI 모델은 특정 작업에 대해 특별히 훈련되지 않은 작업에서도 일반화 기능을 보여주며 최첨단 성능을 달성합니다. 각 작업에 대해 특정 훈련 데이터가 필요한 이전 음성 AI 모델과 달리, Voicebox는 확산 모델보다 발전된 새로운 Flow Matching 접근 방식을 사용하여 원시 오디오 및 관련 전사본으로부터 학습합니다.
Voicebox는 고품질 오디오 클립 생성에 뛰어나며, 영어, 프랑스어, 스페인어, 독일어, 폴란드어, 포르투갈어의 6개 언어로 음성을 합성할 수 있습니다. 그 다재다능함은 노이즈 제거, 콘텐츠 편집, 스타일 변환과 같은 고급 음성 편집 작업을 수행하는 것으로 확장됩니다. 핵심 혁신은 오토 리그레시브 모델보다 유연성이 높은 오디오 샘플의 끝부분뿐만 아니라 어느 부분이든 수정할 수 있다는 것입니다.
성능 벤치마크에서 Voicebox는 기존 모델보다 훨씬 뛰어난 성능을 발휘합니다. 제로샷 텍스트 음성 변환 작업에서 VALL-E보다 뛰어난 명료도와 오디오 유사성을 달성하면서도 최대 20배 더 빠릅니다. 다국어 스타일 전송의 경우, Voicebox는 YourTTS와 비교하여 단어 오류율을 줄이고 오디오 유사성을 향상시킵니다. 이러한 발전은 단어 오류율 및 오디오 스타일 유사성 지표에 대한 영어 및 다국어 벤치마크 모두에서 새로운 최첨단 결과를 달성합니다.
Voicebox의 기능은 여러 흥미로운 사용 사례를 가능하게 합니다. 새로운 음성 생성을 위해 짧은 오디오 샘플의 스타일과 일치하는 인컨텍스트 텍스트 음성 변환 합성을 수행할 수 있습니다. 다국어 스타일 전송은 언어 장벽을 넘어 자연스러운 커뮤니케이션을 가능하게 합니다. 또한, 음성 노이즈 제거 및 편집 기능은 손상된 오디오 세그먼트를 원활하게 복구하거나 잘못 말한 단어를 대체하여 오디오 후반 작업을 단순화할 수 있습니다. 이 모델은 실제 음성 패턴을 나타내는 다양한 음성 샘플을 생성할 수도 있으며, 이는 더 강력한 음성 어시스턴트 모델을 훈련하는 데 사용될 수 있습니다.
오용 가능성을 인지하고 Meta AI는 현재 Voicebox 모델 또는 코드를 공개적으로 제공하지 않습니다. 대신, 오디오 샘플과 접근 방식 및 결과를 자세히 설명하는 상세한 연구 논문을 공유하고 있습니다. 여기에는 실제 오디오와 Voicebox 생성 오디오를 구별하기 위해 개발된 매우 효과적인 분류기에 대한 정보가 포함되어 있으며, 잠재적 위험을 완화하고 책임감 있는 AI 개발을 촉진하는 것을 목표로 합니다.
Voicebox 하이라이트
음성용 생성 AI 모델
음성 작업 전반에 걸쳐 일반화
최첨단 성능
6개 언어로 음성 합성
노이즈 제거 수행
콘텐츠 편집 가능
스타일 변환 지원
다양한 음성 샘플 생성
Flow Matching 모델 활용
오디오 샘플의 모든 부분 수정
제로샷 TTS에서 VALL-E보다 뛰어난 성능
다국어 스타일 전송에서 YourTTS보다 뛰어난 성능
벤치마크에서 새로운 최첨단 결과 달성
50,000시간 이상의 음성 데이터로 훈련됨
Voicebox 시작하기
모델 액세스: 연구 출판물 및 공유된 샘플을 통해 Voicebox 모델에 액세스합니다.
접근 방식 이해: Flow Matching 방법 및 훈련 데이터를 자세히 설명하는 연구 논문을 연구합니다.
성능 평가: 명료도 및 유사성에 대한 제공된 오디오 샘플 및 벤치마크 결과를 분석합니다.
기능 탐색: 인컨텍스트 TTS, 다국어 전송, 오디오 편집과 같은 사용 사례를 검토합니다.
책임감 있는 AI 평가: 생성된 오디오를 구별하기 위해 개발된 분류기를 이해합니다.
Voicebox의 사용 사례
- 음성 합성
- 오디오 편집
- 스타일 전송
- 다국어 커뮤니케이션
- 합성 데이터 생성
- 접근성 도구
- 가상 비서





