설명
Dia-1.6B는 Nari Labs에서 개발한 정교한 텍스트-음성 변환 모델로, 16억 개의 매개변수를 특징으로 합니다. 이 모델은 대본에서 매우 현실적인 대화를 생성하도록 설계되어 있으며, 사용자가 감정과 톤 조절을 위해 오디오에 따라 출력을 조정할 수 있습니다. 또한, Dia-1.6B는 웃음, 기침 등과 같은 비언어적 의사소통을 생성할 수 있어 생성된 음성의 현실감을 높입니다.
이 모델은 PytorchModelHubMixin과 통합되어 있으며, Hugging Face에 호스팅되어 있어 사용자가 사전 훈련된 모델 체크포인트와 추론 코드를 접근할 수 있습니다. 현재 Dia-1.6B는 영어 언어 생성만 지원합니다. 이 모델은 고급 텍스트-음성 변환 기능을 탐색하고자 하는 연구자와 개발자에게 특히 유용합니다.
Dia-1.6B는 PyTorch 2.0+ 및 CUDA 12.6가 설치된 GPU에서 테스트되었으며, 실행을 위해 약 10GB의 VRAM이 필요합니다. CPU 지원은 곧 추가될 예정이지만, 이 모델은 기업용 GPU에서 실시간으로 오디오를 생성할 수 있습니다. 필요한 하드웨어가 없는 사용자는 모델의 더 큰 버전에 접근하기 위해 대기자 명단에 가입할 수 있습니다.
이 모델은 Apache License 2.0에 따라 라이센스가 부여되며, 연구 및 교육 목적으로 사용될 예정입니다. 사용자는 신원 남용, 기만적 콘텐츠 또는 불법 활동을 위해 모델을 사용하지 말 것을 권장합니다. Nari Labs는 프로젝트에 대한 기여를 장려하며, Discord 서버를 통해 커뮤니티 지원을 제공합니다.
Dia-1.6B AI 모델 하이라이트
16억 매개변수 텍스트-음성 변환 모델
현실적인 대화 생성
감정 및 톤 조절
비언어적 소리 생성
영어 언어 지원
사전 훈련된 모델 체크포인트
추론 코드 제공
GPU 최적화
Dia-1.6B AI 모델 시작하기
접속 페이지: Hugging Face 모델 페이지 방문
모델 로드: 사전 훈련된 모델 체크포인트 다운로드
환경 구성: PyTorch 2.0+ 및 CUDA 12.6 설정
통합: PytorchModelHubMixin을 사용하여 통합
미세 조정: 특정 사용 사례에 맞게 매개변수 조정
Dia-1.6B AI 모델의 사용 사례
- 대화 생성
- 감정 조절
- 비언어적 소리 생성
- 연구 및 개발
- 교육적 사용






