描述
Dia-1.6B是Nari Labs开发的先进文本转语音模型,具有16亿个参数。该模型旨在从文本生成高度逼真的对话,允许用户根据音频进行情感和语调控制。此外,Dia-1.6B能够产生非语言交流,如笑声、咳嗽和其他声音,增强生成语音的真实感。
该模型集成了PytorchModelHubMixin,并托管在Hugging Face上,用户可以访问预训练模型检查点和推理代码。目前,Dia-1.6B仅支持英语生成。该模型对于希望探索先进文本转语音能力的研究人员和开发者特别有用。
Dia-1.6B已在配备PyTorch 2.0+和CUDA 12.6的GPU上进行了测试,运行时大约需要10GB的显存。虽然预计很快会添加CPU支持,但该模型可以在企业GPU上实时生成音频。没有必要硬件的用户可以加入等待名单,以获取更大版本模型的访问权限。
该模型根据Apache许可证2.0进行许可,使用旨在用于研究和教育目的。建议用户不要将该模型用于身份滥用、欺骗性内容或非法活动。Nari Labs鼓励对该项目的贡献,并通过其Discord服务器提供社区支持。
Dia-1.6B AI模型亮点
16亿参数文本转语音模型
逼真的对话生成
情感和语调控制
非语言声音生成
英语语言支持
预训练模型检查点
可用推理代码
GPU优化
Dia-1.6B AI模型入门
访问页面:访问Hugging Face模型页面
加载模型:下载预训练模型检查点
配置环境:设置PyTorch 2.0+和CUDA 12.6
集成:使用PytorchModelHubMixin进行集成
微调:调整参数以适应特定用例
Dia-1.6B AI模型的使用案例
- 对话生成
- 情感控制
- 非语言声音生成
- 研究与开发
- 教育用途






