설명
LTX-2.5는 Lightricks에서 개발한 최첨단 오픈 월드 모델로, 텍스트, 이미지 및 비디오 입력으로부터 동기화된 고충실도 비디오 및 오디오를 생성하도록 설계되었습니다. 이 모델은 로컬 실행 및 파인 튜닝을 위해 구축되어 사용자에게 완전한 제어 및 사용자 정의 옵션을 제공합니다. 고품질 멀티미디어 생성의 필요성이 중요한 로봇 공학 및 물리적 AI와 같은 신흥 분야에 특히 유용합니다.
LTX-2.5의 두드러진 기능 중 하나는 네이티브 멀티샷 생성 기능으로, 사용자가 단일 패스에서 연결된 장면을 생성할 수 있게 합니다. 이는 여러 샷이 컷 간에 캐릭터 정체성, 환경, 조명, 음성 및 시각적 스타일을 유지할 수 있음을 의미하며, 스토리텔링 경험을 향상시킵니다. 또한, 이 모델은 장면 복잡성에 따라 컴퓨팅 자원을 동적으로 할당하는 확산 충실도 렌더링을 사용하여, 가장 중요한 곳에서 세부 사항이 렌더링되도록 하면서 다른 곳에서는 효율성을 유지합니다.
새로운 확산 비디오 디코더의 도입은 VAE 재구성 단계를 대체하여, 요구가 높은 장면에서 더 선명한 얼굴, 개선된 텍스처 및 더 나은 모션을 제공하며 아티팩트를 줄입니다. 맞춤형 Gemma 4 12B 텍스트 인코더는 복잡한 프롬프트를 긴 시퀀스에서도 세부 사항을 잃지 않고 유지할 수 있는 또 다른 중요한 발전입니다. 또한, 프롬프트 향상기는 짧은 프롬프트를 더 풍부한 영화적 지침으로 확장하여 전체 출력 품질을 향상시킵니다.
클립 길이를 예측하려는 사용자들을 위해 LTX-2.5는 프롬프트에 따라 프레임 수를 설정하는 선택적 지속 시간 예측기를 포함하여 워크플로우를 간소화합니다. 이 모델은 전체 모델의 시각적 품질과 모션 일관성을 대부분 유지하면서 더 작고 빠른 상당히 개선된 증류 모델도 제공합니다.
LTX-2.5는 LTX-2.x 커뮤니티 라이선스 하에 제공되어 상업적 및 제작 용도로 무료로 사용할 수 있지만, 파인 튜닝의 전송에는 유료 라이선스가 필요할 수 있습니다. 사용자는 Python 및 ComfyUI를 포함한 다양한 통합 옵션을 통해 모델에 접근할 수 있어 다양한 기술 환경에 적합합니다. 강력한 기능과 오픈 소스 특성을 갖춘 LTX-2.5는 멀티미디어 생성에서 인공지능을 발전시키고 민주화할 준비가 되어 있습니다.
LTX-2.5 하이라이트
오픈 월드 모델
고충실도 비디오 생성
고충실도 오디오 생성
네이티브 멀티샷 생성
확산 충실도 렌더링
맞춤형 Gemma 4 12B 텍스트 인코더
프롬프트 향상기
지속 시간 예측기
증류 모델 제공
상업적 사용 라이선스
LTX-2.5 시작하기
접속 페이지: Hugging Face의 LTX-2.5 모델 페이지를 방문하세요.
모델 로드: LTX-2.5에 필요한 가중치 및 구성 요소를 다운로드하세요.
환경 구성: 설정이 요구 사항을 충족하는지 확인하세요 (Python >= 3.12, CUDA >= 12.7, PyTorch ~= 2.7).
통합: 제공된 CLI 플래그를 사용하여 애플리케이션에서 모델 구성 요소를 로드하세요.
파인 튜닝: 필요에 따라 LTX-2 트레이너를 사용하여 모델을 파인 튜닝하세요.
LTX-2.5의 사용 사례
- 비디오 제작
- 오디오 생성
- 로봇 공학 시뮬레이션
- 게임 개발
- 교육 콘텐츠








