설명
Pathways Autoregressive Text-to-Image 모델인 Parti는 텍스트 설명으로부터 사실적인 이미지를 생성하는 새로운 접근 방식입니다. 텍스트-이미지 생성을 시퀀스-투-시퀀스 모델링 문제로 프레임화하여 기계 번역과의 유사성을 도출하고, 특히 데이터 및 모델 크기 확장을 통해 얻어진 대규모 언어 모델의 발전을 활용합니다. Parti는 ViT-VQGAN 이미지 토크나이저를 사용하여 이미지를 이산 토큰의 시퀀스로 변환하며, 이를 통해 고품질의 시각적으로 다양한 이미지를 재구성할 수 있습니다.
이 모델은 인코더-디코더가 200억 개의 매개변수로 확장됨에 따라 일관된 품질 향상을 보여줍니다. Parti는 MS-COCO 벤치마크에서 최첨단 제로샷 FID 점수 7.23점과 파인튜닝 FID 점수 3.22점을 달성했습니다. 이 모델의 효과는 새로 출시된 PartiPrompts 벤치마크에서 분석된 바와 같이 광범위한 범주와 과제에 걸쳐 나타납니다. PartiPrompts는 모델의 다양한 측면에서의 능력을 측정하기 위해 설계된 1600개 이상의 영어 프롬프트로 구성된 총체적인 컬렉션입니다.
Parti는 세계 지식을 정확하게 반영하고, 미세한 디테일과 상호작용을 가진 수많은 참가자와 객체의 구성을 요구하며, 특정 이미지 형식 및 스타일에 대한 준수를 필요로 하는 길고 복잡한 프롬프트를 처리하는 데 탁월합니다. 이 모델의 능력은 추상적인 개념에 기반한 이미지 생성, 세계 지식 통합, 특정 관점 렌더링, 심지어 이미지 내 텍스트 및 기호 생성 능력에서도 분명하게 드러납니다. 또한, 연구에서는 부정 표현 및 부재 표시 처리와 같은 한계점과 향후 개선 영역을 강조합니다.
Lingvo를 사용하여 구현되고 TPU v4 하드웨어에서 GSPMD로 확장된 Parti의 아키텍처는 상당한 확장을 가능하게 합니다. 3억 5천만 개에서 200억 개에 이르는 모델 간의 비교는 모델 능력과 출력 이미지 품질에서 상당한 개선을 보여줍니다. 인간 평가자들은 특히 이미지 사실성, 품질 및 텍스트-이미지 정렬 측면에서 더 큰 모델을 일관되게 선호했습니다. 200억 개 매개변수 모델은 추상적 추론, 세계 지식, 특정 관점 및 텍스트/기호 렌더링을 요구하는 프롬프트에서 특히 강점을 보입니다.
Parti는 창의성과 시각적 커뮤니케이션에 대한 흥미로운 가능성을 제공하지만, 연구에서는 훈련 데이터의 편향으로 인해 유해한 고정관념 및 표현을 인코딩할 잠재력을 포함한 상당한 위험을 인정합니다. 다른 텍스트-이미지 모델과 마찬가지로 Parti는 서구 편향을 반영하고 특정 배경을 과소 표현할 수 있습니다. 딥페이크 생성 및 허위 정보 확산 가능성 또한 우려 사항입니다. 이러한 위험 때문에 Google Research는 추가적인 안전 장치 없이는 Parti 모델, 코드 또는 데이터를 공개적으로 릴리스하지 않기로 결정했습니다. 대신, 릴리스된 이미지에 Parti 워터마크를 적용하고 편향 측정, 완화 전략 및 책임감 있는 애플리케이션 탐색을 위한 아티스트와의 협업에 집중할 계획입니다.
Parti: Pathways Autoregressive Text-to-Image 모델 하이라이트
자동회귀 텍스트-이미지 생성
고품질 사실적인 이미지 생성
복잡한 구성을 포함하는 풍부한 콘텐츠 합성 지원
대규모 언어 모델 발전 활용
시퀀스-투-시퀀스 모델링 접근 방식
이미지 토큰화를 위한 ViT-VQGAN 활용
최대 200억 개 매개변수로 확장 가능한 아키텍처
MS-COCO에서 최첨단 FID 점수 달성
다양한 프롬프트 범주 및 난이도 측면에서 효과적
추상적인 프롬프트 및 세계 지식 처리
특정 관점 및 텍스트/기호 렌더링
Lingvo로 구현 및 TPU v4에서 GSPMD로 확장
Parti: Pathways Autoregressive Text-to-Image 모델 시작하기
모델 접근: Parti에 대한 연구 논문 및 그 결과를 이해합니다.
기능 탐색: 예시 프롬프트와 생성된 이미지를 검토하여 모델 성능을 평가합니다.
벤치마크 결과 분석: FID 점수와 PartiPrompts 벤치마크에서의 성능을 검토합니다.
한계점 이해: 식별된 실패 모드 및 개선 영역에 대해 숙지합니다.
책임감 있는 사용 고려: 텍스트-이미지 모델과 관련된 윤리적 고려 사항 및 위험을 인지합니다.
데이터 카드 검토: 데이터 수집 및 모델 개발 관행에 대한 정보에 접근합니다.
Parti: Pathways Autoregressive Text-to-Image 모델의 사용 사례
- 사실적인 이미지 생성
- 복잡한 장면 합성
- 세계 지식 통합
- 추상 개념 시각화
- 예술 스타일 에뮬레이션
- 텍스트 및 기호 렌더링
- 창의적인 콘텐츠 제작






