설명
UL2 20B는 다양한 작업 및 설정에서 성능을 향상시키는 통합 프레임워크를 제공하는 언어 모델 사전 학습의 중요한 발전을 나타냅니다. Google Research에서 개발한 이 오픈 소스 모델은 파인튜닝 또는 퓨샷 인컨텍스트 학습 중 하나에 탁월하지만 다른 하나에는 어려움을 겪는 기존 패러다임의 한계를 해결합니다.
기존 언어 모델은 일반적으로 다음 단어를 예측하는 자기회귀 디코더 전용 아키텍처(GPT-3 등)와 마스킹된 텍스트를 복구하는 스팬 손상 기반 인코더-디코더 아키텍처(T5 등)의 두 가지 범주로 나뉩니다. 자기회귀 모델은 개방형 생성 및 프롬프트 기반 학습에 능숙하지만 파인튜닝 작업에서는 성능이 저하될 수 있습니다. 반대로 T5와 유사한 모델은 지도 파인튜닝에서 좋은 성능을 보이지만 퓨샷 시나리오에서는 효과가 떨어집니다. UL2는 이러한 접근 방식을 통합하여 이 격차를 해소합니다.
UL2의 핵심 혁신은 새로운 사전 학습 패러다임인 통합 언어 학습기(UL2)에 있습니다. 이 프레임워크는 다양한 학습 목표를 디노이징 작업으로 구성하며, 모델은 입력 텍스트의 누락된 하위 시퀀스를 재구성하는 방법을 학습합니다. 사전 학습 중에 UL2는 고유한 디노이저 혼합을 사용하여 다양한 구성의 다양한 목표에서 샘플링합니다. 이 접근 방식을 통해 모델은 여러 학습 전략의 강점을 동시에 활용하여 개별 약점을 완화할 수 있습니다.
UL2의 디노이저 혼합에는 R-디노이징(표준 스팬 손상), X-디노이저(극단적 스팬 손상), S-디노이저(순차적 PrefixLM)의 세 가지 주요 작업이 포함됩니다. 사용자 지정 비율에 따라 이러한 작업에서 샘플링하고 패러다임 토큰(예: [R], [X], [S])을 추가하여 작업을 나타냄으로써 UL2는 더 다재다능하고 강력한 언어 모델을 학습합니다. 이 통합 접근 방식은 생성, 언어 이해, 검색, 장문 이해 및 질문 답변에서 성능을 향상시킵니다.
200억 개의 매개변수를 가진 UL2 20B 모델은 퓨샷 프롬프팅 및 연쇄적 사고(CoT) 추론에서 탁월한 능력을 보여줍니다. XSUM(1샷 요약)과 같은 작업에서 PaLM 및 T5와 같은 다른 최첨단 모델보다 뛰어난 ROUGE 점수를 달성합니다. 또한 UL2 20B는 접근 가능한 규모에서 CoT 프롬프팅 및 추론을 가능하게 하여 고급 추론 기술을 더 많은 연구 커뮤니티에서 사용할 수 있도록 합니다. UL2 20B 체크포인트의 공개 릴리스는 기계 학습 커뮤니티 내에서 더 나은 언어 모델 개발의 발전을 가속화하는 것을 목표로 합니다.
UL2 20B 하이라이트
통합 언어 학습 패러다임
디노이저 혼합 사전 학습 목표
R-디노이징, X-디노이징, S-디노이징 작업 지원
파인튜닝 작업 성능 향상
퓨샷 인컨텍스트 학습 기능 강화
개방형 생성에 탁월
언어 이해에서 강력한 성능
검색 작업에 효과적
장문 이해 가능
질문 답변 작업 지원
공개 릴리스된 200억 매개변수 모델 체크포인트
연쇄적 사고(CoT) 프롬프팅 활성화
접근 가능한 규모의 추론 촉진
UL2 20B 시작하기
모델 액세스: UL2 20B 모델 체크포인트를 얻습니다.
환경 설정: 필요한 라이브러리 및 인프라를 구성합니다.
API를 통한 통합: 모델을 로드하고 입력 데이터를 준비합니다.
작업 정의: 원하는 언어 작업(예: 요약, QA)을 지정합니다.
추론 실행: 모델을 통해 입력 데이터를 처리합니다.
결과 평가: 성능을 위해 모델 출력을 분석합니다.
UL2 20B의 사용 사례
- 퓨샷 학습
- 텍스트 생성
- 언어 이해
- 질문 답변
- 요약
- 추론 작업
- 정보 검색





