설명
PaLM-E는 추상적인 언어 이해와 실제 물리적 상호 작용 간의 격차를 해소하도록 설계된 체화된 멀티모달 언어 모델을 도입함으로써 인공지능 분야의 중요한 발전을 나타냅니다. 전통적인 대규모 언어 모델은 복잡한 텍스트 작업에는 뛰어나지만, 로봇 공학과 같은 응용 분야에 필수적인 연속적인 실제 센서 데이터에 지식을 기반화하는 데 어려움을 겪습니다. PaLM-E는 시각적 입력 및 상태 추정과 같은 모달리티를 언어 모델의 처리 파이프라인에 직접 통합함으로써 이러한 과제를 해결합니다.
PaLM-E의 핵심 아키텍처 혁신은 사전 훈련된 언어 모델의 언어 임베딩 공간에 연속적인 체화된 관찰을 주입하는 방법에 있습니다. 이는 센서 데이터를 언어 모델의 토큰 임베딩과 동일한 차원을 공유하는 벡터 시퀀스로 인코딩하여 달성됩니다. 이를 통해 모델은 텍스트, 이미지, 연속적인 상태 추정을 포함한 멀티모달 입력을 통합된 방식으로 처리하고 추론할 수 있습니다. PaLM-E는 PaLM이라는 디코더 전용 대규모 언어 모델 아키텍처를 기반으로 구축되었으며, 체화된 작업을 처리하도록 기능을 확장합니다.
PaLM-E는 다양한 체화된 추론 작업에서 뛰어난 성능을 보여주었습니다. 평가는 순차적인 로봇 조작 계획, 시각적 질의응답 및 캡셔닝 능력을 보여줍니다. 단일의 대규모 체화된 멀티모달 모델인 PaLM-E는 다양한 추론 과제를 여러 관찰 모달리티와 여러 로봇 체화에 걸쳐 처리할 수 있습니다. 특히, 광범위한 인터넷 규모의 언어, 비전, 시각-언어 데이터셋에 대한 공동 훈련을 통해 성능이 향상되는 긍정적인 전이를 보여줍니다. 가장 큰 변형인 PaLM-E-562B는 로봇 공학에서 뛰어날 뿐만 아니라 일반적인 비전-언어 모델로도 기능하며, 규모가 증가함에 따라 일반적인 언어 능력을 유지하면서 OK-VQA와 같은 벤치마크에서 최첨단 결과를 달성합니다.
이 모델의 실용적인 응용은 장기 로봇 작업의 예시를 통해 설명됩니다. PaLM-E는 로봇 카메라의 시각적 피드백을 통합하여 "서랍에서 라이스 칩을 가져와" 또는 "녹색 별을 가져와"와 같은 지침을 해석하고 다단계 계획을 실행할 수 있습니다. 또한 블록을 색상별로 배열하거나 밀기 작업을 수행하기 위해 로봇을 제어하고, 저수준 정책에 단계별 명령을 순차적으로 전달할 수 있습니다. 더욱이, PaLM-E는 인상적인 일반화 능력을 보여주며, 이러한 특정 객체나 시나리오가 직접적인 훈련 데이터에 포함되지 않았음에도 불구하고 "빨간 블록을 커피잔으로 밀어라" 또는 "녹색 블록을 거북이에게 밀어라"와 같은 작업을 성공적으로 실행합니다. 이러한 적응성은 새로운 상황에서 강력한 이해 및 추론 능력을 강조합니다.
PaLM-E 하이라이트
체화된 멀티모달 언어 모델
시각 및 연속 상태 센서 모달리티 통합
언어를 실제 인식에 기반화
로봇 조작 계획 지원
시각적 질의응답 지원
이미지 캡셔닝 가능
도메인 전반에 걸친 긍정적인 전이 학습 시연
다양한 로봇 체화 처리
OK-VQA에서 최첨단 성능 달성
일반적인 언어 능력 유지
멀티모달 문장 처리
자기회귀적으로 텍스트 완성 생성
PaLM-E 시작하기
모델 액세스: 체화된 AI 작업에 PaLM-E 모델을 활용합니다.
데이터 입력: 시각, 상태 추정 및 텍스트 인코딩을 포함하는 멀티모달 문장을 제공합니다.
모델 훈련: 사전 훈련된 대규모 언어 모델과 함께 인코딩을 종단 간으로 훈련합니다.
작업 실행: 순차적인 로봇 조작 계획에 배포합니다.
추론 수행: 시각적 질의응답 및 캡셔닝에 적용합니다.
성능 평가: 다양한 체화된 추론 작업에서 기능을 평가합니다.
로봇 공학 통합: 실제 로봇 제어 및 계획에 사용합니다.
PaLM-E의 사용 사례
- 로봇 조작
- 시각적 질의응답
- 이미지 캡셔닝
- 체화된 추론
- 일반화 AI
- 로봇 공학 계획
- 교차 도메인 학습








