설명
대규모 언어 모델링의 발전에 힘입어 Google DeepMind는 텍스트 기반 출력을 넘어 작동하도록 설계된 단일 일반화 에이전트인 Gato를 개발했습니다. Gato는 멀티모달, 멀티태스크, 멀티-임보디먼트 일반화 정책으로 기능합니다. 동일한 신경망과 동일한 가중치를 사용하여 Atari 게임 플레이, 이미지 캡셔닝, 대화 참여, 실제 로봇 팔을 사용한 객체 조작 등 다양한 활동에 참여할 수 있습니다. 의사 결정 과정은 제공된 컨텍스트에 따라 동적으로 조정되어 텍스트, 조인트 토크, 버튼 누름 또는 기타 형태의 토큰을 출력할지 결정합니다.
훈련 단계에서 Gato는 다양한 작업과 모달리티의 데이터를 평탄한 토큰 시퀀스로 직렬화하여 처리합니다. 이 시퀀스는 대규모 언어 모델에 사용되는 것과 유사한 트랜스포머 신경망으로 배치 처리됩니다. 훈련 손실은 Gato가 액션 및 텍스트 타겟 예측에 집중하도록 마스킹됩니다. Gato를 배포할 때, 프롬프트(데모일 수 있음)를 토큰화하여 초기 시퀀스가 형성됩니다. 그런 다음 환경에서 첫 번째 관찰을 제공하며, 이 역시 토큰화되어 이 시퀀스에 추가됩니다. Gato는 한 번에 하나의 토큰씩 액션 벡터를 자기회귀적으로 샘플링합니다. 액션 벡터를 구성하는 모든 토큰이 환경의 액션 사양에 따라 샘플링되면, 액션이 디코딩되어 환경으로 전송됩니다. 환경이 스텝을 진행하여 새로운 관찰을 생성하고, 프로세스가 반복됩니다. 중요한 것은 모델이 1024 토큰의 컨텍스트 창 내에서 모든 이전 관찰과 액션에 항상 액세스할 수 있다는 것입니다.
Gato는 시뮬레이션 및 실제 환경의 에이전트 경험과 다양한 자연어 및 이미지 데이터셋을 포함하는 광범위한 데이터셋 모음으로 훈련됩니다. 사전 훈련된 Gato 모델의 성능은 수많은 작업에서 전문가 점수의 백분율을 초과하는 능력으로 측정되며, 도메인별로 분류됩니다. 시각화는 Gato가 이미지 캡셔닝 수행, 대화형 대화 참여, 로봇 팔 제어 등 다양한 작업을 동일한 가중치 세트로 수행할 수 있는 능력을 보여줍니다.
Gato Generalist Agent 하이라이트
멀티모달 기능
멀티태스크 성능
멀티-임보디먼트 제어
트랜스포머 신경망 아키텍처
자기회귀 액션 샘플링
1024 토큰 컨텍스트 창
다양한 데이터셋으로 훈련됨
일반화 정책 에이전트
Gato Generalist Agent 시작하기
모델 액세스: Gato 일반화 에이전트에 액세스합니다.
인증: 필요한 인증 자격 증명을 설정합니다.
환경 설정: 상호 작용을 위한 대상 환경을 구성합니다.
API를 통한 통합: 제공된 API 엔드포인트를 사용하여 작업을 실행합니다.
프롬프트 제공: 토큰화된 프롬프트 또는 데모를 입력합니다.
관찰 수신: 환경 관찰을 처리합니다.
액션 샘플링: 액션 토큰을 자기회귀적으로 샘플링합니다.
디코딩 및 실행: 샘플링된 토큰을 실행 가능한 액션으로 디코딩합니다.
Gato Generalist Agent의 사용 사례
- 로봇 제어
- 이미지 캡셔닝
- 대화형 대화
- 게임 플레이
- 멀티모달 이해
- 일반 AI 연구








