Toolformer 논문 공개 (2023)
Toolformer는 외부 도구에 기능 실행을 요청하는 API 호출을 모델이 익히도록, 데이터에서 학습 신호를 얻는 자기감독 학습을 적용했다. 2023년 2월 9일 arXiv에 공개된 논문이 제안한 학습 방식과 실험 결과를 설명한다.
고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.
언어 능력과 도구 사용 사이의 차이
언어모델은 규모가 커지면서 몇 개의 예시나 지시문만으로 새로운 과제를 수행했다. 그런데 산술이나 사실 조회에서는 훨씬 작고 단순한 모델보다 성능이 낮았다. 이런 기능은 도구를 연결해 보완할 수 있었지만 어떤 도구를 언제 호출할지는 사람이 정해야 했다.
Toolformer 논문 공개
2023년 2월 9일, Schick 등은 arXiv에 Toolformer: Language Models Can Teach Themselves to Use Tools를 공개했다. 어떤 API를 언제 어떤 인자로 호출할지, 반환된 결과를 다음 토큰 예측에 어떻게 반영할지 모델이 결정하도록 학습시켰다. 자기감독 방식으로 학습하며 API마다 소수의 시연 예시만 있으면 시작할 수 있다고 보고했다. 계산기, 질문에 답하는 Q&A 시스템, 두 종류의 검색 엔진, 번역 시스템, 달력을 실험 도구로 사용했다.
도구 사용을 학습한 결과
초록은 학습한 모델을 적용하는 다양한 후속 과제(downstream)에서, 과제의 예시를 프롬프트에 주지 않는 zero-shot 조건의 성능이 크게 향상됐고 종종 훨씬 큰 모델과 경쟁할 수 있었다고 보고한다. 그러면서도 핵심 언어모델 능력은 유지됐다고 설명한다. 도구 사용을 학습하는 과정에서 기존 언어 능력이 희생되지 않았다는 주장이다.
스스로 학습한다는 표현의 범위
스스로 가르친다는 표현은 사람이 전혀 관여하지 않는다는 뜻이 아니다. API 호출 후보를 생성한 뒤 유용한 후보만 남기는 파이프라인을 가리키며, 그 과정 자체는 사람이 설계한다. 이런 범위를 확인해야 논문의 주장을 과장하지 않을 수 있다. 이 글에서는 성능 점수와 함께 도구 사용을 학습의 대상으로 삼았다는 변화에 주목한다.
학습과 호출 절차 선택하기
도구 사용을 모델에 학습시킬지, 정해진 절차로 처리할지 선택해야 한다. 도구가 적고 호출 규칙이 분명하면 절차로 정하는 편이 빠르고 확실하다. 도구가 많고 호출 여부를 판단하기 까다로우면 학습을 고려할 수 있다. 어느 방식을 택하든 호출 기록을 남기고 실패를 추적해야 한다. 학습과 절차는 서로 필요한 부분을 보완하도록 설계한다.
현재 판 출처 (이 개정의 출처 보관본 아님) 1건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.