Attention Is All You Need 공개 (2017)
2017년 6월 12일 arXiv에 공개된 Transformer 논문은 순환과 합성곱을 입력 정보 사이의 관련성을 계산하는 attention으로 대체했다. 구조가 어떻게 달라졌는지와 번역 과제에서 어떤 결과를 보고했는지 살펴본다.
고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.
순차 계산의 제약
2017년 이전에는 입력을 표현으로 바꾸는 인코더와 출력을 생성하는 디코더로 구성된 순환 신경망이나 합성곱 신경망이 입력 시퀀스를 출력 시퀀스로 변환하는 sequence transduction을 수행했다. 성능이 좋은 모델은 인코더와 디코더를 attention으로 연결하기도 했지만 순차 계산이 여전히 기본이었다. 이 방식은 병렬화가 어렵고 학습에 시간이 걸리며, 멀리 떨어진 위치 사이의 의존 관계를 파악하기 어렵다는 제약이 있었다.
Transformer 논문 공개
2017년 6월 12일, Vaswani 등은 arXiv에 Attention Is All You Need를 공개했다. 순환과 합성곱을 없애고 attention만으로 구성한 Transformer를 제안했다. 입력의 각 위치가 다른 위치와 어떤 관계를 맺는지 계산하는 self-attention을 중심에 둔 구조로, 순차 계산의 제약을 줄여 병렬 학습이 가능해졌다.
번역 과제에서 보고한 결과
초록은 두 기계 번역 과제에서 품질과 효율이 모두 향상됐다고 보고한다. 기계번역 평가대회 WMT 2014 영어·독일어 번역에서는 번역문을 기준 번역과 비교하는 BLEU 점수로 28.4를 기록해, 여러 모델의 결과를 결합한 앙상블을 포함한 기존 최고 기록을 2 BLEU 이상 앞섰다. WMT 2014 영어·프랑스어 번역에서는 단일 모델 최고인 41.8 BLEU를 기록했다. 8개 GPU로 학습하는 데 3.5일이 걸렸으며, 비용은 기존 최고 모델들이 사용한 비용의 작은 일부였다고 한다. 영어 구문 분석에도 적용해 일반화 가능성을 보였다고 보고했다.
당시 성능과 구조의 의미 구분하기
이 수치들은 2017년의 실험 설정에서 나온 기록이므로 현재의 절대 성능으로 읽어서는 안 된다. 기억 연구의 관점에서 이 논문을 살펴볼 때는 점수와 함께 구조의 변화에 주목할 수 있다. 컨텍스트 안의 각 위치를 비교하는 연산이 중심이 되면서 한 번에 처리하는 입력 범위가 모델의 작업 기억을 결정하게 됐다. 이후 기억에 관한 논의도 이 구조를 바탕으로 전개된다.
컨텍스트 구성에 미친 영향
Transformer는 병렬 학습과 컨텍스트 중심의 설계에 영향을 주었다. 순차 계산의 제약이 줄면서 큰 모델을 학습할 수 있게 됐고, 입력의 모든 위치를 비교하는 방식에서는 한 번에 전달하는 입력의 구성이 성능에 영향을 미쳤다. 프롬프트를 다듬거나 검색 결과를 배치할 때 이 구조를 이해하면 설계의 이유를 설명하는 데 도움이 된다.
현재 판 출처 (이 개정의 출처 보관본 아님) 1건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.