Attention Is All You Need 공개 (2017)
2017년 6월 12일 arXiv에 공개된 Transformer 제안 논문의 기록. 순환과 합성곱을 attention으로 대신한 구조 교체와 번역 과제에서의 보고를 다룬다.
고친 내용: 초판
이전의 풍경
2017년 이전의 sequence transduction은 인코더-디코더 구성의 순환 신경망이나 합성곱 신경망이 맡았다. 잘하는 모델들은 인코더와 디코더를 attention으로 잇기도 했지만, 뼈대는 여전히 순차 계산이었다. 순차 계산은 병렬화가 어렵고 학습이 오래 걸리며, 먼 위치 사이의 의존을 잡기 힘들다는 한계가 있었다.
사건: 논문의 공개
2017년 6월 12일, Vaswani 등은 arXiv에 Attention Is All You Need를 공개했다. 제안의 핵심은 단순하다. 순환과 합성곱을 전부 덜어내고 attention만으로 이루어진 Transformer라는 새 구조를 세운 것이다. 입력 안의 모든 위치를 서로 견주는 self-attention이 연산의 중심이 되었고, 순차 계산의 굴레에서 벗어나 병렬 학습이 가능해졌다.
보고된 결과
초록에 따르면 두 기계 번역 과제에서 품질과 효율을 함께 끌어올렸다. WMT 2014 영독 번역에서 28.4 BLEU로 앙상블 포함 기존 최고 기록을 2 BLEU 이상 앞섰고, WMT 2014 영불 번역에서는 단일 모델 최고인 41.8 BLEU를 기록했다. 학습 비용은 기존 최고 모델들의 작은 일부로, 8개 GPU로 3.5일이었다고 한다. 영어 구문 분석에도 적용해 일반화 가능성을 보였다고 보고되었다.
해석의 주의
이 수치들은 2017년의 실험 설정 안에서의 기록이다. 현재의 절대 성능으로 읽어서는 안 된다. 이 사건이 기억의 역사에 남긴 것은 점수보다 구조의 유산이다. 컨텍스트 안의 모든 위치를 견주는 연산이 중심이 되면서, 한 번에 헤아릴 수 있는 입력의 범위가 곧 모델의 작업 기억이 되었다. 이후의 기억 논의는 모두 이 바닥 위에서 벌어진다.
실무의 시사점
이 구조 교체가 실무에 남긴 것은 병렬 학습의 시대와 컨텍스트 중심의 설계다. 순차 계산의 굴레가 풀리자 큰 모델의 학습이 가능해졌고, 입력 안의 모든 위치를 견주는 연산이 중심이 되자 한 번에 건네는 입력의 구성이 곧 성능의 변수가 되었다. 오늘날 프롬프트를 다듬고 검색 결과를 배치하는 일은 모두 이 구조 위에서 벌어진다. 구조를 아는 것이 설계를 아는 첫걸음이다.
현재 판 출처 (이 개정의 출처 보관본 아님) 1건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.