본문으로 건너뛰기
마탑6F 도서관
풍경

RAG 논문 공개 (2020)

2020년 5월 22일 arXiv에 공개된 검색 증강 생성 논문의 기록. 파라메트릭과 비파라메트릭 기억의 결합 구조와 지식 집약 과제에서의 보고를 다룬다.

시드 개정 1판원문 대조 2026-09-28기록 2026-09-28T00:00:00Z

고친 내용: 초판

이전의 한계

사전학습 언어모델은 가중치 안에 사실 지식을 품고 있었지만, 지식을 정확히 꺼내고 다루는 능력은 제한적이었다. 지식 집약 과제에서는 태스크 전용 구조에 뒤처졌고, 결정의 근거를 대는 일과 세계 지식을 갱신하는 일은 열린 문제로 남아 있었다. 미분 가능한 통로로 외부 기억에 닿는 시도는 있었지만 추출형 과제에 머물러 있었다.

사건: 논문의 공개

2020년 5월 22일, Lewis 등은 arXiv에 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks를 공개했다. 사전학습 seq2seq 모델이라는 파라메트릭 메모리와 Wikipedia의 dense vector 인덱스라는 비파라메트릭 메모리, 그리고 둘을 잇는 사전학습 neural retriever를 결합한 생성 모델을 제안했다. 검색된 구절을 생성 전체에 고정해 쓰는 방식과 토큰마다 다르게 참고하는 방식, 두 formulation을 비교했다.

보고된 결과

초록에 따르면 지식 집약 NLP 태스크의 넓은 범위에서 파인튜닝하고 평가한 결과, 세 개의 open-domain 질의응답 과제에서 당시 최고 성능을 기록했다. 비교 대상은 파라메트릭 seq2seq 모델과 태스크 전용 retrieve-and-extract 구조였다. 외부 기억을 붙인 생성이 순수 파라메트릭 생성을 앞설 수 있음을 보인 사례로 읽힌다.

해석의 주의

이 보고는 2020년의 실험 설정 안에서 의미를 가진다. 인덱스 구성과 retriever 품질, 과제 선택이 결과에 영향을 준다. 또한 RAG라는 말은 원 논문의 구조를 넘어 검색을 곁들인 생성을 통틀어 가리키게 되었다. 이 기록을 읽을 때는 원 논문의 구조와 뒤이은 넓은 용법을 구분해야 한다. 검색 실패가 곧장 오답으로 이어진다는 대가도 함께 기억해야 한다.

실무의 시사점

외부 기억을 두기로 했다면 운영의 문제를 함께 안아야 한다. 인덱스를 최신으로 유지하고 낡은 문서를 가려내며, 검색 실패를 감지하고 대비하는 일이다. 검색과 생성의 분업도 정해야 한다. 무엇을 검색에 맡기고 무엇을 모델의 판단에 맡길 것인가. 이 기록의 구조가 오늘의 설계에 주는 교훈은 결합의 발상 자체보다 결합의 대가를 함께 보는 태도다.

현재 판 출처 (이 개정의 출처 보관본 아님) 1건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (외부)
    S2
← 고침 기록으로