본문으로 건너뛰기
마탑6F 도서관
풍경

Chain-of-Thought 논문 공개 (2022)

중간 추론 단계를 담은 예시만으로 복잡한 추론의 성능을 높일 수 있을까. 2022년 1월 28일 arXiv에 공개된 CoT 프롬프팅 논문의 보고와 그 적용 조건을 설명한다.

시드 개정 2판원문 대조 2026-09-28기록 2026-09-29T12:35:50Z

고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.

답만 요구하는 프롬프트의 한계

큰 언어모델도 복잡한 추론 문제에서 답만 요구하면 오류를 내곤 했다. 중간 과정을 밟게 할 방법이 없는 상황에서는 추론 능력을 높이기 위해 추가 데이터로 모델을 조정하는 파인튜닝 같은 비용이 드는 수단이 필요해 보였다. 답을 생성하는 것과 그 답에 이르는 과정을 추론하는 것은 서로 다른 일처럼 보였다.

CoT 프롬프팅 논문 공개

2022년 1월 28일, Wei 등은 arXiv에 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models를 공개했다. 중간 추론 단계를 담은 예시 몇 개를 보여주고 모델도 같은 방식으로 단계를 거치게 하는 방법이다. 세 개의 큰 언어모델로 실험한 결과, 산술·상식·기호 추론 과제에서 성능이 향상됐으며 연구진은 실험에서 얻은 개선 폭을 인상적이라고 평가했다.

수학 문장제에서 보고한 사례

초록에서 소개한 대표 사례는 수학 문장제로 구성된 평가 문제 모음인 벤치마크 GSM8K다. 540B 파라미터 모델에 8개의 chain-of-thought 예시를 주는 것만으로 당시 최고 정확도를 달성했으며, 답 후보의 타당성을 평가하는 verifier를 붙인 파인튜닝 GPT-3의 성능도 넘어섰다고 보고했다. 파인튜닝 없이 프롬프트로 추론 능력을 끌어낸 사례로 볼 수 있다. 초록은 충분히 큰 모델에서 이러한 능력이 자연스럽게 나타난다는 emergence 설명도 제시한다.

모델 규모와 해석의 범위

이 결과는 충분히 큰 모델에서 관찰됐으므로 모든 규모와 과제에서 같은 효과가 난다는 뜻은 아니다. emergence에 관한 이후 논쟁의 세부 내용은 이 글에서 확인한 출처의 범위를 벗어나 다루지 않는다. 중간 단계를 설득력 있게 적었다고 해서 모델이 답을 낸 실제 이유가 드러나는 것도 아니다. 여기서는 원 논문의 보고를 조건과 함께 전달하며, 그 해석을 정설로 단정하지 않는다.

예시와 추론 단계 점검하기

모델이 중간 추론 단계를 출력하게 하려면 풀이 과정이 담긴 예시를 보여줘야 한다. 모델은 예시에서 본 단계의 형식을 따라 답을 작성한다. 다만 충분히 큰 모델에서 관찰한 효과이므로 작은 모델에 적용할 때는 다시 측정해야 한다. 출력된 과정도 직접 읽어 어느 단계에서 오류가 생겼는지 확인해야 다음 시도를 개선할 수 있다.

현재 판 출처 (이 개정의 출처 보관본 아님) 1건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (외부)
    S3
← 고침 기록으로