본문으로 건너뛰기
마탑6F 도서관
풍경

Chain-of-Thought 논문 공개 (2022)

2022년 1월 28일 arXiv에 공개된 CoT 프롬프팅 논문의 기록. 중간 추론 단계 예시만으로 복잡한 추론을 끌어낸 보고와 그 조건을 다룬다.

시드 개정 1판원문 대조 2026-09-28기록 2026-09-28T00:00:00Z

고친 내용: 초판

이전의 풍경

큰 언어모델도 복잡한 추론 앞에서는 답만 달라고 하면 곧잘 틀렸다. 중간 과정을 밟게 하는 방법이 없었고, 추론 능력을 끌어내려면 파인튜닝 같은 무거운 수단이 필요해 보였다. 답을 내는 것과 이유를 밟는 것은 서로 다른 일처럼 보였다.

사건: 논문의 공개

2022년 1월 28일, Wei 등은 arXiv에 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models를 공개했다. 방법은 단순하다. 중간 추론 단계를 보여주는 예시를 몇 개 주고 모델도 같은 식으로 단계를 밟게 한다. 세 개의 큰 언어모델에서 실험한 결과, 산술과 상식, 기호 추론 태스크 범위에서 성능이 올랐고 경험적 이득은 인상적이었다고 보고되었다.

대표 사례

초록이 내세운 대표 사례는 수학 단어 문제 벤치마크 GSM8K다. 540B 파라미터 모델에 8개의 chain-of-thought 예시를 주는 것만으로 당시 최고 정확도를 달성했고, verifier를 붙인 파인튜닝 GPT-3까지 넘었다는 것이다. 파인튜닝 없이 프롬프트만으로 추론 능력을 끌어낼 수 있음을 보인 사례로 읽힌다. 초록에는 충분히 큰 모델에서 이런 능력이 자연스럽게 나타난다는 emergence 서술도 있다.

해석의 주의

조건을 분명히 해야 한다. 충분히 큰 모델에서 관찰된 현상이며, 모든 규모와 태스크에서 같은 효과가 난다는 뜻이 아니다. emergence 서술을 둘러싼 이후 논쟁의 세부 내용은 이 서가의 출처 범위에 없어 다루지 않는다. 또한 중간 단계를 잘 적는 것과 진짜 이유를 밝히는 것은 다르다. 이 기록은 원 논문의 보고를 그 조건과 함께 전달할 뿐, 정설로 단정하지 않는다.

실무의 시사점

중간 단계를 끌어내려면 예시를 잘 보여야 한다. 답만 적힌 예시가 아니라 단계를 밟는 예시를 몇 개 보이면 모델도 그 모양을 따라간다. 다만 규모 조건을 잊어서는 안 된다. 충분히 큰 모델에서 관찰된 현상이므로 작은 모델에서는 효과를 재보고 판단해야 한다. 단계를 요구한 뒤에는 단계를 읽는 일까지가 한 묶음이다. 어디서 빗나갔는지를 짚어야 다음 시도가 있다.

현재 판 출처 (이 개정의 출처 보관본 아님) 1건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (외부)
    S3
← 고침 기록으로