본문으로 건너뛰기
마탑6F 도서관
풍경

언어모델의 추론

중간 단계를 적게 하는 chain-of-thought의 주장과 조건, 외부 행동과 엮은 ReAct의 답, 그리고 emergence 서술의 자리까지 추론이라는 말의 층위를 정리한 개념 뼈대 글이다.

시드 개정 1판원문 대조 2026-09-28기록 2026-09-28T00:00:00Z

고친 내용: 초판

추론이란 무엇인가

언어모델의 문맥에서 추론이라는 말은 여러 층위를 가진다. 좁게는 수학 문제처럼 답까지의 단계가 분명한 과제를 푸는 능력이고, 넓게는 계획을 세우고 예외를 처리하는 일반적 문제 해결이다. 벤치마크가 재는 것은 대개 좁은 의미의 추론이며, 넓은 의미의 추론은 측정 자체가 어렵다. 이 글에서 추론이라는 말을 쓸 때는 어느 층위인지 함께 밝힌다.

또 하나 구분할 것은 과정과 결과다. 중간 단계를 그럴듯하게 적는 것과 그 단계가 실제로 답을 이끄는 것은 다르다. 겉으로 보기에는 논리적인 풀이도 속으로는 답을 먼저 정해놓고 끼워 맞춘 것일 수 있다. 이 간극을 faithfulness 문제라고 부르며, 추론 연구의 깊은 논쟁거리다. 이 서가의 출처 범위 안에서는 이 문제를 제기하는 데 그치고 특정 해법을 지지하지 않는다.

생각의 사슬: chain-of-thought

Chain-of-thought 프롬프팅은 발상이 단순하다. 답만 달라고 하지 말고 중간 추론 단계를 함께 보여주는 예시를 몇 개 주고, 모델도 같은 식으로 단계를 밟게 한다. 논문이 보고한 바에 따르면 이 단순한 방법만으로 산술과 상식, 기호 추론 태스크 범위에서 성능이 올랐고, 경험적 이득은 인상적이었다. 대표 사례로 540B 파라미터 모델에 8개의 예시를 주는 것만으로 수학 문제 벤치마크 GSM8K에서 당시 최고 정확도를 달성했고, verifier를 붙인 파인튜닝 GPT-3까지 넘었다고 보고되었다.

이 결과는 파인튜닝 없이 프롬프트만으로 추론 능력을 끌어낼 수 있음을 보인 사례로 읽힌다. 다만 조건이 있다. 충분히 큰 모델에서 관찰된 현상이며, 모든 규모와 모든 태스크에서 같은 효과가 난다는 뜻이 아니다. 논문 초록의 emergence 서술, 즉 충분히 큰 모델에서 추론 능력이 자연스럽게 나타난다는 표현은 이후 논쟁이 된 해석이다. 이 서가는 그 서술이 원 논문에 있음을 전달하되, 정설로 단정하지 않는다.

왜 중간 단계가 도움이 되나

중간 단계가 도움이 되는 이유에 대해서는 몇 가지 해석이 가능하다. 계산을 여러 토큰에 나누어 실을 수 있어 한 번에 답하는 부담이 줄고, 단계마다 앞선 내용을 다시 읽으며 오류를 바로잡을 기회가 생기며, 예시가 문제의 형식을 알려주는 길잡이가 된다. 이 해석들은 이 글의 편집자 관점이며, 원 논문의 직접 주장이 아니다. 원 논문이 보인 것은 방법이 통한다는 경험적 사실에 가깝고, 왜 통하는지는 여전히 설명이 필요한 부분이다.

실무적으로는 중간 단계가 디버깅의 창이 된다는 점이 크다. 답이 틀렸을 때 어느 단계에서 빗나갔는지 볼 수 있기 때문이다. 다만 앞에서 말한 faithfulness 문제를 잊어서는 안 된다. 보이는 단계가 실제 계산의 기록이라는 보장은 없다. 디버깅의 단서로는 유용하되, 증명으로는 부족하다는 것이 이 글의 입장이다.

생각만으로는 부족할 때: ReAct의 답

혼자 생각만 이어가면 환각과 오류 전파가 따른다. 중간 단계가 그럴듯해도 출발점의 사실이 틀렸다면 결론도 틀리기 때문이다. ReAct는 이 문제에 외부 행동을 엮는 답을 냈다. 생각을 적다가 검색 같은 행동으로 사실을 확인하고, 돌아온 관찰을 읽고 다음 생각을 잇는다. 질의응답과 사실 검증 과제에서 단순 Wikipedia API와의 결합만으로 chain-of-thought의 환각과 오류 전파 문제를 완화했다고 보고되었다.

이 결합의 의미는 추론의 정의가 넓어졌다는 데 있다. 머릿속 계산만이 아니라 외부와 오가는 과정 전체가 추론의 일부가 된다. 다만 행동이 만능은 아니다. 검색 결과가 틀리면 관찰도 틀리고, 행동의 연쇄가 길어지면 그만큼 실패 지점이 늘어난다. 생각과 행동의 균형은 태스크마다 다시 맞춰야 하는 설계 변수다.

열린 질문: emergence 서술과 faithfulness

두 가지 질문을 열린 채로 남긴다. 첫째, 추론 능력이 규모와 함께 어떻게 달라지는가. 원 논문에는 충분히 큰 모델에서 능력이 자연스럽게 나타난다는 emergence 서술이 있으며, 이를 둘러싼 이후 논쟁의 세부 내용은 이 서가의 출처 범위에 없어 다루지 않는다. 둘째, 중간 단계는 믿을 만한가. 단계가 답의 진짜 이유인지, 사후 구성된 이야기인지 가리는 일은 어렵다. 이 질문은 평가의 문제이기도 해서 평가 주제 글과 맞닿아 있다.

이 논쟁들을 대하는 이 서가의 태도는 분명하다. 원 논문의 보고는 보고대로, 해석은 해석대로, 미해결은 미해결대로 적는다. 추론이라는 말이 품은 층위를 구분하지 않은 채 점수만 나열하는 일을 경계한다.

실무의 시사점

추론 논의를 실무로 가져오면 몇 가지 지침이 나온다. 복잡한 과제에는 중간 단계를 요구하고, 사실 확인이 필요한 대목에서는 검색 같은 행동을 엮으며, 중간 단계는 디버깅의 재료로 쓰되 증명으로 믿지 않는다. 그리고 효과를 재볼 때는 태스크와 규모를 함께 적는다. 같은 방법도 조건이 바뀌면 결과가 달라지기 때문이다. 이 지침들은 각 출처의 보고를 이 글이 번역한 것으로, 절대 원칙이 아니라 출발점이다.

중간 단계를 요구하는 법

중간 단계를 요구하는 일은 예시를 보이는 것에서 시작한다. 답만 적힌 예시가 아니라 단계를 밟는 예시를 몇 개 보이면 모델도 그 모양을 따라간다. 단계의 수는 과제 따라 조절한다. 간단한 과제에는 짧게, 엮인 과제에는 넉넉하게. 그리고 단계를 요구했다고 끝이 아니라 단계를 읽어야 한다. 어느 대목에서 빗나갔는지를 짚는 읽기가 디버깅의 시작이다.

다만 단계의 요구가 만능은 아니다. 규모가 작은 모델에서는 효과가 다르거나 없을 수 있고, 사실 확인이 필요한 대목에서는 생각만으로 메꿔지지 않는다. 그럴 때는 검색 같은 행동을 엮는다. 생각의 사슬과 행동의 고리를 함께 쓰는 것이 이 주제가 권하는 모양이다.

현재 판 출처 (이 개정의 출처 보관본 아님) 2건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (외부)
    S3
  2. ReAct: Synergizing Reasoning and Acting in Language Models (외부)
    S4
← 고침 기록으로