본문으로 건너뛰기
마탑6F 도서관
풍경

ReAct 논문 공개 (2022)

ReAct는 추론 과정과 행동을 번갈아 생성하는 방식이다. 2022년 10월 6일 arXiv에 공개된 논문을 바탕으로 이 구조와 과제별 실험 결과를 소개한다.

시드 개정 2판원문 대조 2026-09-28기록 2026-09-29T12:35:50Z

고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.

따로 연구하던 추론과 행동

언어모델의 추론과 행동은 별도로 연구됐다. 중간 추론 단계를 글로 적는 chain-of-thought는 외부 환경과 상호작용하지 않고 추론을 이어가는 방식이었고, 행동 계획을 만드는 일은 다른 주제였다. 추론만 이어가면 환각과 오류 전파 문제가 생겼으며, 행동만 나열하면 계획의 진행 상황을 추적하거나 예외를 처리하기 어려웠다. 두 과정을 연결할 방법이 필요했다.

ReAct 논문 공개

2022년 10월 6일, Yao 등은 arXiv에 ReAct: Synergizing Reasoning and Acting in Language Models를 공개했다. 추론 과정과 과제별 행동을 번갈아 생성하도록 한 방식이다. 추론은 계획 수립·추적·예외 처리를 담당하고 행동은 지식 베이스와 환경에 접근해 정보를 가져온다. 질의응답과 사실 검증 과제에서는 프로그램으로 위키피디아 정보에 접근하는 간단한 Wikipedia API와 결합하는 것만으로 chain-of-thought의 환각과 오류 전파 문제를 완화했다고 보고했다.

의사결정 과제에서 보고한 결과

대화형 의사결정 과제인 ALFWorld와 WebShop의 결과도 보고됐다. 두 벤치마크에서 시연을 따라 배우는 모방학습과 보상을 바탕으로 배우는 강화학습 방식보다 절대 성공률이 높았으며, ALFWorld에서는 34%p의 차이를 보였다. 추론이나 행동을 제외한 방식보다 사람이 풀이 과정을 해석하기 쉽다는 주장도 제시했다. 출력된 추론 과정을 따라가며 오류가 생긴 지점을 확인하기 쉽다는 설명이다.

행동의 결과도 검증해야 하는 이유

이 수치들은 해당 실험 설정에서 나온 결과이므로 모든 환경에서 우수하다는 뜻은 아니다. 잘못된 검색 결과는 관찰에도 영향을 주고, 행동을 오래 이어갈수록 실패할 지점이 늘어난다. 이 글에서는 점수와 함께 추론과 행동을 반복하는 구조에 주목한다. 이후 에이전트 설계에서 기본이 된 흐름을 제시했다는 의미다.

반복을 멈출 조건과 실패 처리

추론과 행동을 반복하려면 멈출 조건부터 정해야 한다. 반복 횟수, 관찰이 성공했다고 판단할 기준, 실패 후 복구 방법을 결정한다. 행동이 길게 이어질수록 실패 지점도 늘어나므로 각 행동의 결과를 검증할 절차를 함께 둔다. 추론 과정이 출력되는 구조는 실패 기록을 남기기에도 유리하다. 오류가 발생한 단계를 디버깅에 활용할 수 있다.

현재 판 출처 (이 개정의 출처 보관본 아님) 1건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. ReAct: Synergizing Reasoning and Acting in Language Models (외부)
    S4
← 고침 기록으로