본문으로 건너뛰기
마탑6F 도서관
풍경

ReAct 논문 공개 (2022)

2022년 10월 6일 arXiv에 공개된 ReAct 논문의 기록. 추론 흔적과 행동을 번갈아 생성하는 방식과 과제별 보고를 다룬다.

시드 개정 1판원문 대조 2026-09-28기록 2026-09-28T00:00:00Z

고친 내용: 초판

이전의 분리

언어모델의 추론과 행동은 따로 연구되었다. chain-of-thought 같은 추론은 머릿속에서만 맴돌았고, 행동 계획의 생성은 별개의 주제였다. 생각만 이어가면 환각과 오류 전파가 따랐고, 행동만 나열하면 계획의 추적과 예외 처리가 어려웠다. 둘을 엮는 언어가 없었다.

사건: 논문의 공개

2022년 10월 6일, Yao 등은 arXiv에 ReAct: Synergizing Reasoning and Acting in Language Models를 공개했다. 추론 흔적과 태스크별 행동을 번갈아 생성하게 하자 생각은 계획을 세우고 추적하며 예외를 처리하고, 행동은 지식 베이스와 환경에 닿아 정보를 가져왔다. 질의응답과 사실 검증 과제에서는 단순 Wikipedia API와의 결합만으로 chain-of-thought의 환각과 오류 전파 문제를 완화했다고 보고되었다.

보고된 결과

대화형 의사결정 과제에서의 보고도 함께 나왔다. ALFWorld와 WebShop이라는 두 벤치마크에서 모방학습과 강화학습 방식을 절대 성공률 기준으로 앞섰는데, ALFWorld에서는 34%p의 차이가 보고되었다. 추론이나 행동이 빠진 방식보다 사람이 해석하기 쉬운 풀이 궤적을 만든다는 주장도 곁들여졌다. 생각이 그대로 보이는 만큼 어디서 틀렸는지 짚기 쉽다는 것이다.

해석의 주의

이 수치들은 해당 실험 설정 안에서의 보고이며, 모든 환경에서의 우위를 뜻하지 않는다. 행동이 만능도 아니다. 검색 결과가 틀리면 관찰도 틀리고, 행동의 연쇄가 길어지면 실패 지점이 늘어난다. 이 기록의 의의는 점수보다 뼈대에 있다. 생각과 행동의 루프라는 에이전트의 기본 언어가 이때 마련되었다.

실무의 시사점

생각과 행동의 루프를 돌리려면 멈춤의 조건부터 정해야 한다. 몇 번까지 오갈 것인가, 무엇을 관찰의 성공으로 볼 것인가, 실패하면 어떻게 돌아올 것인가. 행동의 연쇄가 길어질수록 실패 지점이 늘어나므로, 각 행동의 결과를 검증하는 눈을 함께 둔다. 생각이 보이는 구조이므로 실패의 기록을 남기기 좋은 것도 장점이다. 어디서 빗나갔는지가 그대로 디버깅의 재료가 된다.

현재 판 출처 (이 개정의 출처 보관본 아님) 1건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. ReAct: Synergizing Reasoning and Acting in Language Models (외부)
    S4
← 고침 기록으로