본문으로 건너뛰기
마탑6F 도서관
풍경

에이전트의 형성사: ReAct에서 실무의 정리까지

2022년 ReAct의 생각·행동 교대부터 2023년 Toolformer와 Generative Agents, 2024년 Anthropic의 실무 정리까지 에이전트라는 말이 실체를 얻은 과정을 따라가는 발전 과정 에세이다.

시드 개정 1판원문 대조 2026-09-28기록 2026-09-28T00:00:00Z

고친 내용: 초판

2022년: 생각과 행동을 엮다

2022년 10월 arXiv에 공개된 ReAct는 추론과 행동을 따로 연구하던 흐름에 엮는 답을 냈다. 추론 흔적과 태스크별 행동을 번갈아 생성하게 하자 생각은 계획을 세우고 추적하며 예외를 처리하고, 행동은 지식 베이스와 환경에 닿아 정보를 가져왔다. 질의응답과 사실 검증 과제에서는 단순 Wikipedia API와의 결합만으로 chain-of-thought의 환각과 오류 전파 문제를 완화했다고 보고되었다.

대화형 의사결정 과제에서의 보고도 함께 나왔다. ALFWorld와 WebShop에서 모방학습과 강화학습 방식을 절대 성공률 기준으로 앞섰고, ALFWorld에서는 34%p의 차이가 보고되었다. 사람이 해석하기 쉬운 풀이 궤적을 만든다는 주장도 곁들여졌다. 에이전트라는 말이 아직 굳기 전의 일이지만, 생각과 행동의 루프라는 뼈대는 이때 세워졌다.

2023년: 배우는 도구 사용

2023년 2월의 Toolformer는 호출 규칙을 바깥에서 짜주는 대신 모델이 스스로 익히게 했다. 어떤 API를 언제 어떤 인자로 호출하고 결과를 다음 예측에 반영할지를 자기감독 방식으로 학습시켰고, 계산기와 Q&A 시스템, 두 종류의 검색 엔진, 번역 시스템, 달력이 실험에 쓰였다. 다양한 downstream 태스크의 zero-shot 성능이 크게 올랐고 종종 훨씬 큰 모델과 경쟁할 수 있었으며 핵심 언어모델 능력은 유지되었다고 보고되었다.

스스로 가르친다는 표현은 오해하기 쉽다. 호출 후보를 생성한 뒤 유용한 것만 남기는 파이프라인을 가리키며, 그 설계는 사람의 몫이다. 그럼에도 이 시도의 의의는 분명하다. 도구 사용을 프롬프트의 기술이 아니라 학습의 대상으로 올린 것이다. 이후 에이전트 논의는 무엇을 학습시킬 것인가와 무엇을 절차로 정할 것인가를 함께 묻게 되었다.

2023년: 기억하고 함께 사는 에이전트

같은 해 4월의 Generative Agents는 에이전트의 시간축을 늘였다. 경험을 자연어로 전부 기록하고 성찰로 종합하며 필요할 때 꺼내는 구조 위에 25개 에이전트의 마을을 세운 것이다. 발렌타인데이 파티 시나리오에서 초대 확산과 약속 같은 행동이 나타났다고 보고되었다. 단일 호출의 도구를 넘어 기억과 계획과 회상을 엮은 시스템의 시연이었다.

이 실험을 대하는 태도는 분명해야 한다. 믿음직한 행동의 평가는 설계된 환경과 기준 안의 결과다. 실제 인간 사회의 재현이라는 해석은 과장이다. 이 서가가 이 실험에서 취하는 것은 사회적 행동의 증명이 아니라 기억을 행동의 재료로 쓴 아키텍처의 기록이다. 에이전트의 역사는 이 시연을 기점으로 기억의 문제와 겹치기 시작했다.

2024년: 실무의 언어로 정리하다

2024년 12월 Anthropic의 엔지니어링 글은 연구의 언어가 아니라 실무의 언어로 에이전트를 정리했다. 수십 개 팀과의 협업 경험을 바탕으로 가장 성공적인 구현은 복잡한 프레임워크가 아니라 단순하고 조합 가능한 패턴을 쓴다는 관찰을 전했다. 미리 정해진 코드 경로를 따라 LLM을 엮는 워크플로와 LLM이 스스로 과정과 도구 사용을 이끄는 에이전트를 구분하고, prompt chaining과 routing, parallelization, orchestrator-workers, evaluator-optimizer 같은 패턴을 소개했다.

이 글은 수치 실험의 결과가 아니라 경험 기반의 견해다. 그래서 읽는 법도 다르다. 증명이 아니라 제안으로, 원칙이 아니라 출발점으로 읽어야 한다. 같은 글에 2024년 12월 이후 도구 지형이 바뀌었다는 추신이 붙어 있다는 점도 기록해둔다. 실무의 정리는 시점을 함께 읽어야 한다.

형성사의 요약

2022년부터 2024년까지의 궤적을 줄이면 이렇다. 생각과 행동의 루프가 제안되고, 도구 사용이 학습의 대상이 되고, 기억과 함께 사는 시스템이 시연되고, 마침내 실무의 언어로 정리되었다. 각 단계는 이전을 부정하지 않고 층을 더했다. 오늘날 에이전트라는 말 아래에는 이 층들이 함께 들어 있다.

이 말의 정의가 하나로 굳지 않은 것은 약점이 아니라 이력의 결과다. 누군가 에이전트를 말할 때는 어느 층을 말하는지 물어야 한다. 루프를 말하는지, 학습을 말하는지, 시스템을 말하는지, 아니면 자율성의 정도를 말하는지. 그 질문에 답할 수 있게 되는 것이 이 글을 읽는 소득이다.

층이 겹치는 지점

형성사의 각 단계는 따로 떨어져 있지 않다. 편집자의 비교로 정리하면, ReAct는 호출 결정을 절차로 보여준 사례이고 Toolformer는 그 결정을 학습의 대상으로 올린 사례이며, Generative Agents는 루프가 오래 돌기 위한 기억의 재료를 붙인 사례다. Anthropic의 정리는 이 모든 것을 어디까지 자율에 맡길 것인가를 묻는다. 네 층을 나란히 놓고 읽으면 겹치는 지점이 보인다.

이 겹침을 이해하면 에이전트 논의의 혼선이 풀린다. 루프의 문제를 학습으로 풀려 하거나, 기억의 문제를 절차로 다스리려 하면 어긋난다. 어느 층의 문제인지 먼저 가리고, 그 층의 언어로 말해야 한다. 이 글이 층을 나눠 서술한 것은 역사의 순서 때문이기도 하지만, 오늘의 문제를 층별로 나누어 보기 위해서다.

이후를 읽는 눈

이 형성사 이후의 소식을 만났을 때 물을 질문은 세 가지다. 어느 층의 소식인가. 루프의 개선인지, 학습의 진전인지, 기억의 확장인지, 자율성의 규율인지를 먼저 가린다. 무엇을 근거로 말하는가. 실험의 수치인지, 경험의 관찰인지, 제안의 방향인지를 구분한다. 그리고 어떤 조건에서 통하는가. 조건이 빠진 주장은 반쪽이다. 이 세 질문에 답할 수 있으면 어떤 소식도 제자리에 놓을 수 있다.

현재 판 출처 (이 개정의 출처 보관본 아님) 4건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. ReAct: Synergizing Reasoning and Acting in Language Models (외부)
    S4
  2. Toolformer: Language Models Can Teach Themselves to Use Tools (외부)
    S5
  3. Generative Agents: Interactive Simulacra of Human Behavior (외부)
    S7
  4. Building Effective Agents (외부)
    S9
← 고침 기록으로