에이전트 연구의 발전: ReAct에서 실무 적용까지
2022년 ReAct, 2023년 Toolformer와 Generative Agents, 2024년 Anthropic의 글을 통해 도구 사용·학습·기억·자율성에 관한 논의가 어떻게 발전했는지 살펴본다.
고친 내용: 독자에게 보이는 문장과 용어를 다듬고 기존 근거 연결을 유지했다.
2022년: 추론과 행동을 결합하다
2022년 10월 arXiv에 공개된 ReAct는 추론 과정과 과제별 행동을 번갈아 생성하는 방법을 제안했다. 추론 과정은 계획을 세우고 진행 상황을 확인하며 예외를 처리하는 데 쓰인다. 행동은 지식 베이스나 실행 환경에서 정보를 가져오는 역할을 한다. 질의응답과 사실 검증 과제에서는 단순 Wikipedia API와 결합하는 것만으로 chain-of-thought의 환각과 오류 전파 문제를 완화했다고 보고했다.
대화형 의사결정 과제에서의 보고도 함께 나왔다. ALFWorld와 WebShop에서 모방학습과 강화학습 방식을 절대 성공률 기준으로 앞섰고, ALFWorld에서는 34%p의 차이가 보고되었다. 사람이 해석하기 쉬운 풀이 과정을 만든다는 주장도 곁들여졌다. 에이전트가 추론과 행동을 반복하는 구조를 보여준 사례다.
2023년: 도구 사용을 학습하다
2023년 2월의 Toolformer는 모델이 API 호출을 학습하도록 했다. 어떤 API를 언제 어떤 인자로 호출할지, 결과를 다음 토큰 예측에 어떻게 반영할지를 자기감독 방식으로 학습시켰다. 계산기와 Q&A 시스템, 두 종류의 검색 엔진, 번역 시스템, 달력이 실험에 쓰였다. 논문은 다양한 응용 과제에서 풀이 예시를 주지 않고 평가하는 zero-shot 성능이 크게 향상됐다고 보고했다. 종종 훨씬 큰 모델과 경쟁할 수 있었고 기본적인 언어모델 능력도 유지됐다는 설명이다.
모델이 스스로 학습한다는 표현은 오해하기 쉽다. 호출 후보를 생성한 뒤 유용한 것만 남기는 파이프라인을 가리키며, 이 파이프라인은 사람이 설계한다. Toolformer는 도구 사용을 학습으로 다룬 사례다. 이후 에이전트 연구자들은 어떤 동작을 모델에 학습시키고 어떤 동작을 정해진 절차로 처리할지 함께 다루게 되었다.
2023년: 기억을 활용하는 에이전트
같은 해 4월의 Generative Agents는 에이전트가 과거 경험을 활용하는 구조를 선보였다. 경험을 자연어로 전부 기록하고 성찰로 종합하며 필요할 때 꺼내는 구조 위에 25개 에이전트의 마을을 세운 것이다. 발렌타인데이 파티 시나리오에서 초대 확산과 약속 같은 행동이 나타났다고 보고되었다. 기억·계획·회상을 결합한 시스템을 시연한 것이다.
실험 결과는 평가 조건과 함께 읽어야 한다. 행동이 자연스러웠다는 평가는 설계된 환경과 기준 안의 결과다. 실제 인간 사회를 재현했다고 해석하기는 어렵다. 이 글에서는 기억을 활용해 행동을 결정하는 아키텍처를 살펴보며, 이를 통해 에이전트 설계와 기억 시스템의 관계를 설명한다.
2024년: 실무 구현 방식을 정리하다
2024년 12월 Anthropic의 엔지니어링 글은 수십 개 팀과 협업한 경험을 바탕으로 에이전트 구현 방식을 정리했다. 가장 성공적인 구현은 복잡한 프레임워크가 아니라 단순하고 조합 가능한 패턴을 쓴다는 관찰을 전했다. 미리 정해진 코드 경로를 따라 LLM을 연결하는 워크플로와 LLM이 스스로 과정과 도구 사용을 결정하는 에이전트를 구분했다. 패턴으로는 프롬프트를 순서대로 이어 실행하는 prompt chaining, 입력에 맞는 처리 경로를 고르는 routing, 작업을 병렬로 실행하는 parallelization, 조정자가 작업을 나눠 다른 작업자에게 맡기는 orchestrator-workers, 평가 결과를 받아 출력을 반복 수정하는 evaluator-optimizer를 소개했다.
이 글은 수치 실험의 결과가 아니라 경험 기반의 견해다. 실험으로 검증한 보편적 원칙보다는 실무에 적용해 볼 제안으로 읽어야 한다. 같은 글에 2024년 12월 이후 사용할 수 있는 도구가 달라졌다는 추신이 붙어 있다는 점도 기록해둔다. 실무 지침을 적용할 때는 작성 시점도 확인해야 한다.
연구마다 다룬 문제
2022년부터 2024년까지 연구자들은 추론과 행동의 반복, 도구 사용 학습, 기억 활용 등 서로 다른 문제를 다뤘다. Anthropic은 이와 관련한 실무 구현 방식을 정리했다. 에이전트라는 용어에는 이런 여러 접근이 함께 포함된다.
에이전트의 정의가 하나로 정해지지 않은 배경도 여기에 있다. 에이전트를 논의할 때는 실행 절차, 학습 방식, 시스템 구성, 자율성 가운데 무엇을 다루는지 먼저 확인해야 한다.
서로 보완하는 접근
이 연구들은 서로 관련이 있다. 편집자의 관점에서 비교하면 ReAct는 도구 호출 결정을 실행 절차로 보여주고, Toolformer는 그 결정을 학습으로 다룬다. Generative Agents는 작업을 이어갈 때 필요한 기억을 활용한다. Anthropic의 구분으로는 이런 과정에서 모델에 어느 정도의 자율성을 줄지 검토할 수 있다.
각 접근이 해결하려는 문제를 구분하면 논의가 명확해진다. 실행 절차, 학습, 기억 가운데 어느 부분에서 문제가 생겼는지 먼저 확인해야 한다. 이 글에서 연구를 나누어 살펴본 것도 각 연구가 다루는 문제를 구분하기 위해서다.
새 연구를 읽을 때 확인할 점
새로운 에이전트 연구를 읽을 때는 무엇이 달라졌는지부터 확인한다. 실행 절차, 학습, 기억, 자율성 중 어디를 개선했는지 살펴본다. 근거가 실험 수치인지, 실무 관찰인지, 아직 검증하지 않은 제안인지도 구분해야 한다. 마지막으로 효과를 확인한 조건을 살피면 기존 연구와 비교하기 쉽다.
현재 판 출처 (이 개정의 출처 보관본 아님) 4건
아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.