본문으로 건너뛰기
마탑6F 도서관
풍경

에이전트와 도구 사용

생각과 행동을 번갈아 엮는 ReAct, 스스로 도구를 배우는 Toolformer, 단순한 패턴을 권하는 Anthropic의 정리까지, 에이전트라는 말의 실체를 정리한 개념 뼈대 글이다.

시드 개정 1판원문 대조 2026-09-28기록 2026-09-28T00:00:00Z

고친 내용: 초판

도구를 쓰는 언어모델

언어모델은 말은 잘하지만 손이 없다. 계산을 틀리고, 최신 사실을 모르며, 외부 시스템에 직접 닿지 못한다. 도구 사용은 이 한계를 메우는 발상이다. 모델이 필요할 때 검색이나 계산기, 코드 실행 같은 외부 기능의 호출을 생성하게 하고, 그 결과를 다시 읽어 다음 단계를 정하게 한다. 이때 모델의 출력은 최종 답이 아니라 다음 행동의 계획이 되기도 한다.

도구를 붙이는 방식은 크게 두 갈래다. 하나는 프롬프트와 절차로 엮는 방식으로, 모델 자체는 그대로 두고 호출 규칙을 바깥에서 정해준다. 다른 하나는 도구 호출 자체를 학습시키는 방식으로, 언제 무엇을 호출할지를 모델이 익히게 한다. ReAct가 전자라면 Toolformer는 후자에 가깝다. 두 갈래는 경쟁이 아니라 필요에 따라 섞어 쓰는 재료다.

생각과 행동의 교대: ReAct

ReAct는 추론 흔적과 행동을 번갈아 생성하는 프롬프트 방식이다. 모델은 먼저 상황을 헤아리는 생각을 적고, 그에 맞는 행동을 취하고, 돌아온 관찰을 읽은 뒤 다음 생각을 잇는다. 생각은 계획의 수립과 추적, 예외 처리를 돕고, 행동은 지식 베이스나 실행 환경 같은 외부와 모델을 이어준다. 논문이 보고한 바에 따르면 질의응답과 사실 검증 과제에서는 단순 Wikipedia API와의 결합만으로 chain-of-thought의 환각과 오류 전파 문제를 완화했다.

대화형 의사결정 과제에서의 보고도 눈에 띈다. ALFWorld와 WebShop이라는 두 벤치마크에서 모방학습과 강화학습 방식을 절대 성공률 기준으로 앞섰는데, ALFWorld에서는 34%p의 차이가 보고되었다. 또한 추론이나 행동이 빠진 방식보다 사람이 해석하기 쉬운 풀이 궤적을 만든다고 주장한다. 생각이 그대로 보이는 만큼 어디서 틀렸는지 짚기 쉽다는 것이다. 다만 이 수치들은 해당 실험 설정 안에서의 보고이며, 모든 환경에서의 우위를 뜻하지 않는다.

스스로 배우는 도구 사용: Toolformer

Toolformer는 방향을 달리 잡는다. 호출 규칙을 사람이 짜주는 대신, 모델이 API 호출을 스스로 익히게 한다. 학습은 자기감독 방식으로 이루어지며 API마다 소수의 시연 예시만으로 시작한다고 보고되었다. 계산기와 Q&A 시스템, 두 종류의 검색 엔진, 번역 시스템, 달력이 실험에 쓰인 도구다. 어떤 API를 언제 어떤 인자로 호출하고 결과를 다음 토큰 예측에 어떻게 반영할지를 모델이 결정하게 학습시킨 것이다.

보고된 결과는 두 가지다. 다양한 downstream 태스크의 zero-shot 성능이 크게 올랐고, 종종 훨씬 큰 모델과 경쟁할 수 있었다는 것, 그리고 핵심 언어모델 능력은 유지되었다는 것이다. 스스로 가르친다는 표현이 사람 손이 전혀 안 간다는 뜻은 아니다. 호출 후보를 생성한 뒤 유용한 것만 남기는 파이프라인을 가리키며, 그 설계 자체는 사람의 몫이다. 이 점은 원 논문의 주장을 과장 없이 읽는 데 중요하다.

워크플로와 에이전트의 구분

Anthropic의 2024년 12월 엔지니어링 글은 에이전트라는 말이 지나치게 넓게 쓰이는 상황에서 실무의 언어를 정리한 글로 읽힌다. 수십 개 팀과의 협업 경험을 바탕으로, 가장 성공적인 구현은 복잡한 프레임워크가 아니라 단순하고 조합 가능한 패턴을 쓴다는 관찰을 전한다. 그리고 미리 정해진 코드 경로를 따라 LLM을 엮는 워크플로와, LLM이 스스로 과정과 도구 사용을 이끄는 에이전트를 구분한다.

글에서 소개하는 패턴에는 prompt chaining과 routing, parallelization, orchestrator-workers, evaluator-optimizer가 있다. 이 글의 해석을 덧붙이자면, 이 구분의 가치는 자율성의 정도를 미리 정하게 한다는 데 있다. 모든 일을 모델의 판단에 맡길 것인가, 사람이 짠 절차 안에서 모델을 부릴 것인가. 이 선택을 분명히 하지 않은 채 에이전트를 논하면 논의가 겉돈다. 같은 글에 2024년 12월 이후 도구 지형이 바뀌었다는 추신이 붙어 있다는 점도 함께 밝혀둔다.

기억하는 에이전트, 함께 사는 에이전트

에이전트가 오래 일하려면 기억이 필요하다. Generative Agents 연구는 경험을 자연어로 기록하고 성찰로 종합하며 필요할 때 꺼내는 구조 위에 25개 에이전트의 마을을 세웠다. 발렌타인데이 파티 시나리오에서 초대 확산과 약속 같은 행동이 나타났다고 보고되었다. 편집자의 비유로 덧붙이자면, 기억 회상을 일종의 도구 호출처럼 볼 수도 있다. 원 논문의 직접 주장이 아니라 이 글의 해석이다.

다만 믿음직한 행동이라는 평가는 저자들이 설계한 환경과 기준 안의 결과다. 실제 인간 사회가 재현되었다는 식의 해석은 과장이며, 이 서가는 그렇게 읽지 않는다. 이 실험의 의의는 사회적 행동의 증명이 아니라 기억과 계획과 회상을 엮은 아키텍처의 시연에 있다는 것이 이 글의 입장이다.

열린 문제

도구를 쓰는 에이전트 앞에는 여전히 큰 질문들이 있다. 잘못된 도구를 골랐을 때 누가 책임지고 어떻게 복구할 것인가. 도구 호출의 연쇄가 길어질수록 오류가 누적되는 문제를 어떻게 다스릴 것인가. 자율성을 어디까지 허용할 것인가. 그리고 에이전트 전체를 어떻게 공정하게 평가할 것인가. 마지막 질문은 평가 주제 글과 맞닿아 있다. 개별 부품의 점수가 좋아도 전체 작업의 성공을 보장하지 않기 때문이다. 이 글은 각 출처의 주장과 그 조건을 분명히 하는 데 그치고, 특정 프레임워크의 우열은 판단하지 않는다.

읽는 순서의 제안

이 주제를 처음 만난다면 ReAct의 기록부터 읽기를 권한다. 생각과 행동의 루프가 에이전트의 기본 문법이기 때문이다. 그 다음 Toolformer의 기록으로 학습의 갈래를, Generative Agents의 기록으로 기억의 갈래를, Anthropic 글의 기록으로 실무의 정리를 읽으면 층이 순서대로 쌓인다. 각 기록의 끝에 붙은 개념 맥락 연결이 이 글로 돌아오는 다리가 된다.

현재 판 출처 (이 개정의 출처 보관본 아님) 4건

아래는 현재 판의 출처 목록을 고리 풀이용으로 그대로 둔 참조이며, 이 개정의 출처 보관본이 아니다.

  1. ReAct: Synergizing Reasoning and Acting in Language Models (외부)
    S4
  2. Toolformer: Language Models Can Teach Themselves to Use Tools (외부)
    S5
  3. Building Effective Agents (외부)
    S9
  4. Generative Agents: Interactive Simulacra of Human Behavior (외부)
    S7
← 고침 기록으로