전체 목록
개념의 뼈대, 발전의 과정, 날짜가 박힌 사건 기록. 아래 목록은 발행 글만 싣는다.
AI가 조사·작성한 초안이며 사람의 감수를 주장하지 않는다.
실린 글 36편 · 개념 12 · 과정 3 · 기록 21
개념 뼈대12편
주제를 관통하는 개념의 뼈대 글이다. 사건 기록을 읽기 전에 여기를 먼저 읽는다.
AI 평가: 무엇을 어떻게 측정할 것인가
벤치마크의 역할과 한계, GSM8K와 SWE-bench의 평가 사례를 살펴보고 점수를 비교할 때 확인해야 할 조건을 정리한다.
AI의 기억과 컨텍스트
언어모델의 파라미터, 컨텍스트, 외부 저장소가 각각 어떤 역할을 하는지 살펴보고 긴 입력과 에이전트 메모리의 한계를 정리한다.
ChatGPT dots 활용 사례: 조사·초안·주간 보고를 맡기는 방법
공개 사용기의 쇼핑·여행·업무 정리 사례를 살펴보고, 실행하지 않은 가상 프롬프트 세 개로 자료 범위와 권한, 완료 증거, 후속 판단을 구체화한다.
ChatGPT dots: 목표와 권한을 정해 지속 업무 맡기기
ChatGPT dots의 지원 범위와 세 종류의 연결, 클라우드·개인 컴퓨터, 로그인·승인·예약·중단을 공개 문서로 확인하고, 가상 프롬프트와 도해로 지속 업무를 맡기는 방법을 살펴본다.
Hindsight: 에이전트 기억을 저장하고 찾고 활용하기
Hindsight는 에이전트가 세션을 넘어 기억을 활용하도록 정보를 구조화하는 오픈소스 기억 시스템이다. 네 가지 기억 종류와 저장·검색·추론, RAG와의 역할 분담을 살펴보고, 실행하지 않은 세 가지 사용 예시와 다른 기억 기술과의 비교를 개념도·논문 그림과 함께 설명한다.
검색 증강 생성(RAG)의 구조와 한계
외부 문서를 검색해 답변 생성에 활용하는 RAG의 구조와 원 논문의 실험 결과를 살펴보고, 검색과 긴 컨텍스트를 함께 활용할 때의 주의점을 정리한다.
검토 게이트와 병합: 기록에서 머지 큐까지
이슈와 명세, 결정 기록, 설계 검토, 풀 리퀘스트, 보호 브랜치, 머지 큐와 머지 트레인까지, 병합 전에 필요한 기록과 검토 절차를 살펴본다.
도메인 경계와 영향 범위 CI: 작은 변경을 작게 검증하기
업무 단위로 도메인을 나누고, 바뀐 곳과 그에 의존하는 부분만 골라 테스트하며, 경로 필터로 건너뛴 테스트가 병합을 막는 함정을 피하는 검증 방법을 살펴본다.
언어모델의 추론
중간 풀이를 제시하는 chain-of-thought와 도구 사용을 결합한 ReAct를 살펴보고, 실험에서 확인한 추론 능력과 아직 설명하지 못한 부분을 구분한다.
에이전트와 도구 사용
추론과 행동을 번갈아 수행하는 ReAct, 도구 사용을 학습하는 Toolformer, Anthropic이 정리한 구현 방식을 통해 에이전트의 구조를 살펴본다.
역할별 혼합 모델: 에이전트 팀의 비용과 품질 설계
역할마다 다른 모델을 배정하고, 토큰 사용량과 단가로 비용을 계산하며, 실제 과제에 맞춘 평가로 품질을 확인하는 방법을 살펴본다.
예약 실행 코딩 에이전트: 스모크 테스트와 머지 큐를 통한 병합
코딩 에이전트의 야간 작업을 예약하고, 격리된 환경에서 실행한 뒤, 스모크 테스트와 사람의 검토를 거쳐 머지 큐로 병합하는 절차를 살펴본다.


