평가
모델과 에이전트를 재는 평가의 갈래를 모은다.
다르게 부르기: benchmark · swe-bench · 벤치마크
개념 뼈대2편
AI 평가: 무엇을 어떻게 측정할 것인가
벤치마크의 역할과 한계, GSM8K와 SWE-bench의 평가 사례를 살펴보고 점수를 비교할 때 확인해야 할 조건을 정리한다.
역할별 혼합 모델: 에이전트 팀의 비용과 품질 설계
역할마다 다른 모델을 배정하고, 토큰 사용량과 단가로 비용을 계산하며, 실제 과제에 맞춘 평가로 품질을 확인하는 방법을 살펴본다.
발전 과정1편
AI 평가의 발전: 벤치마크에서 실제 개발 과제까지
정해진 문제를 푸는 벤치마크, chain-of-thought와 ReAct의 평가, 2023년 SWE-bench를 통해 평가 대상이 어떻게 넓어졌는지 살펴본다.
사건 기록8편
Anthropic OSS Scanner: 무료 AI 보안 보고서를 받는 유지관리자의 실무 안내
무료 신청형 OSS Scanner의 등록·빌드·보고서 수신 경로를 확인하고, 오픈소스 유지관리팀의 재현·패치 검토·중단·복구 절차를 정리합니다.
ChatGPT 오디오 업로드로 한국어 회의록과 후속 업무 정리하기
ChatGPT가 녹음 파일 업로드를 공식 안내했다. 지원 형식과 512MB 한도, 한국어 회의록 프롬프트, 화자·숫자 검증과 개인정보 설정을 함께 살펴본다.
Claude Haiku 5.5, 한국어 반복 업무의 비용과 분류 품질 확인하기
100K 가격 구간과 새 토크나이저, effort 설정을 확인하고 공식·독립 벤치마크의 차이를 비교합니다. 한국어 분류와 숫자 추출을 검증할 표본·정답표·검수·비용 기준도 제안합니다.
ElevenAgents Architect로 고객 응대 AI를 점검하고 개선하는 방법
실패한 상담을 조사하고 수정안과 테스트를 준비하는 ElevenAgents Architect가 공개됐다. 환불 상담 예제로 살펴보는 활용법과 승인 모드, 개인정보, Alpha 무료 범위.
Mistral Large 4 프리뷰의 가격과 성능을 확인하는 방법
Mistral Large 4가 API 프리뷰로 공개됐다. 할인 가격과 가중치 공개 계획, 서로 다른 공식 사양, 독립 평가와 실제 개발자 실험을 구별해 살펴본다.
Nano Banana 2.1로 한국어 상품 배너를 만들고 검수하는 방법
Nano Banana 2.1의 공식 기능과 이미지 출력 요금, 폴란드어 소규모 실험을 살펴봅니다. 상품 배너와 반복 편집에 쓸 가상 한국어 프롬프트 및 승인 절차를 제안합니다.
Rasp 영업 자동화 사례 읽기: 리드 분류부터 CRM 기록과 실패 복구까지
OpenRouter의 Rasp 사례를 검토하고 리드 분류·미팅 준비·회의록·CRM 기록을 권한과 사람 검토, 비용 측정, 기능별 중단으로 연결하는 실무 안내입니다.
SWE-bench 공개 (2023)
SWE-bench는 실제 GitHub 이슈에서 뽑은 2,294문제로 소프트웨어 수정 능력을 평가한다. 2023년 10월 10일 arXiv에 공개된 평가의 구성과 2023년에 보고한 결과를 정리한다.