GPT-6 Intelligent UI로 한국어 정산 도구 만들기: Chat 탭과 검수 절차
GPT-6 Intelligent UI의 Chat 탭 제공 범위와 44% 첫 답변 시작 지표를 구분하고 가상 회식 정산 예제로 입력 규칙·화면 요청·금액 검수 방법을 살펴봅니다.
개정 2판 · 최근 고침: 공식 시스템 카드와 독립 API 평가의 버전·지표를 구별하고, 한국어 정산 도구의 결정적 테스트와 화면·검수 시간 평가 절차를 보강했습니다. · 고침 기록 보기
공식 기능 안내를 바탕으로 만든 실습 가이드입니다. 회식·행사 예제는 가상 데이터이며 실제 계정의 실행 결과나 독립 성능 측정이 아닙니다. 속도 수치는 OpenAI 발표의 측정 범위를 따릅니다.
GPT-6 Intelligent UI로 대화 안에서 정산 도구 만들기
회식비를 나눌 때는 총액을 사람 수로 나누는 계산만으로 끝나지 않습니다. 술값을 제외할 사람, 중간에 합류한 사람, 먼저 결제한 사람을 반영해야 합니다. 조건을 바꿀 때마다 계산을 다시 요청하면 대화가 길어집니다. 입력값과 결과를 함께 볼 수 있는 작은 도구가 있으면 어디서 금액이 달라졌는지 확인하기 쉽습니다.
OpenAI가 2026년 10월 7일 발표한 GPT-6 Intelligent UI는 질문에 맞춰 글·시각 자료·상호작용 요소를 조합합니다. 비교표, 설명 도식, 계산기처럼 대화 안에서 다루는 화면이 대상입니다. 간단한 질문에는 텍스트로 답할 수도 있습니다.
아래에서는 가상의 회식 내역으로 요청을 구성하고 결과를 검수하는 방법을 살펴봅니다. 실제 계정에서 얻은 사용후기나 계산 정확도 측정은 아닙니다. 예시에는 송금이나 외부 서비스 연결을 넣지 않습니다.
이 절의 근거 S83
Chat 탭과 추론 옵션을 먼저 확인하기
공식 릴리스 노트에 따르면 10월 7일 Plus·Pro·Business·Enterprise부터 전 세계 Chat 탭에 순차 제공하며 10월 8일부터 Free·Go로 확대합니다. Enterprise에서는 관리자 설정이 영향을 줍니다.
유료 대상은 GPT-6 Sol, Free·Go는 GPT-6 Luna를 사용합니다. Intelligent UI는 Instant부터 Extra High까지 지원하며 GPT-6 Astra를 쓰는 Pro 추론 옵션에는 제공되지 않습니다. 이번 발표로 Work·Codex 모델은 바뀌지 않습니다.
원하는 화면이 보이지 않으면 같은 요청을 반복하기 전에 Chat 탭과 추론 옵션을 확인하세요. 제공 일정은 계정별 실제 표시를 보장하는 시각표가 아니므로, 자신의 화면에서 사용할 수 있는지 확인한 뒤 실습을 시작합니다.
이 절의 근거 S84
| 대상 | Chat 모델 | 순차 제공 시작 |
|---|---|---|
| Plus·Pro·Business·Enterprise | GPT-6 Sol | 10월 7일 |
| Free·Go | GPT-6 Luna | 10월 8일 |
| Intelligent UI 지원 추론 | Instant~Extra High | Pro 추론은 미지원 |
| Work·Codex | 이번 발표로 변경 없음 | Chat 출시와 구별 |
표를 글로 읽기
요금제, 모델, 제공 시작을 비교하는 Chat 탭 표입니다.
공식 데모를 읽는 방법
공식 발표 페이지에는 인원 수에 맞춰 장보기 수량을 조절하는 식사 계획, 자전거 부품을 선택하며 보는 설명, 계산 도구 예시가 있습니다. 업체가 제시한 데모이며 독립 사용자의 성능 실험과는 구별해야 합니다.
데모에서 참고할 것은 화면의 장식보다 입력과 결과의 관계입니다. 인원이 달라지면 수량도 달라지고 부품을 선택하면 설명 범위가 바뀝니다. 자신의 요청에서도 무엇을 바꾸고 어떤 결과를 확인할지 정해야 검수할 수 있습니다.
회식 정산에서는 인원·항목별 비용·참여 범위를 입력으로 두고 개인별 부담액·결제액·차액을 결과로 두겠습니다. 이 구성이 반드시 특정 위젯으로 생성된다는 보장은 없습니다. 화면이 복잡해지면 먼저 표로 조건과 수식을 확인한 뒤 상호작용 요소를 요청하는 편이 수월합니다.
독립 기자가 직접 사용한 사례
WIRED의 Reece Rogers는 10월 7일 기사에서 출시 전 짧게 사용한 경험을 소개했습니다. 부위별 버튼이 있는 민달팽이 도식, 소득·지출 슬라이더를 조절하는 주거비 계산기, 좌석을 누르면 설명이 나오는 항공기 좌석 탐색 도구를 만들었다고 보고했습니다.
이는 기자의 직접 사용 사례입니다. 한국어 정산 정확도나 반복 실행 성공률을 측정한 실험으로 일반화할 수는 없습니다. 자신의 업무에 적용할 때도 입력을 바꿀 수 있다는 기능과 결과가 정확하다는 판단을 따로 확인하세요.
이 절의 근거 S85
1단계 계산 규칙을 먼저 적기
정산 도구의 첫 입력은 실제 개인정보 대신 가상의 식별자를 사용합니다. 사람 이름을 A·B·C·D로 적어도 계산 규칙을 시험하는 데는 충분합니다. 휴대전화 번호와 계좌번호는 이 예시에 필요하지 않습니다.
가상 모임에는 네 사람이 참여했습니다. 음식값 120,000원은 네 사람이 균등하게 부담하고 술값 40,000원은 A와 B만 부담합니다. C가 음식값을 결제했고 A가 술값을 결제했다고 가정합니다. 우선 서비스료와 할인은 없다고 정해 계산 범위를 좁힙니다.
참여 인원과 결제자를 별도 항목으로 적으세요. 술을 마신 사람과 카드로 결제한 사람은 같은 역할이 아닙니다. 모델이 빈칸을 추정해 채우지 않도록 참여 범위가 없는 항목은 계산 전에 질문하도록 요청합니다.
금액을 입력하는 칸에는 원 단위를 표시하고 음수나 문자 입력을 어떻게 처리할지 정합니다. 빈칸을 0원으로 취급할지, 필수 입력으로 안내할지도 정해야 합니다. 이렇게 입력 규칙을 명시하면 이후 오류가 계산에서 생겼는지 입력 해석에서 생겼는지 찾기 쉽습니다.
다음 가상 데이터로 회식 정산 규칙을 먼저 표로 정리해 줘.
참여자: A, B, C, D
음식: 120000원 / 참여 A,B,C,D / 결제 C
술: 40000원 / 참여 A,B / 결제 A
원화 정수로 계산해 줘. 할인과 서비스료는 없어.
참여 범위나 결제자가 빠지면 추정하지 말고 질문해 줘.
개인별 부담액, 실제 결제액, 받을 돈 또는 보낼 돈을 구분해 줘.
화면을 만들기 전에 수식과 전체 금액 검산을 보여 줘.2단계 기준값으로 수식을 검산하기
위 데이터에서 음식값은 한 사람당 30,000원이고 술값은 A와 B가 각각 20,000원씩 부담합니다. 따라서 A·B는 각각 50,000원, C·D는 각각 30,000원을 부담합니다. 네 사람의 부담액을 합하면 지출 총액인 160,000원과 같습니다.
받을 금액은 결제액에서 부담액을 뺀 값으로 정의하겠습니다. A는 40,000원을 결제했으므로 10,000원을 더 보내야 하고 B는 50,000원을 보내야 합니다. C는 120,000원을 결제했으므로 90,000원을 받아야 하며 D는 30,000원을 보내야 합니다. 차액의 합계는 0원입니다.
이는 모델이 출력한 결과를 인용한 것이 아니라 예시 입력을 직접 산술 계산한 기준값입니다. 생성된 도구가 이 표와 다르면 상호작용을 추가하기 전에 계산 규칙부터 수정합니다. 금액이 맞더라도 받는 사람과 보내는 사람을 뒤집으면 정산에 쓸 수 없습니다.
이 예시에서는 A가 C에게 10,000원, B가 C에게 50,000원, D가 C에게 30,000원을 보내면 정산됩니다. 가능한 송금 조합은 상황에 따라 여러 개일 수 있으므로, 최소 송금 횟수를 요청하더라도 개인별 차액과 총액 보존을 먼저 확인하세요.
| 사람 | 부담액 | 결제액 | 결제액−부담액 |
|---|---|---|---|
| A | 50,000원 | 40,000원 | −10,000원: 보내기 |
| B | 50,000원 | 0원 | −50,000원: 보내기 |
| C | 30,000원 | 120,000원 | +90,000원: 받기 |
| D | 30,000원 | 0원 | −30,000원: 보내기 |
| 합계 | 160,000원 | 160,000원 | 0원 |
표를 글로 읽기
A와 B의 부담액 50000원, C와 D의 부담액 30000원과 결제액·차액을 비교한 표입니다.
3단계 수정 가능한 화면 요청하기
기준값을 확인한 뒤 인원과 비용을 바꾸는 화면을 요청합니다. 이미 합의한 계산 규칙을 다시 적어 주면 화면 생성 과정에서 참여 범위가 달라지는지 대조하기 쉽습니다.
실습용 후속 프롬프트는 아래와 같습니다. 버튼의 개수나 색상보다 입력값 변경, 오류 안내, 최종 결과를 같은 화면에서 확인하는 것이 목적입니다.
결과를 받은 뒤 음식값을 160,000원으로 바꿔 보세요. 음식값의 개인별 부담은 40,000원이 되어야 하고 술값을 포함한 A·B의 부담은 각각 60,000원이 되어야 합니다. 결제액도 새 영수증 금액에 맞게 바뀌는지 함께 확인합니다. 지출값만 바뀌고 결제액은 그대로라면 총액 검산이 실패할 수 있습니다.
참여자를 추가하거나 삭제할 때는 기존 항목에 자동으로 포함되는지 살펴보세요. 추가된 사람이 이전 술자리에도 참여했다고 가정하면 사용 의도와 달라집니다. 사람 목록을 수정한 뒤 항목별 참여 범위를 다시 확인하는 안내를 넣는 편이 좋습니다.
확인한 규칙으로 대화 안에서 수정 가능한 정산 도구를 만들어 줘.
입력: 참여자 목록, 항목 이름, 금액, 항목별 참여자, 결제자.
출력: 개인별 부담액·결제액·차액, 전체 지출과 부담액 합계.
기본값은 방금 검산한 가상 데이터로 설정해 줘.
금액이나 참여 범위를 바꾸면 결과를 다시 계산해 줘.
빈 참여 범위, 음수 금액, 삭제된 결제자는 오류로 안내해 줘.
송금하거나 외부 서비스를 연결하지 말고 계산과 복사할 표만 보여 줘.
모바일에서 가로로 크게 넘치지 않도록 입력과 결과를 나눠 줘.그림을 글로 읽기
입력 규칙 → 기준값 검산 → 화면 요청 → 변경값 검수 순서로 정산 도구를 검토하는 흐름도입니다.
나누어떨어지지 않는 금액 처리하기
100,000원을 세 사람이 나누면 원 단위에서 나머지가 생깁니다. 세 사람 모두 33,333원을 부담하면 합계는 99,999원입니다. 보기 좋은 숫자만 표시하면 남은 1원이 사라질 수 있습니다.
규칙을 한 가지 정해 두세요. 예를 들어 참여자 목록에서 첫 번째 사람이 나머지 1원을 부담하도록 정하면 33,334원·33,333원·33,333원으로 합계가 맞습니다. 이 규칙은 본문의 실습 제안이며 서비스가 자동으로 채택하는 기본 규칙은 아닙니다.
화면에 소수점을 반올림해 보여 주는 것과 실제 정산 금액을 원 단위로 배분하는 것은 별도 작업입니다. 내부 계산에는 소수가 남아 있는데 복사한 표만 정수로 바뀌면 검수할 때 혼동하기 쉽습니다. 부담액, 받을 금액, 복사 결과 모두 같은 배분 규칙을 쓰도록 요청하세요.
후속 요청 예시: 음식값 100000원을 A,B,C 세 사람이 나눠. 원 미만 금액을 남기지 말고 참여자 목록 순서대로 나머지를 배분해 줘. 각 사람의 금액과 합계, 어떤 사람이 나머지를 부담했는지 표시해 줘. 총액이 100000원과 다르면 정산 결과를 확정하지 마.
속도 지표와 검수 시간 구분하기
OpenAI는 웹 검색이 필요한 질문에서 GPT-6 Instant가 GPT-5.6 Instant보다 평균 44% 빨리 답변을 시작한다고 발표했습니다. 이는 업체가 보고한 첫 답변 시작 지표입니다. 전체 응답 완료 시간, 정산 도구 완성 시간, 한국어 정확도가 44% 개선됐다는 의미로 옮겨 쓰면 안 됩니다.
글이 먼저 나타난 뒤 다른 결과가 추가될 수 있으므로 정산에서는 생성이 끝났는지 확인하고 최종 표를 검수합니다. 처음 표시된 숫자와 마지막 합계가 같은지도 살펴보세요.
업무에서 효율을 비교하려면 요청을 보낸 시각, 첫 내용이 나온 시각, 전체 결과가 준비된 시각, 수정까지 마친 시각을 별도로 기록할 수 있습니다. 조건을 같은 상태로 맞추고 여러 번 확인해야 우연히 빠른 한 번의 결과를 일반화하지 않을 수 있습니다. 이것은 평가 절차 제안이며 이 글에서 수행한 측정이 아닙니다.
| 구분 | 의미 |
|---|---|
| 발표한 44% | GPT-5.6 Instant 대비 GPT-6 Instant의 평균 답변 시작 단축 |
| 첫 답변 시작 | 사용자가 내용을 읽기 시작할 시점 |
| 전체 응답 완료 | 별도로 확인할 시간 |
| 검수까지 완료 | 수정과 숫자 확인을 포함해 별도로 기록 |
| 한국어 계산 정확도 | 해당 속도 수치에서 추정하지 않음 |
표를 글로 읽기
발표 지표와 별도로 확인할 지표를 구분하는 속도 해석 표입니다.
벤치마크를 읽기 전에 모델 버전 맞추기
10월 시스템 카드는 Chat용 Sol·Luna를 October, Work·Codex에 남아 있는 기존 버전을 September로 구별합니다. 안전 평가는 가장 낮은 배포 추론 설정, 능력 평가는 최대 추론 설정에서 수행합니다. 모델 이름이 같아도 버전·설정·도구가 다른 결과를 같은 제품 점수로 합치지 않습니다.
카드는 지시 계층 위반에 대한 강건성을 Sol 99.99%, Luna 99.79%로 보고합니다. 이 수치는 공격 평가의 결과이며 정산 정확도·버튼 동작·일반 사용자 세션의 성공률은 아닙니다. 안전 평가를 통과한 응답에도 계산이나 화면 오류가 있을 수 있습니다.
공식 발표는 UI의 명료성·유용성·완전성을 평가했다고 설명합니다. 그러나 발표와 시스템 카드만으로 대규모 UI 전용 벤치마크의 표본 수·채점 기준·한국어 통과율을 확인할 수는 없습니다. 공개된 설명의 범위를 넘어서 UI가 특정 모델보다 안정적이라고 순위를 정하지 않습니다.
또한 GPT-6 Astra의 API 코딩·추론 점수를 Intelligent UI의 검증 결과로 옮기면 대상이 달라집니다. 이 글에서 다루는 기능은 Chat의 Sol·Luna이고, Astra를 사용하는 Pro 추론 옵션은 Intelligent UI를 지원하지 않습니다. 기존 Work·Codex 작업 성능과 Chat에서 만들어진 계산 화면은 따로 평가해야 합니다.
독립 API 평가가 알려 주는 것과 남겨 둔 것
Artificial Analysis가 직접 측정한 Sol과 Luna의 공개 페이지는 September 출시 모델의 Max 설정입니다. 2026년 10월 8일 확인값은 Intelligence Index에서 Sol 48, Luna 38입니다. API의 TTFT는 각각 127.24초와 108.60초로 표시됩니다. 점수는 정확도 백분율이 아니고, 이 지연시간은 Chat Instant의 첫 내용 표시 시간과 다릅니다.
이 수치에서 Sol과 Luna의 일반 모델 능력을 참고할 수는 있지만, 10월 Chat 버전의 정산기 통과율이나 모바일 반응 속도를 계산할 수는 없습니다. 특히 Max API 지연시간과 Instant의 44% 답변 시작 단축은 추론 설정·버전·작업이 다르므로 직접 비교하지 않습니다.
AA의 Intelligence Index 방법론은 여러 평가를 합산합니다. 개별 업무와 합산 점수의 목적이 일치하는지 먼저 살펴보세요. 높은 점수가 나와도 한국어 회식 조건을 유지하는지, 금액 입력을 지우면 오류를 안내하는지, 복사한 표가 화면의 결과와 같은지는 별도 문제입니다.
앞서 소개한 WIRED 사례는 기자가 짧게 직접 사용한 경험입니다. 기능을 활용한 실제 예시로 읽을 수 있지만 표본 수를 정한 반복 실험은 아닙니다. 회사의 평가, 독립 기관의 API 점수, 기자의 경험, 아래에서 제안하는 자체 평가를 같은 증거 수준으로 취급하지 않습니다.
| 근거와 대상 | 확인값 | 이 수치로 알 수 없는 것 |
|---|---|---|
| OpenAI 10월 Chat Sol/Luna | 지시 계층 강건성 99.99% / 99.79% | 정산·버튼·모바일 성공률 |
| AA 9월 Sol/Luna Max API | Intelligence Index 48 / 38 | 10월 Chat UI 통과율 |
| AA 9월 Sol/Luna Max API | TTFT 127.24초 / 108.60초 | Instant 첫 표시·전체 업무 시간 |
| WIRED 사전 짧은 사용 | 도식·슬라이더·좌석 탐색 사례 | 정량 정확도·반복 성공률 |
| 아래 자체 평가 계획 | 아직 실행하지 않은 테스트 설계 | 측정 결과·서비스 순위 |
표를 글로 읽기
10월 Chat 강건성, 9월 API Max 점수와 지연시간, 기자 사용 사례를 구분하는 평가 근거 표입니다.
한국어 정산 도구를 평가하는 테스트 세트
직접 평가할 때는 생성된 화면의 숫자를 정답으로 삼지 말고 손계산 기준을 먼저 고정합니다. 정산에서는 두 가지 불변식을 확인할 수 있습니다. 모든 사람의 부담액 합계는 전체 지출과 같아야 하고 결제액에서 부담액을 뺀 개인별 차액의 합계는 0원이어야 합니다. 결제액 합계가 지출과 다르면 먼저 입력의 불일치를 표시해야 합니다.
본문의 기본값은 부담액 A 50,000원·B 50,000원·C 30,000원·D 30,000원, 차액 A −10,000원·B −50,000원·C +90,000원·D −30,000원입니다. 이 값과 생성된 도구의 표를 비교합니다. 어느 한 금액을 맞추는 것보다 네 사람의 금액과 두 합계를 모두 확인해야 빠진 항목을 발견하기 쉽습니다.
인원을 바꾸는 테스트에는 두 경우를 둡니다. E를 사람 목록에만 추가하면 기존 항목의 참여 범위는 A·B·C·D와 A·B 그대로이고 E의 부담은 0원이어야 합니다. E가 음식에도 참여하도록 명시한 경우 음식값 120,000원은 다섯 사람이 24,000원씩 나누며 A·B는 술값을 포함해 각각 44,000원, C·D·E는 각각 24,000원을 부담합니다.
규칙이 변하지 않는지도 확인합니다. 음식·술의 행 순서만 바꾸었을 때 개인별 금액이 달라지면 실패로 기록합니다. 120,000원 음식을 같은 참여 범위의 60,000원 두 항목으로 나누어도 부담액은 같아야 합니다. 단, 나머지 배분은 항목별로 수행할지 전체 합계에서 수행할지에 따라 달라질 수 있으므로 나머지가 없는 값으로 이 테스트를 분리합니다.
오류 입력에서는 결과를 그럴듯하게 완성하는 행동이 오히려 실패입니다. 필수 금액을 빈칸으로 만들거나 −1원을 입력하면 정산을 중단하고 해당 칸의 오류를 안내해야 합니다. 0원은 빈칸과 별도 값으로 시험합니다. 실제 환불을 허용하는 도구가 필요하다면 음수를 모두 막는 현재 실습 규칙을 먼저 바꾸고 별도의 기대값을 만들어야 합니다.
100,000원을 세 사람에게 배분하는 경우에는 합의한 순서대로 33,334원·33,333원·33,333원인지 확인합니다. 첫 사람에게 나머지를 주는 규칙은 이 글의 실습 조건입니다. 사람 목록을 정렬하거나 이름을 바꿀 때 나머지를 부담하는 사람이 몰래 달라지는지 확인하고 화면에 배분 기준이 남아 있는지도 살펴봅니다.
각 테스트는 입력, 기대값, 실제값, 통과 여부, 수정 요청 횟수로 기록하세요. 한 번 생성한 화면에 연속으로 값을 바꾸는 시험과 새 대화에서 같은 요청으로 다시 생성하는 시험을 구별하면 상호작용 오류와 생성의 편차를 나눠 볼 수 있습니다. 아래 표는 실행 결과가 아닌 테스트 설계입니다.
| 테스트 | 입력 변경 | 기대값 또는 동작 |
|---|---|---|
| 총액 보존 | 기본 음식120000·술40000 | 부담합160000원·결제합160000원 |
| 차액 0합 | 기본 결제 C120000·A40000 | −10000−50000+90000−30000=0원 |
| 사람만 추가 | E 추가·참여 범위 유지 | E부담0원·기존 사람 금액 유지 |
| 음식 참여 추가 | E를 음식 참여에 포함 | A/B44000원·C/D/E24000원 |
| 필수 값 비움 | 음식 금액 빈칸 | 0원으로 몰래 처리하지 않고 오류 안내 |
| 음수 입력 | 음식 금액−1원 | 현재 실습 규칙에 따라 정산 중단 |
| 0원 입력 | 술0원·결제A0원 | 각30000원·총120000원 |
| 나머지 | 100000원 / A,B,C | 33334·33333·33333원·합100000원 |
| 규칙 유지 | 120000원을60000원2행으로 분할 | 동일 참여 범위이면 기본 부담액 유지 |
표를 글로 읽기
기본값, 인원 추가, 빈칸, 음수, 나머지와 규칙 유지에 대한 정산 테스트 입력과 기대값 표입니다.
화면 안정성과 세 종류의 시간을 함께 기록하기
계산이 맞으면 PC와 모바일에서 같은 입력을 다시 확인합니다. 예를 들어 가로 1440px와 390px 화면을 대상으로 이름·원 단위·오류 메시지·합계가 보이는지 살펴보고 키보드로 입력칸과 버튼에 이동해 조작합니다. 모바일에서 입력을 수정한 뒤 결과가 화면 밖에 남는지, 복사한 표의 이름과 금액이 같은 행에 붙어 있는지도 확인하세요. 화면 너비는 이 글이 제안하는 시험 조건입니다.
시간은 요청 전송을 t0, 첫 유용한 내용 표시를 t1, 입력 가능한 최종 화면 준비를 t2, 검수·수정 완료를 t3로 기록합니다. t1−t0는 첫 내용까지의 시간, t2−t0는 사용할 화면이 준비될 때까지의 시간, t3−t0는 검수까지 포함한 업무 시간입니다. 버튼을 눌렀을 때 결과가 갱신되는 시간은 별도 상호작용 지연으로 기록합니다.
OpenAI의 44%는 업체가 측정한 답변 시작 지표이며 공개 문구만으로 API TTFT와 측정 방식이 완전히 같다고 단정할 수 없습니다. 독자가 기록한 t1은 첫 유용한 내용이라는 자체 기준이므로 서로 같은 숫자처럼 비교하지 마세요. 첫 글이 빨리 나와도 마지막 합계가 바뀌거나 버튼이 늦게 동작하면 실제 업무는 더 오래 걸릴 수 있습니다.
시작용 계획으로 같은 고정 프롬프트를 새 대화에서 5회 생성하고 각 화면에 동일한 테스트 세트를 적용해 볼 수 있습니다. 계정·Chat 모델·추론 설정·클라이언트·날짜·화면 너비를 기록하고 실패한 시도를 제외하지 않습니다. 모든 항목의 반복별 통과율, 전체 테스트를 함께 통과한 횟수, 수정 횟수, 각 시간의 중앙값과 범위를 함께 남깁니다.
5회는 대규모 벤치마크를 대신하는 표본이 아닙니다. 자신의 업무에 맞지 않는 규칙과 잦은 오류를 찾는 출발점입니다. 비교할 모델이나 설정이 있다면 같은 자료와 기대값을 쓰고 계산 정답·상호작용 성공·검수 시간을 각각 비교하세요. 이 글에서는 해당 실험을 실행하거나 서비스 간 순위를 산출하지 않았습니다.
정산 외의 한국어 활용 요청
조건이 바뀌는 비교 업무에도 같은 요청 구조를 적용해 볼 수 있습니다. 입력값, 결과, 검수 기준을 먼저 정하고 필요한 화면을 요청하는 방식입니다.
행사 예산 예시: 장소비는 고정 300000원이고 식비는 1인당 18000원인 가상 행사야. 인원을 10~40명으로 바꾸며 총예산을 보는 도구를 만들어 줘. 인당 비용과 고정비를 구분하고 20명일 때 총액이 660000원이 되는지 확인해 줘. 실제 장소 가격을 검색한 것처럼 설명하지 마.
서비스 비교 예시: 내가 제공하는 후보 A,B,C의 비용·최소 이용기간·해지 조건만 비교해 줘. 한 달과 여섯 달 총액을 전환해서 보고 싶어. 제공하지 않은 조건은 미확인으로 남기고 계산식과 원본 값을 함께 표시해 줘. 외부 구매나 신청은 진행하지 마.
학습 예시: 같은 거리에서 속도가 달라지면 이동 시간이 어떻게 달라지는지 탐색하는 설명을 만들어 줘. 거리와 속도 단위를 표시하고 120km를 60km/h로 이동할 때 2시간이라는 기준값을 포함해 줘. 휴식이나 교통 상황을 반영하지 않은 단순 계산임을 화면에도 적어 줘.
이 예시들은 작성자가 구성한 연습 요청입니다. 실제 가격이나 도로 상황이 필요한 질문에서는 근거 자료를 먼저 확보하고 화면에 출처 날짜와 가정을 표시하도록 추가로 요청하세요.
공유하기 전 마지막 점검
화면을 눌러 볼 수 있다고 해서 계산 근거가 자동으로 검증되지는 않습니다. 가상 기본값, 변경값, 잘못된 입력, 나머지가 생기는 값을 각각 넣어 보세요. 개인별 부담액의 합계가 지출 총액과 같은지, 받을 금액과 보낼 금액의 합계가 같은지 확인합니다.
모바일에서는 입력 필드의 단위가 보이는지, 버튼을 눌러 바뀐 결과를 찾을 수 있는지, 표를 복사했을 때 이름과 금액이 같은 행에 남는지 살펴봅니다. 좁은 화면에서 숫자가 잘리면 결과를 믿고 전달하기 어렵습니다.
동료에게 공유할 때는 숫자만 보내기보다 항목별 참여 범위와 나머지 배분 규칙도 덧붙이세요. 같은 총액이어도 어떤 사람이 술값을 부담하는지에 따라 개인별 금액은 달라집니다. 복사된 최종 표를 원래 입력과 대조한 뒤 전달하면 변경 이력을 놓칠 가능성을 줄일 수 있습니다.
처음에는 네 사람과 두 항목처럼 작은 입력으로 시작해 보세요. 계산 규칙을 확인한 다음 항목을 늘리면 오류가 생긴 조건을 찾기 쉽습니다. Intelligent UI가 만든 화면을 잘 활용하려면 검수할 수 있는 기준값부터 마련하는 것이 좋습니다.
근거 출처 7건
- [1] Intelligent UI의 기능, 공식 데모와 웹 검색 질문의 첫 답변 시작 지표. 독립 측정이 아닌 업체 발표.
GPT-6 and Intelligent UI for everyone (외부)
OpenAI · 2026-10-07 - [2] 2026년 10월 7일 Chat 탭 제공 범위, 요금제별 모델·추론 옵션과 Work·Codex 변경 없음.
ChatGPT release notes — October 7, 2026 (외부)
OpenAI Help Center · 2026-10-07 - [3] Reece Rogers의 출시 전 짧은 직접 UI 사용 사례. 도식·주거비 슬라이더·좌석 탐색 경험이며 정량 정확도 실험은 아님.
The New ChatGPT Is More Show Than Tell (외부)
WIRED · 2026-10-07 - [4] 10월 Chat·9월 Work/Codex 버전 구분, 평가 추론 설정, 지시 계층 강건성 Sol99.99%·Luna99.79%. UI 정확도 아닌 업체 평가.
GPT-6 Sol and GPT-6 Luna: October 2026 update (외부)
OpenAI Deployment Safety Hub · 2026-10-07 - [5] 9월 출시 Sol Max의 독립 API 평가 확인값: Intelligence Index48, TTFT127.24초. 10월 Chat UI 결과와 구별.
GPT-6 Sol (max) — Artificial Analysis (외부)
Artificial Analysis - [6] 9월 출시 Luna Max의 독립 API 평가 확인값: Intelligence Index38, TTFT108.60초. 10월 Chat UI 결과와 구별.
GPT-6 Luna (max) — Artificial Analysis (외부)
Artificial Analysis - [7] Intelligence Index의 합산 평가 방법론. 모델 능력 지표를 UI 전용 통과율로 확대하지 않음.
Intelligence Benchmarking — Artificial Analysis (외부)
Artificial Analysis
함께 읽기
- AI 평가: 무엇을 어떻게 측정할 것인가 (개념 뼈대 · AI 평가: 무엇을 어떻게 측정할 것인가)
- 언어모델의 추론 (개념 뼈대 · 추론)