# TALK LAB 공개 실험 자료

2026년 9월 17일 한국어 가상 결항 상담 실험. 일반 Gemini 3.8 Live와 Extended Thinking HIGH를 비교했습니다. 실제 항공사 규정·실제 고객 통화가 아닙니다.

## 먼저 읽기

비교 가능한 것은 4개 상황 × 2개 모델, 총 8회입니다. 두 모델 모두 예약 3건·적절한 이관 1건이었습니다. ambiguous_budget·one_seat 두 상황은 합성 고객 응답 오류로 양쪽 모델을 함께 제외했습니다. results.csv의 included_in_paired_comparison 열이 True인 행만 본문의 비교에 포함합니다. 각 상황은 한 번씩 실행했으므로 일반적인 모델 성공률이 아닙니다.

- analysis.json: 유효 비교 집계, 제외 사유, 전체 12회 결과, 예비 실행까지 포함한 비용.
- results.csv: 회차별 시간·비용·성공 여부. usd_low/high는 비교 구간, raw_usd_low/high는 저장된 전체 세션 사용량 기준입니다. correct는 업무 결과의 정확성이고 completed_correct는 모델 종료 확인까지 요구하는 별도 항목입니다.
- comparison-excerpts.json: 본문에 인용한 모델 출력 자동 전사문 발췌.
- PROTOCOL.md: 실험 조건·측정 방법·고객 응답 장치의 수정 이력.
- runs/: 12회 각각의 자동 전사문, 가상 시스템 상태, 조건, 사용량, 모델 출력 음성.

음성은 output-concatenated.wav를 재생하면 됩니다. 수신한 모델 음성 조각을 이어 붙였으므로 무음·대기 구간을 보존한 실제 통화 녹음이 아닙니다. 파일 재생 길이를 상담 처리 시간으로 읽으면 안 됩니다. 고객 음성은 포함하지 않았습니다. 사람의 청취 평가도 수행하지 않았습니다.

operations의 Extended 세션은 첫 업무가 끝난 뒤 불필요한 후속 대화가 있었습니다. 전사문·음성은 그 대화까지 남겼고, 모델 간 비교는 첫 업무 완료 후 첫 모델 종료 신호까지 적용했습니다. 추가 사용료는 전체 지출에 포함했습니다. 유효 Extended 두 회차는 정답을 저장했지만 모델 종료를 확인하지 못해 150초에 끝났습니다.

## 비용 계산을 읽는 방법

공식 유료 정가에 기록된 사용량을 곱한 관측 비용입니다. 미분류 사용량 때문에 범위로 표시했습니다. 미수신 사용량·별도 전사 비용·세금·크레딧은 청구서와 대조하지 않았습니다. 모든 원화는 1달러=1,400원 가정입니다.

유효 회차의 평균 비용: Live 44~53원, Extended 248~253원. 추가 비용은 약 195~209원입니다. 사람의 후속 처리비를 H원, 상담 건수를 N건으로 두면 회수에 필요한 추가 해결 건수 = (Extended 평균 비용 - Live 평균 비용) × N ÷ H입니다. H=5,000원, N=100건이면 약 3.9~4.2건입니다. 이는 가정의 계산이며 이번 실험에서 추가 해결한 건수는 0건입니다.

새 실험 21회(예비 9회+본 실험 12회)의 관측 비용은 약 2,786~2,928원입니다. 이전 실험까지 합친 40회는 약 4,075~4,277원입니다. 제외 회차 비용도 포함합니다.
