# TALK LAB 실험 조건 — 2026-09-17

목적: 여러 조건과 가상 정책을 적용하는 한국어 결항 상담에서 일반 Live와 Extended HIGH의 정확한 처리·시간·비용 비교. 이전 예약 실험과 별개다.

- 우선 6상황 × 2모델 = 12세션, 같은 순서 seed 918로 섞음. 반복은 첫 묶음 종료 후 예산 안에서만. 한 번씩 실행한 결과로 일반 성능 우열을 확정하지 않음.
- 모델: gemini-3.8-live / gemini-3.8-live-extended-thinking HIGH. 동일 프롬프트·도구·고객 음성. 출력 4096단위, 세션 150초, 관측 비용 $0.25에서 중단. 제한 종료는 오답과 구분하되 전체 시도에서 제외해 성공률을 높이지 않음.
- 고객 Yuna 로컬 합성, 응답 Kore. 실시간 속도로 음성 입력, 수동 발화 구간, 실제 전화망 아님. 도구는 로컬 모의 예약이며 실제 결제·발권 없음.
- 6개의 첫 발화에 예산과 시간을 달리 넣음. raised_budget는 통화 시작부터 12만원이며 통화 도중 수정한 시험이 아님. ambiguous_budget 후속 답변은 1인당 10만원, 총20만원. 전제 확인 뒤 가장 일찍 도착하는 A가 정답.
- 모델은 ask_customer/present_plan으로 질문·제안을 등록하고 음성으로 발화. 모델 턴 종료와 Extended IDLE 확인 후 미리 녹음한 조건별 고객 음성 전송. 고객은 정답 검증기로 유효하다고 확인된 제안만 승인. 모델 발화와 등록 제안의 일치 여부는 실행 후 전사문으로 별도 검토. 실제 일반 고객보다 오류를 잘 잡는 합성 고객이라는 한계.
- 본 실험에서는 끼어들기/잡음/통화 중 조건 변경 없음. 먼저 정책·조건 판단을 분리. 고객 왕복 최대3회, 도구24회. 오류 응답도 기록.
- 모의 도구는 검색·산술을 제공하지만 적합 후보나 감면 정답을 알려주지 않음. 발권 도구는 승인·조건을 방어. 잘못된 발권 시도도 따로 기록. 모든 중간 제안·최종 결과·담당자 이관 점검.
- 명확한 가능안 있는 4상황: 올바른 승인·예약. 불가능한 2상황: 조건 변경 질문→거절 확인→이관. 후자는 올바른 처리지만 무인 해결로 세지 않음.
- 시간: 첫 입력 종료→첫 응답 오디오 수신, 첫 유효 제안 도구 등록, 확정/이관 완료. 실제 스피커 출력 지연은 미측정. output-concatenated는 음성 청취용, output-timeline은 수신 시각 간격 기반 재생본이며 실제 통화 녹음이 아님.
- 비용: 공식 유료 정가 × 저장 사용량. 미분류 종류는 범위. 전사/미수신 사용량·세금·크레딧 미대조. 기록에 나타난 원가 추정이지 청구액 아님.
- 비용 효용: 실제 무인 해결 건당 원가, 올바른 이관 건수, 잘못된 시도, 대안/해결 시간 비교. 사람의 처리비·이관율 실제 현장자료 없음 → 손익분기는 가정의 계산만 제시. 현장 인건비 절감 주장 금지.

공식 출처: https://ai.google.dev/gemini-api/docs/pricing · https://ai.google.dev/gemini-api/docs/models/gemini-3.8-live-extended-thinking

## 본 비교의 고객 응답 방식 수정 (호출 전 고정)

상위 폴더 7회는 고객이 IDLE까지 기다리는 장치의 예비 실행이다. 그 결과로 모델의 속도·비용 우위를 주장하지 않는다. primary 아래가 새 본 비교이며 같은 6상황 × 2모델을 새로 수행한다.

고객은 질문의 오디오 생성이 끝나고 수신 오디오의 순차 재생 길이가 지난 뒤 0.8초 후 답한다. 배경 추론 IDLE는 고객 답변의 조건이 아니다. 세션 종료는 기존처럼 완료 신호/시간 상한으로 판단한다. 출력 실제 재생이 아니라 수신 시각과 샘플 길이를 이용한 모의 청취다.

제안 등록을 생략했어도, 고객이 음성에서 후보명·정확한 총액·도착시각·승인 요청을 모두 인식하면 승인한다. 정규식으로 인식하는 제한된 합성 고객이며 인식 실패는 모델 추론 오답으로 해석하지 않는다. 서버의 승인 상태는 고객 승인 음성이 끝나야 바뀐다. 고객 승인 전 예약 방어는 유지한다.

프롬프트·규정·모델 설정·후보·고객 음성·150초/$0.25 상한은 동일하다. 비용 장부는 상위 폴더를 공유하여 예비 실행 사용량도 총1만원 상한에 포함한다. 예비 실행 중단 손실을 숨기지 않는다.

음성 응답 장치 추가 교정: 첫 2회는 calibration-r1에 보존한다. “주시겠어요?”와 같이 등록 도구 없이 조건 조정을 묻는 음성 질문을 인식하도록 보완했다. 저장된 실제 발화 재생으로 제안 등록 누락·질문 등록 누락·예산 단위 확인·잘못된 금액 거절 4항목을 비용 없이 확인했다. 이후 main-* 접두사의 12회가 본 비교다. 앞선 9회는 전부 예비·교정 비용으로 구분한다.



## 공개 자료의 기록 출처

도착 마감을 늦춘 Extended 회차는 실행일에 보존한 기록으로 집계했습니다. 이후 파일과의 불일치를 발견해 당시 예약 완료 기록 및 사용량과 대조했습니다. 모델을 다시 실행한 결과로 바꾸지 않았습니다.

공개 자료의 비용 환산은 1달러=1,400원 가정이며 실시간 환율이나 실제 청구액이 아닙니다.
