먼저 100만 토큰당 입력·출력을 따로 봅니다
아래는 2026년 8월 28일 공식 가격표에서 텍스트 중심 모델의 대표 단가를 추린 것입니다. 모두 미국 달러, 100만 토큰 기준이며 모델 상태와 긴 컨텍스트 구간에 따라 달라집니다.
| 모델 | 유료 입력 | 유료 출력 | 메모 |
|---|---|---|---|
| Gemini 3.5 Flash | $1.50 | $9.00 | thinking token이 출력에 포함 |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | 대량·비용 효율 작업용 |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | 20만 토큰 이하 입력 구간 |
| Gemini 3.1 Pro Preview | $4.00 | $18.00 | 20만 토큰 초과 입력 구간 |
모델 이름에 Flash가 붙었다고 항상 같은 가격은 아닙니다. Preview 모델은 ID와 가격이 바뀔 수 있고, 입력이 20만 토큰을 넘는 순간 Pro의 단가 구간이 달라질 수 있습니다. 가격표를 복사해 예산표에 고정하기보다 실제 사용하는 모델 ID와 기준일을 함께 기록하세요.
무료 티어는 ‘무료 유료서비스’가 아니라 테스트 환경에 가깝습니다
공식 페이지는 무료로 시작한 뒤 prepaid 또는 pay-as-you-go로 확장하는 구조를 안내합니다. 무료 티어는 일부 모델과 지역에서 제한된 요청량으로 시험하기 좋습니다. 하지만 모델별 rate limit이 다르고, 운영 트래픽을 안정적으로 보장하는 약속으로 읽으면 안 됩니다.

가격표에는 무료 티어 데이터가 Google 제품 개선에 사용될 수 있고 유료 티어는 그렇지 않다는 구분도 표시됩니다. 비용뿐 아니라 데이터 처리 조건 때문에 유료 전환이 필요한 팀이 있습니다. 고객정보나 사내 문서를 다룬다면 무료 한도보다 데이터 정책과 조직의 보안 기준을 먼저 검토해야 합니다.
월 10M 입력·2M 출력이면 모델별 차이가 커집니다
Gemini 3.5 Flash
입력: 10 × $1.50 = $15
출력: 2 × $9.00 = $18
합계: $33
Gemini 3.1 Flash-Lite
입력: 10 × $0.25 = $2.50
출력: 2 × $1.50 = $3
합계: $5.50검색 Grounding, 캐시 저장, 이미지·음성, 세금과 환율은 제외한 단순 비교입니다.
같은 요청 수여도 프롬프트와 답변 길이가 다르면 비용이 달라집니다. 요청 1,000건이라는 숫자보다 실제 input_tokens와 output_tokens를 합산해야 합니다. thinking을 사용하는 모델은 사용자에게 보이는 답변보다 청구되는 출력 토큰이 많을 수 있습니다.
환율을 1,400원으로 가정하면 $33은 약 4만 6천 원이지만 카드사의 해외결제 수수료와 실제 환율이 추가될 수 있습니다. 원화 예산을 세울 때는 달러 금액에 10~20% 완충을 두는 편이 안전합니다.
캐싱·검색·Batch가 계산을 바꿉니다
긴 시스템 지침이나 같은 문서를 반복 입력한다면 context caching으로 입력비용을 줄일 수 있지만 캐시 토큰 단가와 저장 시간 비용이 따로 있습니다. 캐시를 거의 재사용하지 않으면 저장 비용만 늘 수 있습니다. 반복되는 접두 컨텍스트가 충분히 큰지와 실제 hit rate를 측정해야 합니다.
Google Search Grounding은 Gemini 3.x 모델 전체에서 월 5,000개의 무료 검색 요청을 공유하고, 이후 1,000개 검색 쿼리당 $14가 표시돼 있습니다. 한 번의 API 요청이 여러 검색 쿼리를 만들 수 있어 애플리케이션 요청 수와 과금 검색 수가 같지 않을 수 있습니다.
즉시 결과가 필요 없는 대량 작업이라면 Batch 가격이 표준보다 낮습니다. Gemini 3.5 Flash의 Batch 단가는 입력 $0.75, 출력 $4.50로 표준의 절반 수준입니다. 야간 분류나 대량 요약처럼 지연을 받아들일 수 있는 작업인지가 조건입니다.
가장 싼 모델보다 실패까지 포함한 비용을 봅니다
Flash-Lite가 한 번에 정확히 처리하면 훨씬 저렴합니다. 하지만 품질 부족으로 두세 번 재시도하거나 사람이 결과를 크게 고쳐야 한다면 API 단가 차이가 줄어듭니다. 실제 업무 데이터 50~100건으로 성공률과 평균 토큰, 재시도 횟수를 비교하세요.
단순 분류·추출Flash-Lite부터 시험하고 구조화 출력 성공률 확인
일반 요약·대화Flash에서 품질과 지연시간의 균형 측정
복잡한 추론Pro와 Flash의 작업 성공률·긴 컨텍스트 단가 비교
대량 비동기Batch 처리시간이 업무 요구에 맞는지 확인
예산 경보는 월말이 아니라 요청 직전에 작동해야 합니다
애플리케이션에서 요청별 모델, 입력·출력 토큰, 기능별 비용을 기록합니다. 일·주·월 한도를 정하고 예상 비용이 임계치를 넘으면 더 저렴한 모델로 전환하거나 사람 승인을 받게 합니다. 무한 재시도와 지나치게 긴 출력 제한도 막아야 합니다.
개발 환경과 운영 환경의 API 키·프로젝트를 분리하면 테스트 비용이 실제 고객 비용에 섞이지 않습니다. 가격 변경이 잦은 Preview 모델은 배포 설정에 모델 ID를 고정하고 교체 시 품질·비용 테스트를 다시 수행하세요. Gemini API 가격 비교는 한 번 작성하고 끝나는 문서가 아니라 운영 지표에 가까워야 합니다.
Gemini Developer API 최신 가격표 확인 ↗
Google Gemini Developer API 가격, Gemini 3 모델, rate limits 문서를 2026년 8월 28일 확인했습니다.