핵심 요약
- 세 곳의 공개 가격표를 같은 날 열어 백만 토큰당 단가를 정리했습니다. 최상위 모델은 Claude Opus 5 가 입력 $5 출력 $25, GPT-5.5 가 입력 $5 출력 $30, Gemini 3.1 Pro Preview 가 입력 $2 출력 $12 입니다.
- 단가만 비교하면 계산이 틀어집니다. 가격표 바깥에 적힌 조건이 셋 있고, 전부 실제 청구액을 바꿉니다.
- 첫째, 토크나이저가 다릅니다. Anthropic 문서는 Claude 4.7 이후 모델이 같은 글에 대해 약 30% 더 많은 토큰을 만든다고 적어놨습니다. 토큰 수가 다르면 토큰 단가 비교는 그대로 성립하지 않습니다.
- 둘째, Gemini 는 프롬프트가 20만 토큰을 넘으면 단가가 올라갑니다. Gemini 3.1 Pro Preview 는 입력이 $2 에서 $4 로 두 배가 됩니다.
- 셋째, 캐시와 배치가 단가를 크게 낮춥니다. Claude 는 캐시 적중이 기본 입력의 10% 이고 배치가 50% 할인입니다. 둘을 같이 쓰면 곱해집니다.
- 값싼 등급으로 내려가면 격차가 더 큽니다. Gemini 2.5 Flash-Lite 입력 $0.10 과 Claude Fable 5 입력 $10 은 100배 차이입니다.
- 모든 값은 2026년 8월 19일에 각 공개 가격 페이지에서 확인했습니다.
문제 정의: 단가표를 나란히 놓으면 답이 나올 것 같지만
LLM 을 제품에 붙일 때 비용 계산은 보통 이렇게 시작합니다. 각 회사 가격 페이지에서 백만 토큰당 단가를 옮겨 적고, 예상 사용량을 곱합니다. 그럼 월 얼마가 나옵니다.
이 계산이 실제 청구액과 어긋나는 경우가 많습니다. 곱셈이 틀린 것이 아니라 곱하는 값의 전제가 서로 다르기 때문입니다. 같은 "백만 토큰" 이 회사마다 같은 양의 글이 아니고, 단가가 조건에 따라 바뀌고, 단가를 크게 낮추는 장치가 따로 있습니다.
그래서 세 곳의 공개 가격 페이지를 같은 날 열어 단가를 정리하고, 가격표 옆에 붙은 조건들을 같이 읽었습니다. 기준은 네 가지입니다. 백만 토큰당 입력 단가, 백만 토큰당 출력 단가, 같은 글이 몇 토큰이 되는가, 가격을 낮추는 장치입니다. 모델 성능과 품질 비교는 이 글에서 다루지 않습니다.
공개 단가부터

백만 토큰(MTok)당 단가입니다. 각 페이지에 적힌 그대로 옮겼습니다.
| 등급 | 모델 | 입력 | 출력 |
|---|---|---|---|
| 최상위 | Claude Opus 5 | $5 | $25 |
| 최상위 | GPT-5.5 | $5 | $30 |
| 최상위 | Gemini 3.1 Pro Preview | $2 (20만 토큰 이하) | $12 (20만 토큰 이하) |
| 특수 | Claude Fable 5 | $10 | $50 |
| 특수 | GPT-5.5-pro | $30 | $180 |
| 중간 | Claude Sonnet 5 | $2 | $10 |
| 중간 | GPT-5.4 | $2.50 | $15 |
| 중간 | Gemini 3.5 Flash | $1.50 | $9 |
| 경량 | Claude Haiku 4.5 | $1 | $5 |
| 경량 | GPT-5-mini | $0.25 | $2 |
| 경량 | Gemini 2.5 Flash-Lite | $0.10 | $0.40 |
출처는 각 서비스의 공개 가격 페이지이며 2026년 8월 19일에 확인했습니다. Claude, OpenAI, Gemini.
여기까지만 보면 등급별로 값이 비슷하게 몰려 있고 Gemini 가 조금 싸 보입니다. 문제는 이 표가 계산의 시작이지 끝이 아니라는 점입니다.
조건 하나: 같은 글이 같은 토큰이 아닙니다
Anthropic 가격 문서에 이런 문장이 있습니다. Claude 4.7 이후 모델이 새 토크나이저를 쓰고, 그 토크나이저가 같은 텍스트에 대해 약 30% 더 많은 토큰을 만든다는 내용입니다. 정확한 증가폭은 내용과 작업 형태에 따라 달라진다고 덧붙여져 있습니다.
이 한 줄이 단가 비교를 흔듭니다. 토큰 단가는 "토큰 하나당 얼마" 인데, 같은 글이 만들어내는 토큰 수가 모델마다 다르면 비교 단위가 어긋납니다.
같은 글을 처리할 때 실제로 얼마가 나오는지 감을 잡기 위해 계산해봤습니다. 가정을 먼저 적습니다. 기준 토크나이저로 10만 토큰이 되는 글이 있다고 하고, 새 토크나이저에서는 문서에 적힌 대로 30% 늘어 13만 토큰이 된다고 놓았습니다.
| 모델 | 입력 단가 | 이 글의 토큰 수 | 입력 비용 | 산식 |
|---|---|---|---|---|
| Claude Sonnet 4.6 (기존 토크나이저) | $2 | 100,000 | $0.20 | 100,000 × 2 ÷ 1,000,000 |
| Claude Opus 5 (새 토크나이저) | $5 | 130,000 | $0.65 | 130,000 × 5 ÷ 1,000,000 |
단가는 2.5배인데 실제 비용은 3.25배가 됩니다. 단가표만 보고 세운 예산은 이 차이만큼 빗나갑니다.
이 계산은 어디까지나 문서에 적힌 "약 30%" 를 그대로 대입한 것입니다. 실제 증가폭은 다루는 글의 성격에 따라 달라지므로, 자기 데이터로 실제 토큰 수를 재보는 편이 정확합니다. 여기서 말씀드리려는 것은 정확한 배수가 아니라 이 항목을 계산에 넣어야 한다는 점입니다.
조건 둘: 길이에 따라 단가가 바뀝니다
Gemini 는 프롬프트 길이에 단가 구간이 있습니다. 페이지에 적힌 그대로입니다.
| 모델 | 20만 토큰 이하 | 20만 토큰 초과 |
|---|---|---|
| Gemini 3.1 Pro Preview 입력 | $2.00 | $4.00 |
| Gemini 3.1 Pro Preview 출력 | $12.00 | $18.00 |
| Gemini 2.5 Pro 입력 | $1.25 | $2.50 |
| Gemini 2.5 Pro 출력 | $10.00 | $15.00 |
입력은 정확히 두 배가 됩니다. 긴 문서를 통째로 넣는 방식으로 쓴다면 표에 적힌 낮은 쪽 단가는 적용되지 않습니다.
Claude 문서는 반대 방향을 명시합니다. Claude 4.6 이후 모델은 100만 토큰 컨텍스트를 표준 단가로 제공한다고 적혀 있고, 90만 토큰 요청이 9천 토큰 요청과 같은 단가로 청구된다는 설명이 붙어 있습니다. 긴 입력을 자주 넣는 작업이라면 이 차이가 그대로 비용 차이가 됩니다.
조건 셋: 단가를 낮추는 장치가 따로 있습니다
세 곳 모두 캐시를 제공하고, 값이 상당히 큽니다.
| 항목 | Claude | OpenAI | Gemini |
|---|---|---|---|
| 캐시 적중 단가 | 기본 입력의 0.1배 | 예: GPT-5.5 $0.50 (기본 $5) | 예: Gemini 3.5 Flash $0.15 (기본 $1.50) |
| 캐시 저장 비용 | 5분 캐시 1.25배, 1시간 캐시 2배 | 페이지에 별도 표시 없음 | 페이지에 별도 표시 없음 |
| 배치 할인 | 입력·출력 50% | 페이지에 별도 표시 없음 | 페이지에 별도 표시 없음 |
셋 다 캐시 적중이 기본 입력의 10분의 1 수준입니다. 같은 시스템 프롬프트나 같은 문서를 반복해서 넣는 구조라면 실질 단가가 여기서 결정됩니다.
Claude 문서는 캐시가 언제부터 이득인지까지 적어놓았습니다. 5분 캐시는 쓰기가 1.25배이므로 한 번만 읽어도 이득이고, 1시간 캐시는 쓰기가 2배이므로 두 번 읽어야 이득이라는 설명입니다. 이 손익 분기를 넘기지 못하는 사용 패턴이면 캐시가 오히려 비쌉니다.
배치를 같이 쓰면 할인이 곱해집니다. Claude Opus 5 기준으로 배치 입력이 $2.50, 배치 출력이 $12.50 입니다. 급하지 않은 작업을 배치로 돌리는 것만으로 절반이 됩니다.
등급을 낮추면 격차가 커집니다

최상위 모델끼리는 입력이 $2 에서 $5 사이로 비교적 몰려 있습니다. 경량 등급으로 내려가면 사정이 달라집니다.
| 모델 | 입력 | 가장 싼 모델 대비 |
|---|---|---|
| Gemini 2.5 Flash-Lite | $0.10 | 1배 |
| GPT-5-mini | $0.25 | 2.5배 |
| Claude Haiku 4.5 | $1 | 10배 |
| Claude Fable 5 | $10 | 100배 |
분류, 추출, 요약처럼 단순한 작업을 어느 등급으로 처리하느냐가 총비용을 가장 크게 흔듭니다. 최상위 모델 하나로 전부 처리하는 구성과, 작업별로 등급을 나눈 구성의 차이가 여기서 나옵니다.
실무 관점: 어떤 순서로 계산하나
- 자기 데이터로 토큰 수를 먼저 잽니다. 단가를 비교하기 전에 같은 글이 각 모델에서 몇 토큰이 되는지 재봅니다. 토크나이저가 다르면 이 값이 다릅니다.
- 평균 프롬프트 길이를 확인합니다. Gemini 를 쓴다면 20만 토큰 경계를 넘는지가 단가를 두 배로 바꿉니다.
- 반복되는 부분이 있는지 봅니다. 같은 시스템 프롬프트나 같은 문서가 매 요청에 들어간다면 캐시가 실질 단가를 10분의 1로 만듭니다. 캐시 손익 분기를 넘기는 빈도인지 같이 확인하시기 바랍니다.
- 급한 작업과 안 급한 작업을 나눕니다. 배치로 돌릴 수 있는 것을 골라내면 그 부분은 절반이 됩니다.
- 작업별로 등급을 나눕니다. 100배 차이가 나는 구간이 있습니다. 전부 최상위로 처리할 이유는 대개 없습니다.
결론
LLM API 비용은 단가표 하나로 끝나지 않습니다. 토큰 수, 길이 구간, 캐시, 배치, 등급 분리까지 넣어야 실제 청구액에 가까워집니다. 이 항목들은 전부 공개돼 있지만 가격표 안이 아니라 옆의 설명글에 적혀 있어서 지나치기 쉽습니다.
모든 값은 2026년 8월 19일에 확인했습니다. 세 곳 모두 모델과 단가를 자주 바꾸고, Gemini 는 일부 모델에 기한이 붙은 단가를 적어놓았습니다. 예산을 세우기 전에 원 페이지를 다시 열어보시기를 권장합니다.