7억 4천만 토큰 청구서가 10달러대 — 같은 토큰을 클로드·챗GPT에 태우면 얼마일까
거대 언어 모델(LLM)을 일상적인 에이전트로 굴리거나 강도 높은 개발 환경에 연동해 본 사람이라면 누구나 '토큰 비용'이라는 벽에 부딪힌다. 텍스트 분석, 코드 리뷰, 멀티모달 프롬프트를 끊임없이 던지다 보면 API 요금은 순식간에 불어난다. 그런데 최근 중국 모델들이 보여주는 비용 효율성은 이 상식을 완전히 뒤집는다.
이 글은 개념 설명이 아니라 실제 청구서 기록이다. 텍스트 기반의 치밀한 논리 작업은 '딥시크(DeepSeek)'에 맡기고, 일상적인 멀티모달 에이전트 역할은 '샤오미 미모(MiMo)'에게 전담시키는 투트랙(Two-track) 전략을 운영한 결과, 두 모델을 합쳐 7억 4천만 토큰을 쓰고도 청구된 비용은 10달러대에 머물렀다. 아래 수치는 모두 대시보드에 찍힌 값 그대로이며, 환산·추정치는 별도로 표기한다.
한눈에 보는 청구서
| 항목 | 딥시크(DeepSeek) | 미모(MiMo) |
|---|---|---|
| 역할 | 텍스트·코드 워크호스 | 멀티모달 상시 에이전트 |
| API 요청 수 | 3,243회 | (집계 구간 상이) |
| 누적 처리 토큰 | 359,761,623 | 380,023,367 |
| 청구 비용 | $4.86 | $5.11 |
| 비고 | 누적 총비용 $11.34 포함 | 입력 캐시 히트 93.8% |
두 모델을 합치면 739,784,990 토큰, 즉 약 7억 4천만 토큰이다. 그 대가로 청구된 금액은 두 모델 합계 $9.97, 누적 기준으로도 10달러대 초반이다.
딥시크(DeepSeek): 3.6억 토큰을 소화한 텍스트 워크호스
- 총 API 요청(API requests): 3,243회
- 누적 처리 토큰(Tokens): 359,761,623 토큰 (약 3억 6천만)
- 해당 구간 청구 비용(Cost): $4.86 (누적 총비용 $11.34에 포함)
3천 번이 넘는 개별 API 호출과 3억 6천만 개의 토큰을 소모했는데 청구된 비용은 커피 한 잔 값인 5달러가 채 되지 않는다. 요청당 평균 약 11만 토큰을 처리한 셈인데, 이는 한 번의 호출에 코드베이스 일부와 작업 지시, 도구 출력이 함께 실린다는 뜻이다.
샤오미 미모(MiMo): 캐시 히트가 만든 멀티모달의 기적
- 누적 소비 비용(Cumulative Consumption): $5.11
- 총 토큰 소비량(Token History Consumption): 380,023,367 토큰 (약 3억 8천만)
- 입력 캐시 히트(Input Cache Hit): 354,696,567 토큰 (전체 입력의 약 93.8%)
- 입력 캐시 미스(Input Cache Miss): 23,258,315 토큰
- 출력 토큰(Output Token): 2,068,485 토큰
미모가 5달러 남짓한 비용으로 3억 8천만 토큰을 처리한 비결은 압도적인 입력 캐시 히트(Cache Hit) 비율에 있다. 에이전트는 같은 작업 환경과 맥락(Context)을 매 요청마다 다시 읽는다. 미모는 전체 입력 토큰의 93% 이상을 캐시에서 적중시켜, 실제로 새로 계산한 미스 토큰은 2,300만 개 수준으로 줄였다. 캐시 히트 토큰은 신규 입력보다 훨씬 싸게 과금되므로, 무거운 멀티모달 데이터를 계속 실어 보내도 부담이 거의 늘지 않는다.
캐시가 잘 먹으려면 프롬프트 앞부분(시스템 지시, 도구 정의, 고정 문서)이 요청마다 안정적으로 유지되어야 한다. 맥락을 요청마다 뒤섞으면 캐시가 깨져 청구서가 몇 배로 뛴다. 93.8%는 모델 성능이 아니라 프롬프트 운영 방식의 결과물이다.
같은 토큰을 다른 모델에 태우면 얼마인가
여기서부터가 핵심이다. 위 7억 4천만 토큰을 지금 가장 많이 쓰는 클로드와 챗GPT 모델에 태웠다면 청구서가 얼마였을지 계산했다. 단가는 각 사 공식 가격표(2026-10-04 조회)를 사용했고, 아래 두 표는 모두 추정 계산값이며 실측값이 아니다.
1) 단순 입력 환산 — 전체 7억 4천만 토큰 기준
캐시·출력 할인을 적용하지 않고, 총 토큰량을 각 모델의 입력 단가에 그대로 곱한 상한값이다.
| 모델 | 입력 단가(/1M) | 7억 4천만 토큰 환산 |
|---|---|---|
| Claude Fable 5.1 | $10 | $7,397.85 |
| GPT-6 Astra | $10 | $7,397.85 |
| GPT-5.5 | $5 | $3,698.92 |
| Claude Opus 5.5 | $4 | $2,959.14 |
| GPT-5.4 | $2.50 | $1,849.46 |
| GPT-4o | $2.50 | $1,849.46 |
| Claude Sonnet 5.5 | $2 | $1,479.57 |
| GPT-5 | $1.25 | $924.73 |
| Claude Haiku 4.5 | $1 | $739.78 |
| GPT-6 Luna | $0.10 | $73.98 |
같은 7억 4천만 토큰을 Claude Opus 5.5에 태우면 단순 입력 환산으로 약 $2,959, GPT-6 Astra면 약 $7,398이다. 실제 청구된 $9.97과 비교하면 각각 약 297배, 약 742배다.
2) 캐시 구조 반영 — 미모 구간 실측 기준
미모의 실제 입력은 캐시 히트 3.55억, 미스 0.23억, 출력 0.02억으로 구성됐다. 이 구조를 그대로 유지한 채 모델만 바꿔 계산하면 다음과 같다.
| 모델 | 캐시히트 3.55억 | 미스 0.23억 | 출력 0.02억 | 합계 |
|---|---|---|---|---|
| Claude Haiku 4.5 | $35.47 | $23.26 | $10.34 | $69.07 |
| Claude Sonnet 5.5 | $70.94 | $46.52 | $20.68 | $138.14 |
| Claude Opus 5.5 | $70.94 | $93.03 | $41.37 | $205.34 |
| Claude Fable 5.1 | $88.67 | $232.58 | $103.42 | $424.68 |
| GPT-6.1 Sol | $35.47 | $46.52 | $20.68 | $102.67 |
| GPT-5 | $44.34 | $29.07 | $20.68 | $94.09 |
| GPT-5.4 | $88.67 | $58.15 | $31.03 | $177.85 |
| GPT-5.5 | $177.35 | $116.29 | $62.05 | $355.69 |
| GPT-4o | $443.37 | $58.15 | $20.68 | $522.20 |
| GPT-6 Astra | $354.70 | $232.58 | $103.42 | $690.70 |
캐시 할인을 반영하더라도 미모 구간을 Claude Opus 5.5로 돌리면 약 $205, GPT-6 Astra로 돌리면 약 $691이다. 실제 미모 청구액 $5.11과 비교하면 약 40배, 약 135배 차이다. 참고로 캐시 읽기 단가가 가장 불리한 편인 GPT-4o는 약 $522로, 미모보다 약 100배 비싸다.
즉 무료에 가까운 이 청구서는 미모의 캐시 효율만으로 만든 게 아니다. 모델 자체의 입력·출력 단가가 이미 한 자릿수 이상 낮다는 점이 절반, 캐시 운영이 나머지 절반을 만들었다.
성능과 비용 사이, 투트랙이 답인 이유
- 논리·코드·텍스트: 딥시크. 요청당 토큰이 크고 추론 강도가 필요한 작업을 저렴한 텍스트 연산으로 처리한다.
- 문맥 유지·멀티모달 상시 루프: 미모. 같은 맥락을 반복해서 읽는 구조이므로 캐시 히트 효율이 곧 비용 절감으로 직결된다.
작업 성격에 따라 모델을 나누면, 비싼 멀티모달 연산을 텍스트 추론에 낭비하지 않고, 캐시가 잘 먹는 상시 루프는 저렴한 캐시 단가로 방어할 수 있다. 7억 4천만 토큰을 쓰고도 청구서가 10달러대에 머문 이유다.
프런티어 모델의 품질이 반드시 필요한 작업은 그때만 쓰면 된다. 상시 루프와 대량 반복 작업을 플래그십 모델에 태우는 순간, 위 표의 세 자리 수 청구서가 현실이 된다.
주의할 점
- 위 비교표의 모든 금액은 공개 단가에 토큰량을 곱한 추정 계산값이다. 대시보드 실측값과 다르며, 캐시 정책·요금제·배치 할인에 따라 달라진다.
- 캐시 히트율은 프롬프트 안정성에 좌우된다. 시스템 지시·도구 정의를 요청마다 바꾸면 캐시가 깨지고 비용이 급증한다.
- 로그·토큰 집계 구간이 모델마다 다를 수 있어, 두 모델의 요청 수를 1:1로 비교하면 안 된다.
- 위 수치는 단일 운영 환경에서 나온 기록이다. 모델 버전과 캐시 정책이 바뀌면 단가 구조도 바뀐다.
- 저렴하다는 이유만으로 민감한 데이터를 무분별하게 input에 넣어서는 안 된다.
결론
성능과 비용 사이에서 타협점을 찾는 헤비 유저에게, 딥시크와 미모의 앙상블은 대체 불가능에 가까운 선택지다. 논리력은 딥시크의 저렴한 텍스트 연산으로, 문맥 유지가 필수인 멀티모달 루프는 미모의 캐시 효율로 방어하는 구조.
같은 7억 4천만 토큰을 플래그십에 태우면 세 자리에서 네 자리 청구서가 나온다. 10달러대 청구서는 이제 "AI를 얼마나 쓸 수 있나"가 아니라 "어떻게 조합해 굴리느냐"의 문제임을 보여준다.
AI Knowledge Hub
댓글 (2개)
실측 청구서와 단가 환산 표를 공개해 주셔서 감사합니다. 몇 가지 실무 포인트를 보충합니다.
투트랙 전략(논리=딥시크, 상시루프=미모)은 비용·성능 트레이드오프를 깨는 실용적 해법입니다. 캐시 운영 디테일(프롬프트 고정화, 버전 관리, 캐시 무효화 전략)만 잘 잡으면 소규모 팀도 플래그십급 처리량을 1/50 비용으로 낼 수 있음을 실증했습니다.
댓글 1개 더 보기
대규모 에이전트 환경에서 텍스트 추론용 모델과 상시 멀티모달 루프 모델을 분리하는 투트랙(Two-track) 아키텍처는 프롬프트 접두사(Prefix) 일관성과 캐시 생존 주기(TTL)를 체계적으로 관리할 때 비용 절감 효과가 극대화됩니다. 본 실측 사례에 더해 실제 운영 파이프라인에서 캐시 효율을 유지하고 토큰 낭비를 방지하기 위한 기술적 보충 포인트를 공유합니다.
컨텍스트 캐싱(Prompt Caching) 메커니즘은 프롬프트 앞부분의 토큰 일치 여부에 엄격하게 종속됩니다.
딥시크와 미모의 2트랙 구성에 더해, 오케스트레이션 및 사전 필터링 단계에 초저지연 경량 모델(예: Gemini Flash 계열)을 전위 배치하는 방안을 고려할 수 있습니다.
상시 멀티모달 에이전트 운영 시 스크린샷이나 이미지 입력은 캐시 미스가 발생했을 때 토큰 소모량이 급증하는 주원인이 됩니다.