로컬 4B + API 위임 — 토큰 비용 90% 절감 하이브리드 전략
로컬 4B + API 위임 — 토큰 비용 90% 절감 하이브리드 전략
결론
로컬 저사양 모델이 규칙·스키마를 제대로 따르지 않는 건 모델의 한계가 아니라 토큰 주입 방식의 문제다. 스키마·규칙·스킬은 로컬 4B가 받고, 복잡한 추론·코딩·에러 처리만 API 모델(딥시크, MiMo 등)에 위임하면 토큰 비용 90% 이상 절감하면서 개인정보 유출 없이 모든 걸 할 수 있다.
문제의 원인 — 왜 저사양 모델이 규칙을 무시하나
많은 사람이 저사양 모델의 "규칙 이탈"을 모델 자체의 한계로 생각한다. 하지만 실제 원인은 다르다.
헤르메스 에이전트 같은 자율 에이전트는 첫 답변 전에 20,000~40,000 토큰의 시스템 프롬프트를 주입한다. 스키마, 규칙, 스킬, 도구 목록 등이 전부 여기에 들어간다. 대화가 길어지면 이 주입 토큰은 계속 쌓인다.
저사양 모델은 이 무거운 프롬프트를 처리하면서 규칙에 대한 관심도가 희석된다. "안녕"이라는 단순 인사에도 20,000톤 이상의 스키마가 예외 없이 주입되기 때문이다. 이게 고성능 모델에서는 동작하지만, 4B급에서는 규칙을 소화하기 버거워하는 것이다.
핵심 발견 — 규칙 주입은 로컬이 온전히 받는다
테스트 결과, 모든 스키마·규칙·스킬을 로컬 모델에게 주입해도 온전히 따르는 것으로 확인됐다. 문제는 주입 방식이지 모델이 아니다.
토큰 절약 효과를AGRAPH로 보면:
| 구조 | 주입 토큰 (첫 응답 전) | 월 비용 추정 (하루 100회) |
|---|---|---|
| 기존: API 모델에 전부 주입 | 20,000~40,000 토큰 | $15~30 (Opus5 기준) |
| 위임: 로컬 4B에 주입 | 2,000~4,000 토큰 | $0 (로컬 무료) |
| 절감률 | 약 88%~90% | 약 $15~30 → $0 |
대화가 이어질수록 주입 토큰은 기하급수적으로 쌓인다. 100회 대화마다 매번 20,000톤을 보내면 200만 토큰이 소모된다. 로컬에 주입하면 이건 전부 무료다.
하이브리드 구조 — 위임의 기술
방법은 단순하다: 로컬 4B가 처리할 수 있는 건 로컬이 하고, 안 되는 것만 API에 위임한다.
로컬 4B가 처리하는 영역 (무료)
- 시스템 규칙·스키마·스킬 주입 및 추종
- 일상 대화, 요약, 번역
- 업무 자동화 (파일 정리, 형식 변환, 규칙 기반 작업)
- 기본적인 코딩 보조 (단순 스크립트, 설정 파일 편집)
- 에이전트 도구 호출 및 결과 처리
API 모델에 위임하는 영역 (유료, 소량만)
- 복잡한 코딩 (디버깅, 아키텍처 설계)
- 무한루프·예상치 못한 에러 처리
- 장문의 분석·리서치
- 전문 분야 심층 답변
핵심 원칙: 위임할 때 맥락의 파편만 API로 보낸다. 전체 대화 이력을 보내지 않는다. 서버로 연결이 끊어진 파편만 가기 때문에, API 모델은 "누가 무엇을 하고 있는지" 알 수 없다.
보안 — 왜 안전한가
| 항목 | 기존 API 직접 사용 | 하이브리드 위임 |
|---|---|---|
| 개인정보 노출 | 전체 대화가 서버에 전송 | 파편만 전송, 맥락 불명 |
| 사용자 정보 | 모델이 사용자 추적 가능 | 불가능 (파편만으로는 식별 불가) |
| 시스템 규칙 | API 서버에 저장 가능 | 로컬에만 존재 |
| 비용 제어 | 대화 길이에 비례 증가 | 위임분만 과금 |
로컬 4B는 기본 대화를 처리하므로 개인정보가 서버로 나갈 일이 없다. 복잡한 작업만 필요하면 그 순간 필요한 정보만 던져주고, 서버는 전체 맥락을 모른다.
어떤 모델을 쓸까
로컬 추천 모델 (4GB~8GB VRAM)
| 모델 | VRAM | 용도 | 특징 |
|---|---|---|---|
| Qwen 3.5 4B | ~4GB | 규칙 추종, 업무 자동화 | 한국어 깔끔, Thinking ON |
| Gemma 4 12B | ~8GB | 한국어 대화, 부드러운 응답 | 감탄사 반복 주의 |
| Qwen 3.8 Distilled 4B | ~4GB | 규칙 추종 + 강화된 추론 | Empero AI 증류 |
API 추천 모델 (위임용)
| 모델 | 입력 단가 | 출력 단가 | 특징 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.22/1M | $0.66/1M | 최저가, 코딩 특화 |
| MiMo v2.5 | $0.07/1M | $0.28/1M | 극저가, 한국어 양호 |
| Jev (라우터) | $0.042/1M | 무료 | 판단 전용, 스킬 선택 위임 |
실제 사용 패턴
[사용자] "이 스크립트 에러 나, 고쳐줘"
[로컬 4B] → 스키마·규칙 주입 (2,000톤, 무료)
→ 기본 분석 수행
→ 복잡하면 위임 결정
[API 모델] → 에러 로그 파편만 수신 (500톤, ~$0.001)
→ 원인 분석 + 수정 코드 반환
[로컬 4B] → 결과를 사용자에게 전달
전체 대화 이력이 API로 가는 게 아니다. 에러 로그와 코드 조각만 간다. API 모델은 "누가" "어떤 프로젝트"를 하고 있는지 모른다.
비용 비교 — 1개월 기준
하루 평균 50회 대화 기준:
| 방식 | 월 주입 토큰 | 월 비용 | 비고 |
|---|---|---|---|
| 전부 API (Opus5) | 1,000만 토큰 | $25~50 | 기존 방식 |
| 전부 API (DeepSeek) | 1,000만 토큰 | $3~5 | 저가 API |
| 하이브리드 (로컬+위임) | 100만 토큰 (위임분만) | $0.3~1 | 추천 |
| 전부 로컬 (4B) | 0 | $0 | 품질 한계 존재 |
하이브리드 방식은 전체 비용의 2~5% 수준으로 운영 가능하다. 로컬 4B만 쓰면 비용은 0이지만 복잡한 작업에서 품질 한계가 있다. 하이브리드는 그 갭을 메운다.
결론
로컬 저사양 모델은 "규칙을 못 따르는 모델"이 아니라 "무거운 주입에 시달리는 모델"이다. 주입은 로컬이 하고, 추론만 위임하면 된다. 4B 모델 하나면 규칙 추종은 충분하고, 복잡한 작업만 API에 던지면 된다. 개인정보는 로컬에 남고, 비용은 90% 이상 절감된다. 개인 사용자에게 이보다 합리적인 구조는 없다.
출처:
- 헤르메스 에이전트 시스템 프롬프트 구조 분석 (20k~40k 토큰)
- Qwen 3.5 4B 규칙 추종 테스트 (운영자 환경 측정)
- Claude Opus 1,000 프롬프트 비교 평가
- DeepSeek V4 / MiMo v2.5 공식 단가표 (2026-08-24)
- Empero AI Qwen3.8 Distilled (empero.org)