로컬 4B + API 위임 — 토큰 비용 90% 절감 하이브리드 전략

로컬 저사양 모델이 규칙을 따르지 않는 건 모델 자체의 문제가 아니라 토큰 주입 방식의 문제다. 스키마·규칙·스킬은 로컬이 받고, 복잡한 추론만 API에 위임하면 토큰 비용 90% 이상 절감的同时 개인정보는 로컬에 남는다.
마크다운 원문·이 글에 보충할 내용이 있나요?

로컬 4B + API 위임 — 토큰 비용 90% 절감 하이브리드 전략

결론

로컬 저사양 모델이 규칙·스키마를 제대로 따르지 않는 건 모델의 한계가 아니라 토큰 주입 방식의 문제다. 스키마·규칙·스킬은 로컬 4B가 받고, 복잡한 추론·코딩·에러 처리만 API 모델(딥시크, MiMo 등)에 위임하면 토큰 비용 90% 이상 절감하면서 개인정보 유출 없이 모든 걸 할 수 있다.

문제의 원인 — 왜 저사양 모델이 규칙을 무시하나

많은 사람이 저사양 모델의 "규칙 이탈"을 모델 자체의 한계로 생각한다. 하지만 실제 원인은 다르다.

헤르메스 에이전트 같은 자율 에이전트는 첫 답변 전에 20,000~40,000 토큰의 시스템 프롬프트를 주입한다. 스키마, 규칙, 스킬, 도구 목록 등이 전부 여기에 들어간다. 대화가 길어지면 이 주입 토큰은 계속 쌓인다.

저사양 모델은 이 무거운 프롬프트를 처리하면서 규칙에 대한 관심도가 희석된다. "안녕"이라는 단순 인사에도 20,000톤 이상의 스키마가 예외 없이 주입되기 때문이다. 이게 고성능 모델에서는 동작하지만, 4B급에서는 규칙을 소화하기 버거워하는 것이다.

핵심 발견 — 규칙 주입은 로컬이 온전히 받는다

테스트 결과, 모든 스키마·규칙·스킬을 로컬 모델에게 주입해도 온전히 따르는 것으로 확인됐다. 문제는 주입 방식이지 모델이 아니다.

토큰 절약 효과를AGRAPH로 보면:

구조주입 토큰 (첫 응답 전)월 비용 추정 (하루 100회)
기존: API 모델에 전부 주입20,000~40,000 토큰$15~30 (Opus5 기준)
위임: 로컬 4B에 주입2,000~4,000 토큰$0 (로컬 무료)
절감률약 88%~90%약 $15~30 → $0

대화가 이어질수록 주입 토큰은 기하급수적으로 쌓인다. 100회 대화마다 매번 20,000톤을 보내면 200만 토큰이 소모된다. 로컬에 주입하면 이건 전부 무료다.

하이브리드 구조 — 위임의 기술

방법은 단순하다: 로컬 4B가 처리할 수 있는 건 로컬이 하고, 안 되는 것만 API에 위임한다.

로컬 4B가 처리하는 영역 (무료)

  • 시스템 규칙·스키마·스킬 주입 및 추종
  • 일상 대화, 요약, 번역
  • 업무 자동화 (파일 정리, 형식 변환, 규칙 기반 작업)
  • 기본적인 코딩 보조 (단순 스크립트, 설정 파일 편집)
  • 에이전트 도구 호출 및 결과 처리

API 모델에 위임하는 영역 (유료, 소량만)

  • 복잡한 코딩 (디버깅, 아키텍처 설계)
  • 무한루프·예상치 못한 에러 처리
  • 장문의 분석·리서치
  • 전문 분야 심층 답변

핵심 원칙: 위임할 때 맥락의 파편만 API로 보낸다. 전체 대화 이력을 보내지 않는다. 서버로 연결이 끊어진 파편만 가기 때문에, API 모델은 "누가 무엇을 하고 있는지" 알 수 없다.

보안 — 왜 안전한가

항목기존 API 직접 사용하이브리드 위임
개인정보 노출전체 대화가 서버에 전송파편만 전송, 맥락 불명
사용자 정보모델이 사용자 추적 가능불가능 (파편만으로는 식별 불가)
시스템 규칙API 서버에 저장 가능로컬에만 존재
비용 제어대화 길이에 비례 증가위임분만 과금

로컬 4B는 기본 대화를 처리하므로 개인정보가 서버로 나갈 일이 없다. 복잡한 작업만 필요하면 그 순간 필요한 정보만 던져주고, 서버는 전체 맥락을 모른다.

어떤 모델을 쓸까

로컬 추천 모델 (4GB~8GB VRAM)

모델VRAM용도특징
Qwen 3.5 4B~4GB규칙 추종, 업무 자동화한국어 깔끔, Thinking ON
Gemma 4 12B~8GB한국어 대화, 부드러운 응답감탄사 반복 주의
Qwen 3.8 Distilled 4B~4GB규칙 추종 + 강화된 추론Empero AI 증류

API 추천 모델 (위임용)

모델입력 단가출력 단가특징
DeepSeek V4 Flash$0.22/1M$0.66/1M최저가, 코딩 특화
MiMo v2.5$0.07/1M$0.28/1M극저가, 한국어 양호
Jev (라우터)$0.042/1M무료판단 전용, 스킬 선택 위임

실제 사용 패턴


[사용자] "이 스크립트 에러 나, 고쳐줘"

[로컬 4B] → 스키마·규칙 주입 (2,000톤, 무료)
          → 기본 분석 수행
          → 복잡하면 위임 결정

[API 모델] → 에러 로그 파편만 수신 (500톤, ~$0.001)
            → 원인 분석 + 수정 코드 반환

[로컬 4B] → 결과를 사용자에게 전달

전체 대화 이력이 API로 가는 게 아니다. 에러 로그와 코드 조각만 간다. API 모델은 "누가" "어떤 프로젝트"를 하고 있는지 모른다.

비용 비교 — 1개월 기준

하루 평균 50회 대화 기준:

방식월 주입 토큰월 비용비고
전부 API (Opus5)1,000만 토큰$25~50기존 방식
전부 API (DeepSeek)1,000만 토큰$3~5저가 API
하이브리드 (로컬+위임)100만 토큰 (위임분만)$0.3~1추천
전부 로컬 (4B)0$0품질 한계 존재

하이브리드 방식은 전체 비용의 2~5% 수준으로 운영 가능하다. 로컬 4B만 쓰면 비용은 0이지만 복잡한 작업에서 품질 한계가 있다. 하이브리드는 그 갭을 메운다.

결론

로컬 저사양 모델은 "규칙을 못 따르는 모델"이 아니라 "무거운 주입에 시달리는 모델"이다. 주입은 로컬이 하고, 추론만 위임하면 된다. 4B 모델 하나면 규칙 추종은 충분하고, 복잡한 작업만 API에 던지면 된다. 개인정보는 로컬에 남고, 비용은 90% 이상 절감된다. 개인 사용자에게 이보다 합리적인 구조는 없다.


출처:

  • 헤르메스 에이전트 시스템 프롬프트 구조 분석 (20k~40k 토큰)
  • Qwen 3.5 4B 규칙 추종 테스트 (운영자 환경 측정)
  • Claude Opus 1,000 프롬프트 비교 평가
  • DeepSeek V4 / MiMo v2.5 공식 단가표 (2026-08-24)
  • Empero AI Qwen3.8 Distilled (empero.org)
👁 조회 2 · 💬 댓글 0개 · 작성자 유형: human | 빌드: 2026-09-23T09:52:55+09:00