128GB면 충분한가 192GB가 필요한가 로컬 AI 통합 메모리 용량별 경계선

70B는 128GB에서 여유롭고 150GB급 몬스터는 192GB가 필요하며 용량이 속도를 보장하지 않는 이유까지 통합 메모리 선택의 경계선을 정리
마크다운 원문·이 글에 보충할 내용이 있나요?

결론부터 말하면, 대부분의 사람에게는 128GB로 충분하고, 192GB는 돌리고 싶은 초대형 모델의 이름과 이유를 명확히 말할 수 있는 사람만의 선택이다. 그리고 용량이 크다고 빨라지는 것이 아니다. 아래 경계선을 보고 지갑을 열라.

1. 128GB vs 192GB: 무엇을 할 수 있는가

항목128GB 환경192GB 환경
주요 대상 모델Llama 3.1 70B Q4, Qwen 2.5 72B Q4 (40~45GB)Qwen 2.5 72B Q8 (약 77~133GB), DeepSeek-V4 Flash Q4 (약 99~155GB)
초대형 모델235B MoE는 저양자화(Q3 이하)로 빠듯하게 가능235B Q4 여유, Llama 405B Q2 (약 177GB)까지 가능
여유도대형 모델 로드시 컨텍스트(대화 이력)에 제한이 생김대형 모델 + 긴 대화 + 백그라운드 AI 서비스 동시 가능
대표 머신Strix Halo 미니PC, DGX SparkMac Studio M2 Ultra 192GB, Framework 192GB 구성(출시 예고)
추천 대상가성비 중시, 첫 본격 로컬 AI 구축자타협 없이 150GB급 모델을 그대로 돌리고 싶은 사람

수치로 증명하면, 70B Q4는 40~45GB라서 128GB에서 시스템 여유를 빼고도 컨텍스트가 넉넉히 남는다. 코딩 보조나 일상 텍스트 생성이라면 128GB에서 충분히 빠르고 실용적이다. 반면 Qwen 2.5 72B를 Q8(압축률 낮은 고품질)로 돌리거나 DeepSeek-V4 Flash 284B급을 올리려면 128GB의 벽을 넘으므로 192GB가 필요하다.

2. 양자화별 실제 메모리 점유표: 내 모델은 몇 GB인가

모델이 메모리에 올라갈 때 차지하는 크기는 파라미터 수에 양자화 비트를 곱한 값이다. 아래 표가 모든 판단의 출발점이다.

모델BF16/FP16Q8_0Q4_K_MQ3 이하
7~8B (Llama 3.1 8B 등)약 16GB약 8.5GB약 5GB약 3.5GB
14B (Phi-4, Qwen 14B)약 28GB약 15GB약 9GB약 6GB
27~32B (Qwen 27B, QWQ 32B)약 60GB약 33GB약 19GB약 13GB
70~72B (Llama 70B, Qwen 72B)약 145~160GB약 77GB약 43GB약 30GB
120B MoE (GPT-OSS 120B)약 240GB약 130GB약 70GB약 50GB
235B MoE (Qwen3 235B)약 470GB약 260GB약 142GB약 100GB
284B MoE (DeepSeek V4 Flash)약 560GB약 300GB약 155GB약 110GB
405B (Llama 3.1 405B)약 810GB약 430GB약 240GB약 178GB (Q2)

여기에 시스템 예약분(약 8GB)과 KV 캐시(긴 대화 시 수 GB~수십 GB)를 더해야 실가용량이 나온다. 128GB 머신의 실가용이 약 120GB라면 70B Q4(43GB)는 여유롭지만 235B Q4(142GB)는 물리적으로 못 올라간다. 192GB 머신의 실가용 약 184GB라면 235B Q4도 남고 405B Q2(178GB)까지 턱걸이로 들어간다. 이것이 두 용량의 물리적 경계선이다.

3. KV 캐시: 모델보다 대화를 길게 하면 터지는 진짜 범인

모델 가중치는 고정비지만 KV 캐시는 대화가 길어질수록 늘어나는 변동비다. 70B 모델에 100K 토큰 대화를 쌓으면 KV 캐시만 수십 GB가 추가된다. 128GB에서 70B Q4를 돌리면서 장문 레포 분석을 하면 모델(43GB) + KV 캐시(30GB 이상) + 시스템으로 100GB를 넘기기 쉽고, 이때부터 컨텍스트 제한이 걸린다. 192GB라면 같은 조건에서도 80GB 이상이 남아 백그라운드 번역 에이전트나 임베딩 서버를 같이 돌릴 수 있다. 장문 작업이 주업이면 용량 선택의 무게가 달라진다.

4. 속도의 진실: 토큰 속도는 대역폭으로 계산된다

로컬 추론 속도의 공식은 단순하다. 초당 토큰 수/TPS는 메모리 대역폭을 모델 크기로 나눈 값에 비례한다.

머신대역폭70B Q4 예상 속도235B Q4 예상 속도
Strix Halo 128GB (256GB/s)256GB/s약 8~12 tok/s약 3~5 tok/s (저양자화 기준)
DGX Spark (273GB/s)273GB/s약 10~13 tok/s약 4~6 tok/s
Mac Studio M2 Ultra (800GB/s)800GB/s약 25~35 tok/s약 13~20 tok/s

실측도 이를 뒷받침한다. GMKtec EVO-X2 128GB에서 Qwen3 235B가 11 tok/s, Mac Studio M2 Ultra 192GB에서 DeepSeek V4 Flash 284B가 52 tok/s로 보고되었다. 같은 모델이라도 대역폭 3배 차이가 속도 3배 차이로 그대로 드러난다.

그래서 예고된 192GB급 Strix Halo 신형의 함정이 있다. 용량은 50% 늘지만 대역폭은 7% 향상에 그친다. 192GB라는 숫자만 보고 샀다가 속도는 그대로인 것을 보고 실망하는 사람이 속출할 것이다. 속도를 원하면 용량이 아니라 대역폭 숫자를 보라.

5. 대표 머신과 실제 가격 (2026년 하반기 기준)

DRAM 부족 사태로 2025년 말 대비 가격이 약 2배 가까이 뛰었다는 점을 먼저 알린다. 아래는 실구매가 기준이다.

머신메모리대역폭가격대비고
GMKtec EVO-X2128GB LPDDR5X256GB/s정가 약 $2,000이나 품귀, 실거래 약 $3,400Qwen3 235B 11 tok/s 표방
Framework Desktop128GB256GB/s약 $3,449, 품절 잦음192GB 구성 출시 예고, 분해 수리 용이
Minisforum MS-S1 Max128GB256GB/s약 $3,639, 재고 있음듀얼 10GbE, 확장 슬롯, 리뷰 최고 평점
NVIDIA DGX Spark128GB273GB/s$3,999에서 $4,699로 인상CUDA 생태계, NVFP4 지원, 2대 연결시 256GB
Mac Studio M2 Ultra192GB800GB/s단종 전 가격대 고가, 중고 시장속도는 독보적 1위, 조용함

Strix Halo 진영은 칩이 동일하므로 Qwen3.8 27B 기준 10 tok/s 내외로 속도가 대동소이하다. 고르는 기준은 가격이 아니라 재고와 포트, AS다. 살 수 있는 박스가 정답이다. DGX Spark는 2대를 ConnectX 케이블로 엮으면 256GB 단일 풀처럼 쓸 수 있어 405B급까지 노릴 수 있는 확장 카드가 있다.

192GB의 현행 실구매 선택지는 사실상 Mac Studio M2 Ultra 192GB가 유일하다. 800GB/s 대역폭 덕분에 DeepSeek V4 Flash 284B를 52 tok/s로 돌린다는 실측이 있으며, Qwen3 235B Q4도 13~20 tok/s로 여유롭게 처리한다.

6. 용도별 추천 매트릭스

용도권장 용량이유
코딩 보조, 일상 채팅 (8~32B)64GB면 충분, 128GB는 과분32B Q4가 19GB라 64GB에서도 여유
70B급 상시 에이전트 + RAG128GB모델 43GB + 임베딩 + 긴 컨텍스트가 딱 맞음
레포 통째 분석, 100K 이상 장문128GB 최소, 192GB 권장KV 캐시가 수십 GB를 먹으므로
235B MoE 고품질(Q4) 상시 구동192GB128GB는 저양자화로 품질 타협 필요
405B급 맛보기, 멀티 모델 동시 구동192GB 이상Q2 양자화라도 178GB라 192GB가 마지노선
파인튜닝까지 직접 학습별도 CUDA GPU 필수통합 메모리는 추론용, 학습은 대역폭이 부족

7. 전기세와 소음이라는 숨은 비용

24시간 상시 가동이라면 전기세가 매달 나간다. Strix Halo 미니PC는 부하 시 130~150W, Mac Studio는 100W 안팎, DGX Spark는 240W(실사용 100W 안팎)다. 데스크톱 RTX 4090 시스템(600W 이상)과 비교하면 월 전기세가 3분의 1 이하로 떨어진다. 소음도 미니PC와 Mac은 도서관 수준이라 방 안에 두고 잘 수 있지만, DGX급도 팬 소음이 크지 않아 거실 배치가 가능하다. 침실 서버를 노린다면 저전력이 곧 정답이다.

8. 구입 전 필수 경고 3가지

첫째, 용량이 크다고 빨라지는 것이 아니다. 위 4절의 공식이 전부다. 192GB 스티커에 현혹되지 말고 대역폭 숫자를 확인하라.

둘째, 메모리는 나중에 추가할 수 없다. Strix Halo 미니PC와 Mac은 LPDDR5X 온보드라 구매 시점이 마지막 기회다. 나중에 후회해도 늦으므로 첫 예산 때 용도를 확정하라. 특히 Framework 192GB 구성을 기다리느라 반년을 허비할 것인지, 지금 128GB로 시작할 것인지 결정해야 한다.

셋째, 중고와 품귀 프리미엄을 경계하라. DRAM 파동기에는 품절 박스에 웃돈이 붙는다. 정가의 1.5배를 넘기면 차라리 한 체급 아래(64GB) 박스 + API 조합이 싸다. 급하지 않다면 DRAM 가격 안정기까지 기다리는 것도 전략이다.

9. 최종 선택 가이드

대부분의 사람은 128GB를 사라. 70B급 주력 모델이 40GB대에 여유롭게 돌고, 예산도 절반 수준으로 묶인다. 192GB 추가 비용(약 $1,500 이상)은 돌리고 싶은 모델의 이름(Qwen 2.5 72B Q8, DeepSeek-V4 Flash 등)과 그로 얻는 이익(긴 컨텍스트, 동시 서비스)을 명확히 말할 수 있을 때만 정당화된다.

현재 구체적인 용도(프로그래밍, 데이터 분석, 글쓰기)와 돌리고 싶은 모델, 예산 기준을 정해두면 머신 선택이 10분 안에 끝난다.

👁 조회 2 · 💬 댓글 0개 · 작성자 유형: human | 빌드: 2026-09-23T21:20:42+09:00