--- title: 128GB면 충분한가 192GB가 필요한가 로컬 AI 통합 메모리 용량별 경계선 date: 2026-09-23 time: 23:59 model: admin category: knowhow summary: 70B는 128GB에서 여유롭고 150GB급 몬스터는 192GB가 필요하며 용량이 속도를 보장하지 않는 이유까지 통합 메모리 선택의 경계선을 정리 tags: 통합메모리, 128GB, 192GB, Strix-Halo, Mac-Studio, DGX-Spark, 로컬LLM, VRAM, KV캐시, 대역폭 --- 결론부터 말하면, 대부분의 사람에게는 128GB로 충분하고, 192GB는 돌리고 싶은 초대형 모델의 이름과 이유를 명확히 말할 수 있는 사람만의 선택이다. 그리고 용량이 크다고 빨라지는 것이 아니다. 아래 경계선을 보고 지갑을 열라. ## 1. 128GB vs 192GB: 무엇을 할 수 있는가 | 항목 | 128GB 환경 | 192GB 환경 | |---|---|---| | 주요 대상 모델 | Llama 3.1 70B Q4, Qwen 2.5 72B Q4 (40~45GB) | Qwen 2.5 72B Q8 (약 77~133GB), DeepSeek-V4 Flash Q4 (약 99~155GB) | | 초대형 모델 | 235B MoE는 저양자화(Q3 이하)로 빠듯하게 가능 | 235B Q4 여유, Llama 405B Q2 (약 177GB)까지 가능 | | 여유도 | 대형 모델 로드시 컨텍스트(대화 이력)에 제한이 생김 | 대형 모델 + 긴 대화 + 백그라운드 AI 서비스 동시 가능 | | 대표 머신 | Strix Halo 미니PC, DGX Spark | Mac Studio M2 Ultra 192GB, Framework 192GB 구성(출시 예고) | | 추천 대상 | 가성비 중시, 첫 본격 로컬 AI 구축자 | 타협 없이 150GB급 모델을 그대로 돌리고 싶은 사람 | 수치로 증명하면, 70B Q4는 40~45GB라서 128GB에서 시스템 여유를 빼고도 컨텍스트가 넉넉히 남는다. 코딩 보조나 일상 텍스트 생성이라면 128GB에서 충분히 빠르고 실용적이다. 반면 Qwen 2.5 72B를 Q8(압축률 낮은 고품질)로 돌리거나 DeepSeek-V4 Flash 284B급을 올리려면 128GB의 벽을 넘으므로 192GB가 필요하다. ## 2. 양자화별 실제 메모리 점유표: 내 모델은 몇 GB인가 모델이 메모리에 올라갈 때 차지하는 크기는 파라미터 수에 양자화 비트를 곱한 값이다. 아래 표가 모든 판단의 출발점이다. | 모델 | BF16/FP16 | Q8_0 | Q4_K_M | Q3 이하 | |---|---|---|---|---| | 7~8B (Llama 3.1 8B 등) | 약 16GB | 약 8.5GB | 약 5GB | 약 3.5GB | | 14B (Phi-4, Qwen 14B) | 약 28GB | 약 15GB | 약 9GB | 약 6GB | | 27~32B (Qwen 27B, QWQ 32B) | 약 60GB | 약 33GB | 약 19GB | 약 13GB | | 70~72B (Llama 70B, Qwen 72B) | 약 145~160GB | 약 77GB | 약 43GB | 약 30GB | | 120B MoE (GPT-OSS 120B) | 약 240GB | 약 130GB | 약 70GB | 약 50GB | | 235B MoE (Qwen3 235B) | 약 470GB | 약 260GB | 약 142GB | 약 100GB | | 284B MoE (DeepSeek V4 Flash) | 약 560GB | 약 300GB | 약 155GB | 약 110GB | | 405B (Llama 3.1 405B) | 약 810GB | 약 430GB | 약 240GB | 약 178GB (Q2) | 여기에 시스템 예약분(약 8GB)과 KV 캐시(긴 대화 시 수 GB~수십 GB)를 더해야 실가용량이 나온다. 128GB 머신의 실가용이 약 120GB라면 70B Q4(43GB)는 여유롭지만 235B Q4(142GB)는 물리적으로 못 올라간다. 192GB 머신의 실가용 약 184GB라면 235B Q4도 남고 405B Q2(178GB)까지 턱걸이로 들어간다. 이것이 두 용량의 물리적 경계선이다. ## 3. KV 캐시: 모델보다 대화를 길게 하면 터지는 진짜 범인 모델 가중치는 고정비지만 KV 캐시는 대화가 길어질수록 늘어나는 변동비다. 70B 모델에 100K 토큰 대화를 쌓으면 KV 캐시만 수십 GB가 추가된다. 128GB에서 70B Q4를 돌리면서 장문 레포 분석을 하면 모델(43GB) + KV 캐시(30GB 이상) + 시스템으로 100GB를 넘기기 쉽고, 이때부터 컨텍스트 제한이 걸린다. 192GB라면 같은 조건에서도 80GB 이상이 남아 백그라운드 번역 에이전트나 임베딩 서버를 같이 돌릴 수 있다. 장문 작업이 주업이면 용량 선택의 무게가 달라진다. ## 4. 속도의 진실: 토큰 속도는 대역폭으로 계산된다 로컬 추론 속도의 공식은 단순하다. 초당 토큰 수/TPS는 메모리 대역폭을 모델 크기로 나눈 값에 비례한다. | 머신 | 대역폭 | 70B Q4 예상 속도 | 235B Q4 예상 속도 | |---|---|---|---| | Strix Halo 128GB (256GB/s) | 256GB/s | 약 8~12 tok/s | 약 3~5 tok/s (저양자화 기준) | | DGX Spark (273GB/s) | 273GB/s | 약 10~13 tok/s | 약 4~6 tok/s | | Mac Studio M2 Ultra (800GB/s) | 800GB/s | 약 25~35 tok/s | 약 13~20 tok/s | 실측도 이를 뒷받침한다. GMKtec EVO-X2 128GB에서 Qwen3 235B가 11 tok/s, Mac Studio M2 Ultra 192GB에서 DeepSeek V4 Flash 284B가 52 tok/s로 보고되었다. 같은 모델이라도 대역폭 3배 차이가 속도 3배 차이로 그대로 드러난다. 그래서 예고된 192GB급 Strix Halo 신형의 함정이 있다. 용량은 50% 늘지만 대역폭은 7% 향상에 그친다. 192GB라는 숫자만 보고 샀다가 속도는 그대로인 것을 보고 실망하는 사람이 속출할 것이다. 속도를 원하면 용량이 아니라 대역폭 숫자를 보라. ## 5. 대표 머신과 실제 가격 (2026년 하반기 기준) DRAM 부족 사태로 2025년 말 대비 가격이 약 2배 가까이 뛰었다는 점을 먼저 알린다. 아래는 실구매가 기준이다. | 머신 | 메모리 | 대역폭 | 가격대 | 비고 | |---|---|---|---|---| | GMKtec EVO-X2 | 128GB LPDDR5X | 256GB/s | 정가 약 $2,000이나 품귀, 실거래 약 $3,400 | Qwen3 235B 11 tok/s 표방 | | Framework Desktop | 128GB | 256GB/s | 약 $3,449, 품절 잦음 | 192GB 구성 출시 예고, 분해 수리 용이 | | Minisforum MS-S1 Max | 128GB | 256GB/s | 약 $3,639, 재고 있음 | 듀얼 10GbE, 확장 슬롯, 리뷰 최고 평점 | | NVIDIA DGX Spark | 128GB | 273GB/s | $3,999에서 $4,699로 인상 | CUDA 생태계, NVFP4 지원, 2대 연결시 256GB | | Mac Studio M2 Ultra | 192GB | 800GB/s | 단종 전 가격대 고가, 중고 시장 | 속도는 독보적 1위, 조용함 | Strix Halo 진영은 칩이 동일하므로 Qwen3.8 27B 기준 10 tok/s 내외로 속도가 대동소이하다. 고르는 기준은 가격이 아니라 재고와 포트, AS다. 살 수 있는 박스가 정답이다. DGX Spark는 2대를 ConnectX 케이블로 엮으면 256GB 단일 풀처럼 쓸 수 있어 405B급까지 노릴 수 있는 확장 카드가 있다. 192GB의 현행 실구매 선택지는 사실상 Mac Studio M2 Ultra 192GB가 유일하다. 800GB/s 대역폭 덕분에 DeepSeek V4 Flash 284B를 52 tok/s로 돌린다는 실측이 있으며, Qwen3 235B Q4도 13~20 tok/s로 여유롭게 처리한다. ## 6. 용도별 추천 매트릭스 | 용도 | 권장 용량 | 이유 | |---|---|---| | 코딩 보조, 일상 채팅 (8~32B) | 64GB면 충분, 128GB는 과분 | 32B Q4가 19GB라 64GB에서도 여유 | | 70B급 상시 에이전트 + RAG | 128GB | 모델 43GB + 임베딩 + 긴 컨텍스트가 딱 맞음 | | 레포 통째 분석, 100K 이상 장문 | 128GB 최소, 192GB 권장 | KV 캐시가 수십 GB를 먹으므로 | | 235B MoE 고품질(Q4) 상시 구동 | 192GB | 128GB는 저양자화로 품질 타협 필요 | | 405B급 맛보기, 멀티 모델 동시 구동 | 192GB 이상 | Q2 양자화라도 178GB라 192GB가 마지노선 | | 파인튜닝까지 직접 학습 | 별도 CUDA GPU 필수 | 통합 메모리는 추론용, 학습은 대역폭이 부족 | ## 7. 전기세와 소음이라는 숨은 비용 24시간 상시 가동이라면 전기세가 매달 나간다. Strix Halo 미니PC는 부하 시 130~150W, Mac Studio는 100W 안팎, DGX Spark는 240W(실사용 100W 안팎)다. 데스크톱 RTX 4090 시스템(600W 이상)과 비교하면 월 전기세가 3분의 1 이하로 떨어진다. 소음도 미니PC와 Mac은 도서관 수준이라 방 안에 두고 잘 수 있지만, DGX급도 팬 소음이 크지 않아 거실 배치가 가능하다. 침실 서버를 노린다면 저전력이 곧 정답이다. ## 8. 구입 전 필수 경고 3가지 첫째, 용량이 크다고 빨라지는 것이 아니다. 위 4절의 공식이 전부다. 192GB 스티커에 현혹되지 말고 대역폭 숫자를 확인하라. 둘째, 메모리는 나중에 추가할 수 없다. Strix Halo 미니PC와 Mac은 LPDDR5X 온보드라 구매 시점이 마지막 기회다. 나중에 후회해도 늦으므로 첫 예산 때 용도를 확정하라. 특히 Framework 192GB 구성을 기다리느라 반년을 허비할 것인지, 지금 128GB로 시작할 것인지 결정해야 한다. 셋째, 중고와 품귀 프리미엄을 경계하라. DRAM 파동기에는 품절 박스에 웃돈이 붙는다. 정가의 1.5배를 넘기면 차라리 한 체급 아래(64GB) 박스 + API 조합이 싸다. 급하지 않다면 DRAM 가격 안정기까지 기다리는 것도 전략이다. ## 9. 최종 선택 가이드 대부분의 사람은 128GB를 사라. 70B급 주력 모델이 40GB대에 여유롭게 돌고, 예산도 절반 수준으로 묶인다. 192GB 추가 비용(약 $1,500 이상)은 돌리고 싶은 모델의 이름(Qwen 2.5 72B Q8, DeepSeek-V4 Flash 등)과 그로 얻는 이익(긴 컨텍스트, 동시 서비스)을 명확히 말할 수 있을 때만 정당화된다. 현재 구체적인 용도(프로그래밍, 데이터 분석, 글쓰기)와 돌리고 싶은 모델, 예산 기준을 정해두면 머신 선택이 10분 안에 끝난다.