--- title: "LM 스튜디오 + Llama 설치 완벽 가이드 — 초보자를 위한 로컬 AI 첫걸음" date: 2026-09-23 time: "15:00" model: "operator" category: knowhow summary: "로컬 AI의 첫걸음. LM 스튜디오 설치부터 Llama/Qwen 모델 다운로드, 첫 대화까지 3분 컷. 인터넷 없이 내 컴퓨터에서 AI를 돌리는법을零부터 설명한다." tags: "LMStudio, Llama, Qwen, 로컬AI, 설치가이드, 초보자" --- # LM 스튜디오 + Llama 설치 완벽 가이드 — 초보자를 위한 로컬 AI 첫걸음 > "요즘 하도 로컬 AI(내 컴퓨터에서 직접 돌리는 AI)가 대세라고 하길래, 핫하다는 Qwen이나 Llama 모델을 써보려고 했다. 결론부터 말하면, 모델은 그 자체로 실행할 수 없는 '뇌(데이터)'일 뿐이다. 이 뇌를 장착하여 구동하는 프로그램이 바로 LM 스튜디오다." 밤새 삽질하고 시간 버리는 분들이 없도록, **설치부터 첫 대화까지** 세세하게 알려주겠다. --- ## 0. 로컬 AI의 기본 공식 (먼저 이해하기) ``` 로컬 AI = 몸통(실행 프로그램) + 뇌(AI 모델 파일) ``` | 구성요소 | 역할 | 비유 | |----------|------|------| | **LM 스튜디오** (몸통) | AI 모델을 읽고 실행하는 프로그램 | 자동차 차체 | | **Llama / Qwen** (뇌) | AI의 지식 데이터 파일 | 엔진 | > 엔진(모델)만 가지고는 차가 안 움직인다. 차체(LM 스튜디오)에 엔진을 물려야 달린다. --- ## 1단계: 몸통 설치하기 (LM Studio 다운로드) ### 1-1. 공식 사이트 접속 브라우저를 열고 다음 주소를 입력한다: ``` https://lmstudio.ai ``` > 참고: "LM Studio"로 검색하면 여러 사이트가 나오는데, 반드시 **lmstudio.ai**가 맞는지 확인한다. ### 1-2. 운영체제에 맞는 설치 파일 다운로드 사이트에 접속하면 화면 중앙에 큰 다운로드 버튼이 보인다. | 운영체제 | 파일 형식 | 클릭할 버튼 | |----------|----------|------------| | **Windows** (10/11) | `.exe` | "Download for Windows" | | **macOS** (Intel/Apple Silicon) | `.dmg` | "Download for macOS" | | **Linux** (Ubuntu 등) | `.AppImage` | "Download for Linux" | **Windows 사용자 참고:** - 파일명 보통: `LM-Studio-0.x.x.exe` 정도 - 파일 크기: 약 400~600MB (프로그램 자체가 꽤 큼) - 다운로드 시간: 인터넷 속도에 따라 1~5분 ### 1-3. 설치 진행 **Windows:** 1. 다운로드된 `.exe` 파일을 더블클릭한다 2. "이 앱이 디바이스의 변경 사항을 허용하시겠습니까?" → **[예]** 클릭 3. 설치 마법사가 뜨면 기본 설정(폴더 선택 등) 그대로 **[Next]** → **[Install]** 4. 1~2분 정도 설치 진행 → **[Finish]** 클릭 **macOS:** 1. 다운로드된 `.dmg` 파일을 더블클릭한다 2. LM Studio 아이콘이 설치 마법사로 드래그 → Applications 폴더에 복사 3. Applications에서 LM Studio 실행 4. "이 앱은 인증되지 않은 개발자가 배포했습니다" 경고가 뜰 수 있음 → **[설정] > [보안 및 개인 정보 보호]에서 [무시하고 열기]** 클릭 **Linux:** ```bash chmod +x LM-Studio-*.AppImage ./LM-Studio-*.AppImage ``` ### 1-4. 첫 실행 온보딩 LM Studio를 처음 실행하면 초기 설정 화면이 나온다: 1. **테마 선택**: 다크(Dark) / 라이트(Light) — 다크 추천 2. **사용 목적 선택**: "I want to run models locally" 선택 3. **모델 저장 경로 선택**: 기본값 그대로 추천 (드라이브 여유 있는 곳) 4. **완료**: [Get Started] 클릭 > 모델 파일은 상당히 크다 (3~8GB). C드라이브 용량이 부족하면 D드라이브를 추천. --- ## 2단계: 알맹이 채우기 (Llama / Qwen 모델 다운로드) ### 2-1. 검색창으로 모델 찾기 LM 스튜디오 왼쪽 메뉴 바에서 **돋보기 모양 아이콘(🔍 Search)**을 클릭한다. 상단 검색창에 다음 중 하나를 입력한다: | 원하는 AI | 입력할 검색어 | |-----------|-------------| | Meta의 Llama | `llama` 또는 `llama 3` | | Alibaba의 Qwen | `qwen` 또는 `qwen 3` | | Google의 Gemma | `gemma` | | Microsoft의 Phi | `phi` | ### 2-2. 검색 결과 이해하기 검색 결과가 나타나면 여러 모델이 보인다. 여기서 중요한 것은 **파일명의 약어**를 아는 것이다. **파일명 읽는 법:** ``` Qwen3-8B-Q4_K_M.gguf │ │ │ │ │ │ │ │ │ └── 파일 형식 (GGUF = 로컬 AI 표준) │ │ │ └── 양자화 방법 (Q4_K_M = 가장 무난) │ │ └── 파라미터 수 (8B = 80억 개) │ └── 모델명 └── 제조사명 ``` **초보자용 양자화(Quantization) 선택표:** | 약어 | 의미 | 파일 크기 (8B 기준) | 추천 대상 | |------|------|-------------------|----------| | **Q4_K_M** | 4비트, 중간 품질 | ~4.9GB | **대부분의 사용자 (추천)** | | Q5_K_M | 5비트, 약간 더 좋은 품질 | ~5.7GB | VRAM 12GB 이상 | | Q6_K | 6비트, 높은 품질 | ~6.6GB | VRAM 16GB 이상 | | Q8_0 | 8비트, 거의 무손실 | ~8.5GB | VRAM 24GB 이상 | | Q3_K_M | 3비트, 빠르지만 품질↓ | ~3.5GB | VRAM 8GB (한계 상황) | > **모르겠으면 Q4_K_M을 골라라.** 파일명에 `Q4_K_M`이 들어간 것을 클릭한다. ### 2-3. 내 컴퓨터 사양 확인하고 모델 고르기 **그래픽카드 메모리(VRAM) 확인 방법:** **Windows:** 1. 바탕화면 빈 곳에 마우스 우클릭 → **[ NVIDIA 제어판 ]** (NVIDIA 그래픽카드인 경우) 2. 왼쪽 메뉴 **[ 시스템 정보 ]** 클릭 3. **"비디오 메모리: XXXX MB"** 확인 또는: 1. `Ctrl + Shift + Esc` → 작업 관리자 열기 2. 상단 **[성능]** 탭 → **[GPU 0]** 3. 오른쪽 **"전용 GPU 메모리"** 확인 **VRAM별 추천 모델:** | VRAM | 추천 모델 | 추천 양자화 | |------|----------|------------| | **8GB** | Llama 3.1 8B 또는 Qwen3 8B | Q4_K_M (~4.9GB) | | **12GB** | Qwen 2.5 14B 또는 Gemma 4 12B | Q4_K_M (~9GB) | | **16GB** | Qwen3 14B 또는 Llama 3.1 8B | Q6_K 또는 Q8_0 | | **24GB** | Qwen3 32B 또는 Gemma 4 31B | Q4_K_M (~19GB) | > **8GB VRAM이면 Llama 3.1 8B Q4_K_M이 정답.** 파일 크기 ~4.9GB로 안정적으로 돌아간다. ### 2-4. 모델 다운로드 1. 원하는 모델 항목 클릭 2. 오른쪽에 **파란색 [Download]** 버튼 클릭 3. 다운로드 진행 상황이 상단에 표시됨 4. 완료되면 **[Downloaded]** 또는 체크 표시로 변경 **다운로드 시간 참고:** - 인터넷 100Mbps 기준: 8B Q4 (~5GB) → 약 7분 - 인터넷 500Mbps 기준: 8B Q4 (~5GB) → 약 1~2분 --- ## 3단계: 채팅 시작하기 (AI 구동) ### 3-1. 채팅 창으로 이동 왼쪽 메뉴 바에서 **말풍선 모양 아이콘(Chat)**을 클릭한다. ### 3-2. 모델 로드 (가장 중요!) 화면 맨 위를 보면 **[Select a model to load]**라는 드롭다운 메뉴가 있다. 1. 드롭다운 클릭 2. 방금 다운로드한 모델 선택 (예: `Qwen3-8B-Q4_K_M.gguf`) 3. **모델이 로드되기 시작한다** (하단에 진행 바 표시) 4. 로드 완료되면 **"Model loaded"** 또는 **"Ready"** 표시 > 첫 로드 시 RAM/VRAM에서 데이터를 읽어오므로 **10~30초 정도 걸린다.** 두 번째부터는 훨씬 빠르다. ### 3-3. 첫 대화 하단 채팅창에 아무 말이나 입력한다: ``` 안녕! 너는 누구야? ``` 또는 ``` Python으로 fibonacci 함수를 짜줘 ``` **인라인 응답 옵션 (선택사항):** 채팅창 옆에 설정 항목들이 있다: | 설정 | 의미 | 추천 | |------|------|------| | **Temperature** | 답변의 창의성 (0=정확, 1=창의적) | 0.7 | | **Max Tokens** | 최대 출력 길이 | 2048 | | **Context Length** | 한 번에 기억하는 토큰 수 | 4096 (기본) | > 초보자는 **Temperature 0.7, Context 4096**으로 두면 된다. ### 3-4. 오프라인에서도 작동한다 모델이 한 번 로드되면 **인터넷이 끊겨도 완벽하게 작동한다.** 모든 연산이 내 컴퓨터에서 일어나기 때문이다. ``` 인터넷 연결: 외부 서버로 데이터 전송 → API 비용 발생 로컬 AI: 내 컴퓨터에서만 처리 → 비용 0원, 개인정보 안전 ``` --- ## 보충: 자주 하는 실수와 해결법 ### 실수 1: "모델 파일을 더블클릭했다" 모델 파일(.gguf)은 더블클릭해도 아무 일도 안 일어난다. 반드시 **LM 스튜디오 안에서** 다운로드하고 실행해야 한다. ### 실수 2: "VRAM보다 큰 모델을 골랐다" 8GB VRAM에 14B 모델(Q4로 약 9GB)을 올리면: - 증상: 매우 느리거나 아예 안 돌아감 - 해결: VRAM에 맞는 작은 모델로 교체. 또는 **CPU 오프로딩** 기능 사용 (LM 스튜디오 설정에서 활성화 가능하나 속도 느려짐) ### 실수 3: "ollama와 LM 스튜디오를 동시에 쓴다" 둘 다 같은 GPU를 사용하므로 충돌할 수 있다. 하나만 켜고 쓰는 것이 좋다. ### 실수 4: "영어로만 대화한다" Llama나 Qwen 모두 한국어를 지원한다. 한국어로 질문해도 한국어로 답변한다. --- ## 요약: 3단계 정리 ``` 1단계: lmstudio.ai 접속 → 설치 파일 다운로드 → 설치 2단계: LM 스튜디오 검색창 → 모델 검색 → Q4_K_M 선택 → 다운로드 3단계: 채팅 창 → 모델 로드 → 대화 시작 ``` > **"몸통(LM 스튜디오)을 깔고, 그 안에서 알맹이(Llama)를 받는다."** > 이 두 가지면 끝이다. 인터넷도, API 키도, 비용도 필요 없다. --- ## 참고: 더 나아가고 싶다면 | 단계 | 도구 | 설명 | |------|------|------| | CLI 사용 | Ollama | 터미널에서 `ollama run llama3`로 바로 실행 | | API 서버 | LM Studio 서버 모드 | `localhost:1234`로 API 제공, 다른 프로그램에서 호출 가능 | | 고급 설정 | llama.cpp | 소스에서 직접 컴파일, 옵션 자유도 최대 | | 이미지 생성 | Stable Diffusion WebUI | 로컬 AI의 또 다른 세계 | --- **관련 글:** - [로컬 AI 양자화 포맷 완전 정리](/knowhow/2026-09-23-local-llm-format-deep-dive/) - [GPU VRAM 할당 구조와 KV 캐시 바이블](/knowhow/2026-09-23-gpu-vram-kv-cache-bible/) - [그래픽카드별 로컬 AI 모델 추천 완전 가이드](/knowhow/2026-09-23-gpu-local-model-guide/)