LM 스튜디오 + Llama 설치 완벽 가이드 — 초보자를 위한 로컬 AI 첫걸음

로컬 AI의 첫걸음. LM 스튜디오 설치부터 Llama/Qwen 모델 다운로드, 첫 대화까지 3분 컷. 인터넷 없이 내 컴퓨터에서 AI를 돌리는법을零부터 설명한다.
마크다운 원문·이 글에 보충할 내용이 있나요?

LM 스튜디오 + Llama 설치 완벽 가이드 — 초보자를 위한 로컬 AI 첫걸음

> "요즘 하도 로컬 AI(내 컴퓨터에서 직접 돌리는 AI)가 대세라고 하길래, 핫하다는 Qwen이나 Llama 모델을 써보려고 했다. 결론부터 말하면, 모델은 그 자체로 실행할 수 없는 '뇌(데이터)'일 뿐이다. 이 뇌를 장착하여 구동하는 프로그램이 바로 LM 스튜디오다."

밤새 삽질하고 시간 버리는 분들이 없도록, 설치부터 첫 대화까지 세세하게 알려주겠다.


0. 로컬 AI의 기본 공식 (먼저 이해하기)


로컬 AI = 몸통(실행 프로그램) + 뇌(AI 모델 파일)
구성요소역할비유
LM 스튜디오 (몸통)AI 모델을 읽고 실행하는 프로그램자동차 차체
Llama / Qwen (뇌)AI의 지식 데이터 파일엔진

> 엔진(모델)만 가지고는 차가 안 움직인다. 차체(LM 스튜디오)에 엔진을 물려야 달린다.


1단계: 몸통 설치하기 (LM Studio 다운로드)

1-1. 공식 사이트 접속

브라우저를 열고 다음 주소를 입력한다:


https://lmstudio.ai

> 참고: "LM Studio"로 검색하면 여러 사이트가 나오는데, 반드시 lmstudio.ai가 맞는지 확인한다.

1-2. 운영체제에 맞는 설치 파일 다운로드

사이트에 접속하면 화면 중앙에 큰 다운로드 버튼이 보인다.

운영체제파일 형식클릭할 버튼
Windows (10/11).exe"Download for Windows"
macOS (Intel/Apple Silicon).dmg"Download for macOS"
Linux (Ubuntu 등).AppImage"Download for Linux"

Windows 사용자 참고:

  • 파일명 보통: LM-Studio-0.x.x.exe 정도
  • 파일 크기: 약 400~600MB (프로그램 자체가 꽤 큼)
  • 다운로드 시간: 인터넷 속도에 따라 1~5분

1-3. 설치 진행

Windows:

  1. 다운로드된 .exe 파일을 더블클릭한다
  2. "이 앱이 디바이스의 변경 사항을 허용하시겠습니까?" → [예] 클릭
  3. 설치 마법사가 뜨면 기본 설정(폴더 선택 등) 그대로 [Next][Install]
  4. 1~2분 정도 설치 진행 → [Finish] 클릭

macOS:

  1. 다운로드된 .dmg 파일을 더블클릭한다
  2. LM Studio 아이콘이 설치 마법사로 드래그 → Applications 폴더에 복사
  3. Applications에서 LM Studio 실행
  4. "이 앱은 인증되지 않은 개발자가 배포했습니다" 경고가 뜰 수 있음 → [설정] > [보안 및 개인 정보 보호]에서 [무시하고 열기] 클릭

Linux:


chmod +x LM-Studio-*.AppImage
./LM-Studio-*.AppImage

1-4. 첫 실행 온보딩

LM Studio를 처음 실행하면 초기 설정 화면이 나온다:

  1. 테마 선택: 다크(Dark) / 라이트(Light) — 다크 추천
  2. 사용 목적 선택: "I want to run models locally" 선택
  3. 모델 저장 경로 선택: 기본값 그대로 추천 (드라이브 여유 있는 곳)
  4. 완료: [Get Started] 클릭

> 모델 파일은 상당히 크다 (3~8GB). C드라이브 용량이 부족하면 D드라이브를 추천.


2단계: 알맹이 채우기 (Llama / Qwen 모델 다운로드)

2-1. 검색창으로 모델 찾기

LM 스튜디오 왼쪽 메뉴 바에서 돋보기 모양 아이콘(🔍 Search)을 클릭한다.

상단 검색창에 다음 중 하나를 입력한다:

원하는 AI입력할 검색어
Meta의 Llamallama 또는 llama 3
Alibaba의 Qwenqwen 또는 qwen 3
Google의 Gemmagemma
Microsoft의 Phiphi

2-2. 검색 결과 이해하기

검색 결과가 나타나면 여러 모델이 보인다. 여기서 중요한 것은 파일명의 약어를 아는 것이다.

파일명 읽는 법:


Qwen3-8B-Q4_K_M.gguf
  │    │  │    │      │
  │    │  │    │      └── 파일 형식 (GGUF = 로컬 AI 표준)
  │    │  │    └── 양자화 방법 (Q4_K_M = 가장 무난)
  │    │  └── 파라미터 수 (8B = 80억 개)
  │    └── 모델명
  └── 제조사명

초보자용 양자화(Quantization) 선택표:

약어의미파일 크기 (8B 기준)추천 대상
Q4_K_M4비트, 중간 품질~4.9GB대부분의 사용자 (추천)
Q5_K_M5비트, 약간 더 좋은 품질~5.7GBVRAM 12GB 이상
Q6_K6비트, 높은 품질~6.6GBVRAM 16GB 이상
Q8_08비트, 거의 무손실~8.5GBVRAM 24GB 이상
Q3_K_M3비트, 빠르지만 품질↓~3.5GBVRAM 8GB (한계 상황)

> 모르겠으면 Q4_K_M을 골라라. 파일명에 Q4_K_M이 들어간 것을 클릭한다.

2-3. 내 컴퓨터 사양 확인하고 모델 고르기

그래픽카드 메모리(VRAM) 확인 방법:

Windows:

  1. 바탕화면 빈 곳에 마우스 우클릭 → [ NVIDIA 제어판 ] (NVIDIA 그래픽카드인 경우)
  2. 왼쪽 메뉴 [ 시스템 정보 ] 클릭
  3. "비디오 메모리: XXXX MB" 확인

또는:

  1. Ctrl + Shift + Esc → 작업 관리자 열기
  2. 상단 [성능] 탭 → [GPU 0]
  3. 오른쪽 "전용 GPU 메모리" 확인

VRAM별 추천 모델:

VRAM추천 모델추천 양자화
8GBLlama 3.1 8B 또는 Qwen3 8BQ4_K_M (~4.9GB)
12GBQwen 2.5 14B 또는 Gemma 4 12BQ4_K_M (~9GB)
16GBQwen3 14B 또는 Llama 3.1 8BQ6_K 또는 Q8_0
24GBQwen3 32B 또는 Gemma 4 31BQ4_K_M (~19GB)

> 8GB VRAM이면 Llama 3.1 8B Q4_K_M이 정답. 파일 크기 ~4.9GB로 안정적으로 돌아간다.

2-4. 모델 다운로드

  1. 원하는 모델 항목 클릭
  2. 오른쪽에 파란색 [Download] 버튼 클릭
  3. 다운로드 진행 상황이 상단에 표시됨
  4. 완료되면 [Downloaded] 또는 체크 표시로 변경

다운로드 시간 참고:

  • 인터넷 100Mbps 기준: 8B Q4 (~5GB) → 약 7분
  • 인터넷 500Mbps 기준: 8B Q4 (~5GB) → 약 1~2분

3단계: 채팅 시작하기 (AI 구동)

3-1. 채팅 창으로 이동

왼쪽 메뉴 바에서 말풍선 모양 아이콘(Chat)을 클릭한다.

3-2. 모델 로드 (가장 중요!)

화면 맨 위를 보면 [Select a model to load]라는 드롭다운 메뉴가 있다.

  1. 드롭다운 클릭
  2. 방금 다운로드한 모델 선택 (예: Qwen3-8B-Q4_K_M.gguf)
  3. 모델이 로드되기 시작한다 (하단에 진행 바 표시)
  4. 로드 완료되면 "Model loaded" 또는 "Ready" 표시

> 첫 로드 시 RAM/VRAM에서 데이터를 읽어오므로 10~30초 정도 걸린다. 두 번째부터는 훨씬 빠르다.

3-3. 첫 대화

하단 채팅창에 아무 말이나 입력한다:


안녕! 너는 누구야?

또는


Python으로 fibonacci 함수를 짜줘

인라인 응답 옵션 (선택사항):

채팅창 옆에 설정 항목들이 있다:

설정의미추천
Temperature답변의 창의성 (0=정확, 1=창의적)0.7
Max Tokens최대 출력 길이2048
Context Length한 번에 기억하는 토큰 수4096 (기본)

> 초보자는 Temperature 0.7, Context 4096으로 두면 된다.

3-4. 오프라인에서도 작동한다

모델이 한 번 로드되면 인터넷이 끊겨도 완벽하게 작동한다. 모든 연산이 내 컴퓨터에서 일어나기 때문이다.


인터넷 연결:    외부 서버로 데이터 전송 → API 비용 발생
로컬 AI:       내 컴퓨터에서만 처리 → 비용 0원, 개인정보 안전

보충: 자주 하는 실수와 해결법

실수 1: "모델 파일을 더블클릭했다"

모델 파일(.gguf)은 더블클릭해도 아무 일도 안 일어난다. 반드시 LM 스튜디오 안에서 다운로드하고 실행해야 한다.

실수 2: "VRAM보다 큰 모델을 골랐다"

8GB VRAM에 14B 모델(Q4로 약 9GB)을 올리면:

  • 증상: 매우 느리거나 아예 안 돌아감
  • 해결: VRAM에 맞는 작은 모델로 교체. 또는 CPU 오프로딩 기능 사용 (LM 스튜디오 설정에서 활성화 가능하나 속도 느려짐)

실수 3: "ollama와 LM 스튜디오를 동시에 쓴다"

둘 다 같은 GPU를 사용하므로 충돌할 수 있다. 하나만 켜고 쓰는 것이 좋다.

실수 4: "영어로만 대화한다"

Llama나 Qwen 모두 한국어를 지원한다. 한국어로 질문해도 한국어로 답변한다.


요약: 3단계 정리


1단계: lmstudio.ai 접속 → 설치 파일 다운로드 → 설치
2단계: LM 스튜디오 검색창 → 모델 검색 → Q4_K_M 선택 → 다운로드
3단계: 채팅 창 → 모델 로드 → 대화 시작

> "몸통(LM 스튜디오)을 깔고, 그 안에서 알맹이(Llama)를 받는다." > 이 두 가지면 끝이다. 인터넷도, API 키도, 비용도 필요 없다.


참고: 더 나아가고 싶다면

단계도구설명
CLI 사용Ollama터미널에서 ollama run llama3로 바로 실행
API 서버LM Studio 서버 모드localhost:1234로 API 제공, 다른 프로그램에서 호출 가능
고급 설정llama.cpp소스에서 직접 컴파일, 옵션 자유도 최대
이미지 생성Stable Diffusion WebUI로컬 AI의 또 다른 세계

관련 글:

👁 조회 1 · 💬 댓글 0개 · 작성자 유형: human | 빌드: 2026-09-23T16:49:20+09:00