내 맥북·PC에서 이 LLM이 돌아갈까요?
모델의 GGUF 파일 크기와 기기의 메모리를 비교해 로컬 실행 가능 여부를 확인하고, 되는 최소 구성의 실제 가격까지 이어서 봅니다.
맥은 통합 메모리라 GPU가 RAM을 같이 씁니다. GPU가 쓸 수 있는 상한을 RAM의 약 75%로 잡고, 컨텍스트·실행 오버헤드 2GB를 더해 비교합니다. PC는 VRAM에서 표시 출력용 약 1GB를 제하고 비교합니다.
Llama 3.3 70B Instruct · Q4_K_M (4비트 · 표준)
70B급은 48GB 이상 맥이나 복수 GPU급이 필요합니다.
모델별 필요 메모리 (Q4_K_M 기준)
| 모델 | 파라미터 | 파일 크기(약) | 실행 권장 메모리 | 내 기기로 확인 |
|---|---|---|---|---|
| Gemma 3 4B | 4B | 2.5GB | 7GB RAM+ | 비교하기 |
| DeepSeek-R1-Distill-Qwen-7B | 7B | 4.7GB | 11GB RAM+ | 비교하기 |
| EXAONE 3.5 7.8B | 7.8B | 4.8GB | 11GB RAM+ | 비교하기 |
| Llama 3.1 8B Instruct | 8B | 4.9GB | 11GB RAM+ | 비교하기 |
| Qwen3 8B | 8B | 5GB | 11GB RAM+ | 비교하기 |
| Gemma 3 12B | 12B | 8.1GB | 16GB RAM+ | 비교하기 |
| Qwen3 14B | 14B | 9GB | 17GB RAM+ | 비교하기 |
| DeepSeek-R1-Distill-Qwen-14B | 14B | 9GB | 17GB RAM+ | 비교하기 |
| Mistral Small 3.x 24B | 24B | 14.3GB | 25GB RAM+ | 비교하기 |
| Gemma 3 27B | 27B | 17.3GB | 30GB RAM+ | 비교하기 |
| Qwen3 30B-A3B (MoE) | 30B-A3B | 18.6GB | 32GB RAM+ | 비교하기 |
| Qwen3 32B | 32B | 19.8GB | 34GB RAM+ | 비교하기 |
| DeepSeek-R1-Distill-Qwen-32B | 32B | 19.8GB | 34GB RAM+ | 비교하기 |
| EXAONE 3.5 32B | 32B | 19.9GB | 34GB RAM+ | 비교하기 |
| Llama 3.3 70B Instruct | 70B | 42.5GB | 68GB RAM+ | 비교하기 |
| DeepSeek-R1-Distill-Llama-70B | 70B | 42.5GB | 68GB RAM+ | 비교하기 |
왜 RAM이 곧 성능인가
- Apple Silicon은 CPU와 GPU가 같은 메모리를 씁니다. 모델 파일+KV 캐시가 통합 메모리 안에 들어가야 하고, macOS가 GPU에 내주는 상한은 RAM의 약 70~75% 수준으로 알려져 있습니다.
- PC는 모델이 VRAM에 온전히 올라가야 빠릅니다. 넘치면 시스템 RAM으로 일부를 올리는 오프로드가 되고 토큰 속도가 크게 떨어집니다.
- 양자화는 정밀도를 낮춰 용량을 줄입니다. Q4_K_M이 품질 대비 표준이고, Q8은 약 1.7배, FP16은 3배 이상의 메모리를 먹습니다.
- 긴 대화·긴 문서를 넣으면 KV 캐시가 커져 필요 메모리가 늘어납니다. 컨텍스트를 길게 쓸수록 여유분이 더 필요합니다.
- 이 계산은 실행 가능 여부의 기준선이지 속도 보장이 아닙니다. 실제 토큰 속도는 칩의 메모리 대역폭과 백엔드(llama.cpp·Ollama·LM Studio)에 따라 달라집니다.
자주 묻는 질문
맥북 16GB로 로컬 LLM이 돌아가나요?
8B급 Q4_K_M 모델(파일 약 5GB + 오버헤드)까지가 현실적인 범위입니다. 14B급은 빠듯하고 27B 이상은 16GB에서 어렵습니다.
로컬 LLM에 얼마나 큰 메모리가 필요한가요?
모델 파일 크기에 컨텍스트·실행 오버헤드를 더한 값이 필요합니다. Apple Silicon은 GPU가 쓸 수 있는 상한이 RAM의 약 75% 수준이므로, 필요량이 RAM의 2/3를 넘지 않는 구성이 쾌적합니다.
이 숫자의 근거
모델 파일 크기는 Hugging Face의 bartowski·공식 GGUF 배포본과 Ollama 라이브러리에 공개된 Q4_K_M 파일 크기를 기준으로 한 근사치입니다. 배포본·버전·임베딩 구성에 따라 수 GB 단위로 다를 수 있으므로, 실제 설치 전 사용할 런타임의 다운로드 크기를 다시 확인하세요. 통합 메모리 상한은 macOS의 GPU wired limit 관행치(약 75%)를 적용했습니다.