모델별 GGUF 크기와 필요 VRAM 근사
한 줄 요약: 표의 파일/필요는 GGUF GB와 그에 ×1.25를 적용한 짧은 컨텍스트 필요 VRAM(GB)입니다.
gguf_gb는 GGUF 파일 크기(GB). '~' 없이 소수 1자리로 적되, 저장소에서 직접 확인하지 못한 값은 approx=true. 필요 VRAM은 파일 크기에 KV 캐시·버퍼 오버헤드를 더해 산정한다(formula_constants.json 참조).
| 모델 | 파라미터 (B) | Q4_K_M 파일/필요 (GB) | Q5_K_M 파일/필요 (GB) | Q8_0 파일/필요 (GB) | KV KiB/토큰 | 근사치? |
|---|---|---|---|---|---|---|
| Qwen3 4B | 4.0 | 2.5 / 3.1 | 2.9 / 3.6 | 4.3 / 5.4 | 144 | 예 |
| Llama 3.1 8B | 8.0 | 4.9 / 6.1 | 5.7 / 7.1 | 8.5 / 10.6 | 128 | 예 |
| Qwen3 8B | 8.2 | 5 / 6.2 | 5.9 / 7.4 | 8.7 / 10.9 | 144 | 예 |
| Gemma 3 12B | 12.0 | 7.3 / 9.1 | 8.4 / 10.5 | 12.5 / 15.6 | 120 | 예 |
| Qwen3 14B | 14.8 | 9 / 11.2 | 10.5 / 13.1 | 15.7 / 19.6 | 160 | 아니오 |
| Mistral Small 3.2 24B | 24.0 | 14.3 / 17.9 | 16.8 / 21.0 | 25.1 / 31.4 | 160 | 예 |
| Gemma 3 27B | 27.0 | 16.5 / 20.6 | 19.3 / 24.1 | 28.7 / 35.9 | 160 | 예 |
| Qwen3 30B-A3B (MoE) | 30.5 | 18.6 / 23.2 | 21.7 / 27.1 | 32.5 / 40.6 | 192 | 예 |
| EXAONE 4.0 32B | 32.0 | 19.3 / 24.1 | 22.7 / 28.4 | 34 / 42.5 | 160 | 아니오 |
| Qwen3 32B | 32.8 | 19.8 / 24.8 | 23.2 / 29.0 | 34.8 / 43.5 | 256 | 예 |
| Llama 3.3 70B | 70.6 | 42.5 / 53.1 | 50 / 62.5 | 75 / 93.8 | 320 | 예 |
예시: 필요 VRAM ≈ 파일GB × 1.25 + (KV_KiB_per_token × context_tokens) / 1024 / 1024.
출처
- Hugging Face GGUF 저장소 파일 크기 표기 (bartowski/Qwen_Qwen3-14B-GGUF: Q4_K_M 9.00GB·Q5_K_M 10.51GB·Q8_0 15.70GB 확인)
- LGAI-EXAONE/EXAONE-4.0-32B-GGUF (Q4_K_M 19.3GB 공식 표기 확인)
- 각 모델 공식 저장소의 파라미터 수 표기
자주 묻는 질문
- 필요 VRAM 공식은?
- 기본 근사: GGUF 파일 크기(GB) × 1.25. 긴 컨텍스트는 KV 캐시(토큰당 KiB × 길이)를 추가로 더합니다.
- 왜 파일 크기보다 크나요?
- 가중치 외에 KV 캐시, 스크래치 버퍼, 프레임워크 오버헤드가 붙기 때문입니다.
- approx=예 는 무엇인가요?
- 해당 GGUF 크기를 저장소에서 직접 확인하지 못했거나 반올림 추정치인 경우입니다.
- Q4와 Q8 차이는?
- 비트 정밀도가 높아질수록 파일과 필요 VRAM이 커지고, 일반적으로 품질 여유가 생깁니다.
- 컨텍스트 8K면 얼마나 더 쓰나요?
- 대략 (kv_per_token_kib × 8192) / 1024 / 1024 GB를 더합니다.