>_ 브램체크

이 모델, 내 그래픽카드로 돌아갈까

모델별 GGUF 크기와 필요 VRAM 근사

한 줄 요약: 표의 파일/필요는 GGUF GB와 그에 ×1.25를 적용한 짧은 컨텍스트 필요 VRAM(GB)입니다.

gguf_gb는 GGUF 파일 크기(GB). '~' 없이 소수 1자리로 적되, 저장소에서 직접 확인하지 못한 값은 approx=true. 필요 VRAM은 파일 크기에 KV 캐시·버퍼 오버헤드를 더해 산정한다(formula_constants.json 참조).

모델 GGUF (파일GB / 필요GB≈×1.25) — 2026-07-13
모델파라미터 (B) Q4_K_M 파일/필요 (GB) Q5_K_M 파일/필요 (GB) Q8_0 파일/필요 (GB) KV KiB/토큰근사치?
Qwen3 4B4.02.5 / 3.12.9 / 3.64.3 / 5.4144
Llama 3.1 8B8.04.9 / 6.15.7 / 7.18.5 / 10.6128
Qwen3 8B8.25 / 6.25.9 / 7.48.7 / 10.9144
Gemma 3 12B12.07.3 / 9.18.4 / 10.512.5 / 15.6120
Qwen3 14B14.89 / 11.210.5 / 13.115.7 / 19.6160아니오
Mistral Small 3.2 24B24.014.3 / 17.916.8 / 21.025.1 / 31.4160
Gemma 3 27B27.016.5 / 20.619.3 / 24.128.7 / 35.9160
Qwen3 30B-A3B (MoE)30.518.6 / 23.221.7 / 27.132.5 / 40.6192
EXAONE 4.0 32B32.019.3 / 24.122.7 / 28.434 / 42.5160아니오
Qwen3 32B32.819.8 / 24.823.2 / 29.034.8 / 43.5256
Llama 3.3 70B70.642.5 / 53.150 / 62.575 / 93.8320

예시: 필요 VRAM ≈ 파일GB × 1.25 + (KV_KiB_per_token × context_tokens) / 1024 / 1024.

관련: GPU 스펙, 적재 매트릭스.

출처

자주 묻는 질문

필요 VRAM 공식은?
기본 근사: GGUF 파일 크기(GB) × 1.25. 긴 컨텍스트는 KV 캐시(토큰당 KiB × 길이)를 추가로 더합니다.
왜 파일 크기보다 크나요?
가중치 외에 KV 캐시, 스크래치 버퍼, 프레임워크 오버헤드가 붙기 때문입니다.
approx=예 는 무엇인가요?
해당 GGUF 크기를 저장소에서 직접 확인하지 못했거나 반올림 추정치인 경우입니다.
Q4와 Q8 차이는?
비트 정밀도가 높아질수록 파일과 필요 VRAM이 커지고, 일반적으로 품질 여유가 생깁니다.
컨텍스트 8K면 얼마나 더 쓰나요?
대략 (kv_per_token_kib × 8192) / 1024 / 1024 GB를 더합니다.
모델 VRAM — 브램체크 원본 보기 ↗