AI 작업별 최소 VRAM 가이드
한 줄 요약: 아래 밴드는 흔히 통하는 출발점이지 제조사 보증이 아닙니다.
| 작업 | 최소 출발 (GB) | 여유 있는 편 (GB) | 메모 |
|---|---|---|---|
| 소형 LLM 추론 (3B–8B, Q4) | 6–8 | 12 | 컨텍스트를 길게 열면 8GB도 빠듯 |
| 중형 LLM 추론 (14B–32B, Q4) | 12–16 | 24 | Q5/Q8은 한 단계 위 VRAM |
| 대형 LLM 추론 (70B, Q4) | 40–48 | 48+ | 24GB는 공격적 양자화·오프로드 전제 |
| SD 1.5급 이미지 | 4–6 | 8 | 확장·고해상도 시 상승 |
| SDXL 추론 | 8–10 | 12–16 | 해상도·배치에 민감 |
| LoRA 학습 (소형 모델) | 12 | 16–24 | QLoRA 여부에 따라 편차 큼 |
| 영상 생성/프레임 보간 | 12+ | 24 | 툴체인별 차이 매우 큼 |
같은 12GB라도 대역폭과 소프트웨어 스택이 다르면 결과 속도가 달라집니다. GPU 스펙 표의 대역폭 열을 함께 보세요.
자주 묻는 질문
- 이 숫자는 공식 요구사항인가요?
- 아닙니다. 커뮤니티·런타임 문서에서 반복되는 실용 밴드를 정리한 가이드입니다.
- SDXL과 LLM 중 무엇이 더 먹나요?
- 해상도와 배치에 따라 다릅니다. SDXL 고해상도는 순간 피크가 크고, 70B급 LLM Q4는 상시 점유가 큽니다.
- 파인튜닝은 왜 더 필요한가요?
- 옵티마이저 상태와 활성화 값이 가중치 외에 추가됩니다.
- 8GB로 무엇을 할 수 있나요?
- 7B~8B급 Q4 추론과 가벼운 이미지 생성 실험이 흔한 구간입니다.
- 가이드와 계산기 차이는?
- 가이드는 작업 유형 감각, 계산기는 구체 모델·양자화·컨텍스트 숫자 입력용입니다.