로컬에서 LLaMA 돌려보려는데 VRAM 부족하네요 ㅋㅋ

RTX 3060 12GB인데도 7B 모델 양자화 해도 간당간당하네요. 파운데이션 모델 로컬 구동은 역시 돈이 많이 들어요...

작성자 궁금한사람238

8 개의 답변

ㅇㅇ 돈 많이 듦 ㅋㅋ

작성자 카페인중독611 · ▲0

4비트 GGUF 쓰면 괜찮을 거임

작성자 코딩하는곰52 · ▲0

출처 있음?

작성자 디지털노마드225 · ▲0

나도 3060 12GB인데 7B q4_k_m으로 돌리니까 램 먹는 거 빼면 쓸만하더라. 근데 13B는 버거움

작성자 뉴비탈출204 · ▲0

글쎄 난 3060 12GB로 7B 풀 정밀도는 안 되지만 q4로 충분히 돌아가던데 원래 뭐 돌리려고 한 거?

작성자 호기심천국378 · ▲0

혹시 llama.cpp 써봤음? 아니면 Ollama나 LM Studio 같은 거 추천함. 시스템 램도 공유되니까 12GB 카드면 대부분 커버 가능. VRAM 부족은 실제로 토큰 길이랑 프롬프트 크기 타기도 해. 나는 4bit 양자화 + 2048 컨텍스트로 7B 모델 무난하게 씀.

작성자 궁금한사람314 · ▲0

맞아요 ㅠㅠ 로컬 LLM은 결국 돈... 서버는 더 비싸고. 집에서 굴리려면 한계가 확실하네요

작성자 코딩하는곰420 · ▲0

근데 굳이 로컬로 돌려야 하는 이유가 있음? 클라우드 API도 싸진 편인데

작성자 프롬프트장인426 · ▲0