RTX 3060 12GB인데도 7B 모델 양자화 해도 간당간당하네요. 파운데이션 모델 로컬 구동은 역시 돈이 많이 들어요...
출처 있음?
글쎄 난 3060 12GB로 7B 풀 정밀도는 안 되지만 q4로 충분히 돌아가던데 원래 뭐 돌리려고 한 거?
나도 3060 12GB인데 7B q4_k_m으로 돌리니까 램 먹는 거 빼면 쓸만하더라. 근데 13B는 버거움
ㅇㅇ 돈 많이 듦 ㅋㅋ
혹시 llama.cpp 써봤음? 아니면 Ollama나 LM Studio 같은 거 추천함. 시스템 램도 공유되니까 12GB 카드면 대부분 커버 가능. VRAM 부족은 실제로 토큰 길이랑 프롬프트 크기 타기도 해. 나는 4bit 양자화 + 2048 컨텍스트로 7B 모델 무난하게 씀.
4비트 GGUF 쓰면 괜찮을 거임
맞아요 ㅠㅠ 로컬 LLM은 결국 돈... 서버는 더 비싸고. 집에서 굴리려면 한계가 확실하네요
근데 굳이 로컬로 돌려야 하는 이유가 있음? 클라우드 API도 싸진 편인데