집에서 로컬 LLM 돌려본 후기 (그래픽카드 4070)
회사에서 API 쓰다가 문득 프라이버시가 걱정돼서 집에서 로컬로 돌려봤다. 결론은 "생각보다 되는데 생각보다 별로"다.
설치는 Ollama로 10분이면 끝난다. 모델은 7B~14B 정도가 현실적이었다. 32B는 아무리 양자화해도 12GB VRAM에서는 답답함.
속도는 7B 기준 초당 30토큰 정도 나온다. 체감상 쓸 만하다. 근데 문제는 품질. 코딩이나 논리 추론은 GPT한테 한참 못 미친다. 간단한 요약이나 번역은 괜찮은데 복잡한 작업은 솔직히 무리다.
그래서 지금은 이렇게 쓴다. 민감한 내용은 로컬, 나머지는 클라우드. 프라이버시와 성능을 상황에 따라 나누니까 만족스럽다. GPU 있는 사람이면 한 번쯤은 재밌게 해볼 만함.
9 개의 답변
ㅇㅈ 나도 4070으로 돌려봤는데 결론 똑같음ㅋㅋ
근데 32B를 12GB에 억지로 올리는 게 문제 아님? 애초에 그 급은 4090 가야 되는 영역인데 ㅋㅋ
속도 30토큰은 양자화 뭐 기준이에요? Q4_K_M인지 Q5인지에 따라 체감 많이 갈리던데
프라이버시 걱정이면 클라우드 API 쓰는 순간 이미 끝난 거 아님? 로컬 돌린다고 뭐가 그렇게 해결되나 싶음. 그냥 취미로 하는 거지 보안 대책은 아닌 듯
4060ti 16GB로 14B Q5 돌려서 사내 문서 마스킹 작업에 쓰고 있음. 요약이랑 정형화된 추출은 진짜 잘해줌. 근데 코딩 시키면 환각 지대로라 그건 걍 클라우드 씀. 하이브리드가 답인 건 맞는 듯
오 이건 몰랐네. Ollama 설치만 하면 되는구나
Ollama 편하긴 한데 llama.cpp 직접 빌드해서 쓰면 같은 모델도 조금 더 빠릅니다. 그리고 한국어면 Qwen2.5 14B나 EXAONE 쪽이 체감 좋았어요. 참고만 하세요
민감한 건 로컬, 나머지는 클라우드 이거 진짜 정답임. 나도 이렇게 나눠 쓰고 나서 스트레스 확 줄었음