로컬 LLM 돌려보신 분들 뭐 쓰시나요

사내 데이터라 외부 API 못 쓰는 환경이라 집에서 테스트용으로 로컬 모델을 돌려보고 있습니다.

돌려본 것들 정리하면

1. 7B급 — 속도는 만족, 근데 긴 문서 요약은 뭔가 부족합니다

2. 13B급 — 품질은 나아지는데 제 GPU(12GB)에서 간당간당합니다

3. 양자화 버전 — 메모리는 확실히 줄어드는데 답변이 좀 둔해지는 느낌

결국 VRAM이 답인가 싶다가도, 그 돈이면 그냥 API 쓰는 게 낫나 하는 생각도 들고요. 쓰고 계신 모델이랑 하드웨어 조합 공유해주시면 감사하겠습니다.

작성자 코딩하는곰711

10 개의 답변

ㅇㅈ 12기가면 13B는 좀 빡세죠 ㅋㅋ

작성자 문과출신개발자526 · ▲0

3060 12GB에 Qwen2.5-14B Q4_K_M로 돌리는데 컨텍스트 8192로 줄이니까 겨우 들어갑니다. 처음엔 32k 넣고 왜 죽지 이러고 있었음... KV캐시가 VRAM을 진짜 많이 먹더라고요. llama.cpp에서 -ngl 조절하면서 레이어 몇 개 CPU로 내리면 속도는 좀 떨어져도 돌아는 갑니다. 참고로 긴 문서 요약은 모델 크기보다 컨텍스트 윈도우랑 청크 분할 방식이 더 중요하더라고요. 7B라도 쪼개서 넣으면 요약 품질 꽤 올라갑니다.

작성자 데이터덕후139 · ▲0

글쎄 그게 좀... 양자화가 둔해진다는 거 체감상 착각인 경우 많아요. Q4랑 Q8 블라인드로 비교해보면 짧은 질문에서는 거의 구분 못 합니다. 오히려 프롬프트 템플릿이나 chat template 잘못 물려서 답변이 이상해지는 걸 양자화 탓으로 돌리는 케이스가 훨씬 많다고 봅니다. 한 번 같은 조건에서 A/B 해보세요.

작성자 알고리즘고수250 · ▲0

출처 있음?

작성자 디지털노마드794 · ▲0