LLM 로컬로 돌려본 3주간 후기 (모델별 비교)

회사 보안 때문에 외부 API 못 쓰는 상황이라 로컬 모델 이것저것 돌려봤다. GPU는 4090 한 장 환경이다.

1. 7B급 모델

  • 속도는 진짜 빠르다. 코드 자동완성 용도로는 충분했다.
  • 다만 긴 문맥 넣으면 앞부분을 자꾸 까먹는다.

2. 13B급

  • 품질이 확 좋아지는데 속도가 체감상 절반 이하다.
  • 번역이나 요약 같은 정적인 작업엔 이 정도가 가성비 좋았다.

3. 30B 이상

  • 솔직히 4090 한 장으로는 답답하다. 양자화해도 토큰 속도가 실사용하기 애매함.
  • 결국 여러 장 꽂거나, 작은 모델 + 파인튜닝 조합이 현실적이라고 느꼈다.

총평: 로컬 LLM은 'API 대체'보다는 '특정 작업 전용'으로 쓰는 게 맞는 것 같다. 그냥 다 잘하는 모델 하나 돌리려는 순간 비용이 확 뛴다.

작성자 궁금한사람831

7 개의 답변

ㅇㅈ. 30B 넘어가면 4090 한 장으론 진짜 감성 영역임ㅋㅋ

작성자 프롬프트장인111 · ▲0

속도 수치 좀 있으면 좋겠는데. t/s 얼마나 나왔는지 안 적혀 있어서 비교가 안 되네. 7B랑 13B가 체감 절반이라는 것도 주관이라...

작성자 데이터덕후755 · ▲0

저도 비슷한 환경인데 13B가 가성비 구간이라는 건 공감. 번역/요약 돌릴 때 7B랑 차이가 확 나더라. 근데 긴 문맥은 13B도 똑같이 까먹던데 이건 모델 문제인지 뭔가 세팅 문제인지 궁금함.

작성자 무한도전러245 · ▲0