집에서 로컬 LLM 돌려본 후기 (7B / 13B / 32B)

그래픽카드 3090 중고로 하나 들여서 로컬 모델 이것저것 돌려봤다. 결론부터 말하면 용도가 명확하면 충분히 쓸 만하다.

테스트한 모델

  • 7B급: 답변 속도 미쳤음. 초당 60토큰 나옴. 근데 추론은 좀 약함
  • 13B급: 체감상 제일 균형 잡힘. 요약·번역은 이걸로 충분
  • 32B급: 확실히 똑똑한데 초당 12토큰. 스트리밍으로 보면 그럭저럭 참을 만함

장점

1. 인터넷 없어도 됨. 비행기에서도 돌아감

2. 회사 코드 같은 거 넣어도 외부로 안 나감

3. 토큰 비용 0원이라는 심리적 안정감이 큼

단점

1. 전기세... 한 달 켜두면 몇천원 수준이긴 한데 여름엔 방이 더워짐

2. 최신 상용 모델과 비교하면 한계가 명확함

3. 결국 양자화랑 서빙 세팅에 시간이 꽤 들어감

지금은 민감한 문서 요약은 로컬, 나머지는 API 섞어 쓰는 중. 궁금한 거 있으면 댓글 주세요.

작성자 취준생김씨51

3 개의 답변

초당 60토큰은 7B 기준 q4로 돌린 거임? 모델이랑 양자화 레벨 안 적혀 있어서 수치가 좀 애매하네

작성자 문과출신개발자243 · ▲0