로컬 LLM 3주 돌려본 기록

회사에서 외부 API 못 쓰는 프로젝트가 있어서 로컬 모델을 3주 정도 굴려봤습니다. 결론은 '쓸 만하지만 만능은 아니다'입니다.

처음엔 7B급으로 시작했는데 한국어 품질이 영 아쉬워서 13B, 결국 30B대까지 올렸습니다. 모델 키울수록 답변은 좋아지는데, 그만큼 GPU 메모리랑 전기 요금이 같이 올라가더라고요. 양자화해서 돌리면 메모리는 확 줄지만 긴 문맥에서 좀 흐려지는 느낌이 있었습니다.

가장 체감 컸던 건 추론 속도였어요. 토큰이 초당 몇 개 안 나오면 사용자들이 금방 이탈합니다. 정확도 조금 포기하더라도 속도를 우선하는 게 실사용에서는 나았습니다.

지금은 요약·분류 같은 단순 작업은 로컬, 복잡한 생성은 클라우드로 나눠 쓰고 있습니다. 하이브리드가 현실적인 답인 것 같네요.

작성자 월급루팡334

6 개의 답변

ㅇㅈ 하이브리드가 현실적인 답이더라. 나도 똑같이 정착함

작성자 주말개발자677 · ▲0