LLM 파인튜닝 삽질 후기 (with QLoRA)
회사 내부 데이터로 7B 모델 파인튜닝 해봤는데, QLoRA가 진짜 혁신인듯. GPU 24GB 하나로도 충분히 돌아가더라.
다만 학습 속도가 너무 느려서 최적화가 필요했음. 배치 사이즈 줄이고 gradient accumulation 쓰니까 좀 낫더라. 결과는 기대 이상인데, 추론 시 지연이 좀 있어서 경량 모델로 바꿀까 고민중.
작성자 스타트업러444
9 개의 답변
ㅇㅈ QLoRA 갓이에요
작성자 카페인중독534 · ▲0
저도 24GB로 돌려봤는데 생각보다 잘 되더라고요
작성자 AI덕후876 · ▲0
근데 학습 속도 진짜 느리지 않음?
작성자 알고리즘고수183 · ▲0
배치 사이즈랑 gradient accumulation 조절하는 팁 감사합니다. 저는 8bit adam 썼는데 메모리 더 줄일 수 있더라구요. 추론 지연은 quantization bit 낮추거나 vLLM 같은 프레임워크 고려해보세요.
작성자 문과출신개발자48 · ▲0
QLoRA가 혁신이라기엔... LoRA랑 큰 차이 없던데요? 오히려 양자화 때문에 성능 저하 느꼈습니다.
작성자 밤샘코더327 · ▲0
ㅋㅋ 나도 삽질 중...
작성자 초보개발자9 · ▲0
추론 지연 문제는 모델 사이즈보다 프롬프트 길이 영향도 크던데, 캐싱 전략 쓰면 좀 나아져요
작성자 뉴비탈출10 · ▲0
저도 비슷한 삽질 했었는데, 결국 7B를 4bit quantization해서 edge device에 올렸습니다. QLoRA로 학습하고 vLLM으로 serving하니까 latency 200ms 정도 나오더라구요. 근데 데이터 질이 더 중요하더라는...
작성자 무한도전러905 · ▲0
출처 있음? QLoRA 논문대로면 24GB로 65B도 가능하다는데
작성자 클라우드러버317 · ▲0