회사 내부 데이터로 7B 모델 파인튜닝 해봤는데, QLoRA가 진짜 혁신인듯. GPU 24GB 하나로도 충분히 돌아가더라.
다만 학습 속도가 너무 느려서 최적화가 필요했음. 배치 사이즈 줄이고 gradient accumulation 쓰니까 좀 낫더라. 결과는 기대 이상인데, 추론 시 지연이 좀 있어서 경량 모델로 바꿀까 고민중.
배치 사이즈랑 gradient accumulation 조절하는 팁 감사합니다. 저는 8bit adam 썼는데 메모리 더 줄일 수 있더라구요. 추론 지연은 quantization bit 낮추거나 vLLM 같은 프레임워크 고려해보세요.
ㅇㅈ QLoRA 갓이에요
QLoRA가 혁신이라기엔... LoRA랑 큰 차이 없던데요? 오히려 양자화 때문에 성능 저하 느꼈습니다.
저도 24GB로 돌려봤는데 생각보다 잘 되더라고요
근데 학습 속도 진짜 느리지 않음?
ㅋㅋ 나도 삽질 중...