RAG 시스템 만들려고 랭체인 썼는데, 문서 분할(chunking)부터 막혔음.
1. RecursiveCharacterTextSplitter로 500자씩 자르니까 문맥 끊겨서 검색 품질 개판
2. 임베딩 모델은 bge-large-ko vs Korean RoBERTa 고민하다가 bge 씀
3. retriever에 FAISS vs Chroma 중 FAISS가 더 빨라서 선택
결론: 랭체인 자체는 편한데, chunk 전략이 진짜 중요함. 나는 markdown 헤더 기준으로 나누니까 훨씬 낫더라.
혹시 다른 접근법 쓰는 사람 있음?