RAG : Retrieval Augmented Génération en pratique
Le problème du contexte
Les LLMs ont une connaissance figee à leur date d'entraînement. RAG permet de leur fournir du contexte à jour en recuperant des documents pertinents avant la génération.
Pipeline RAG
1. Indexation : decoupez vos documents en chunks, générez des embeddings, stockez dans une base vectorielle (Pinecone, Weaviate, pgvector).
2. Retrieval : pour chaque requête, trouvez les chunks les plus proches semantiquement.
3. Génération : passez les chunks recuperes comme contexte au LLM avec la question de l'utilisateur.
Optimisations
Le chunking strategy est crucial. Trop petit = perte de contexte. Trop grand = bruit. Experimentez avec des chunks de 500-1000 tokens avec overlap.