RAG

Le RAG (Retrieval-Augmented Generation) est l’une des techniques les plus répandues pour ancrer un modèle de langage dans des données réelles plutôt que dans ses seuls souvenirs d’entraînement. L’idée tient en deux temps : aller chercher la bonne information, puis laisser le modèle la formuler. En pratique, tout se joue dans ce premier mouvement.

Un RAG mal réglé ne corrige pas les hallucinations, il les habille de sources. La qualité des embeddings, le découpage des documents, la pertinence de la recherche pèsent autant que le modèle lui-même : on ne branche pas une rustine, on conçoit une architecture, des plus simples aux pipelines agentiques. Fiabiliser une IA tient peut-être d’abord à ce qu’on lui donne à lire. Sur quoi compter pour une réponse juste, le modèle ou ce qu’on a su lui retrouver ?

Nos guides sur le sujet

Nos guides pour comprendre le RAG et ancrer un modèle dans des données fiables, du concept au pipeline.

Questions frequentes

Qu'est-ce que le RAG (retrieval-augmented generation) ?

Le RAG est une technique qui branche un modèle de langage sur une base de connaissances externe. Avant de répondre, le système recherche les documents pertinents et les fournit au modèle comme contexte. La réponse s'appuie alors sur ces données récupérées plutôt que sur la seule mémoire du modèle.

Pourquoi utiliser le RAG plutôt que le seul modèle ?

Un modèle seul ne connaît que ses données d'entraînement, figées et parfois inexactes. Le RAG lui donne accès à des informations à jour, spécifiques ou privées, sans réentraînement. Il réduit les hallucinations en ancrant les réponses sur des sources, et permet de citer d'où vient l'information.

Comment fonctionne un pipeline RAG ?

Les documents sont découpés en morceaux, convertis en embeddings (vecteurs numériques) et stockés dans une base vectorielle. À la question, le système transforme la requête en vecteur, récupère les passages les plus proches, puis les transmet au modèle qui rédige une réponse fondée sur ces extraits.

Que sont les embeddings dans un système RAG ?

Les embeddings sont des représentations numériques du sens d'un texte sous forme de vecteurs. Deux passages proches par le sens ont des vecteurs proches. C'est ce qui permet la recherche par similarité sémantique, au cœur du RAG : retrouver les contenus pertinents même sans mots-clés identiques.

Quelle différence entre RAG et fine-tuning ?

Le fine-tuning réentraîne le modèle sur des données pour modifier son comportement ou son style. Le RAG laisse le modèle intact et lui fournit des informations au moment de la requête. Le RAG convient aux connaissances qui changent souvent ; le fine-tuning, à l'apprentissage d'un ton ou d'un format stable.