RAG en entreprise : un assistant IA qui répond à partir de vos documents internes
Le RAG (génération augmentée par récupération) connecte un modèle de langage aux documents de l'entreprise : avant de répondre, l'assistant recherche les passages pertinents dans vos bases, puis rédige une réponse qui les cite.
C'est le moyen le plus direct de créer un assistant IA ou un chatbot interne qui travaille sur votre savoir — procédures, contrats, documentation technique — avec des réponses vérifiables. Foxpilot conçoit, intègre et exploite des assistants RAG pour les DSI et directions métier, hébergés en Europe ou sur site selon vos contraintes.
Qu'est-ce qu'un RAG et comment fonctionne-t-il ?
Le guide RAG de la Direction générale des Entreprises (DGE, novembre 2024, PDF) décrit deux modules : la récupération, qui cherche les extraits pertinents dans votre corpus, et la génération, qui rédige la réponse à partir d'eux. La qualité se joue surtout dans la chaîne qui prépare et retrouve l'information.
-
Ingestion et nettoyage
Conversion en texte (OCR pour les scans), dédoublonnage, retrait des versions périmées ou contradictoires.
-
Découpage et métadonnées
Des passages calibrés avec vos experts métier, qui gardent source, date et droits du document d'origine.
-
Vectorisation et index
Des embeddings stockés dans une base vectorielle (pgvector, Qdrant, Pinecone) choisie selon votre hébergement.
-
Recherche hybride et reranking
Mots-clés et proximité de sens combinés, puis reclassement des passages vraiment utiles.
-
Réponse citée
Le modèle rédige à partir des seuls passages retenus, cite ses sources et refuse quand l'information manque.
Un assistant RAG répond et cite ; un agent agit (créer un ticket, mettre à jour un dossier) : voir le développement d'agents IA sur mesure.
Quand le RAG est pertinent, et quand il ne l'est pas
Cas d'usage cités par la DGE : assistant juridique sur les contrats, assistant RH sur les conventions collectives, recherche dans la documentation de maintenance, assistant commercial sur le catalogue.
Le RAG est un bon candidat si…
- la base documentaire est interne et volumineuse ;
- elle change souvent ;
- la réponse attendue est rédigée en langage naturel ;
- il faut pouvoir citer le document source.
Il faut autre chose quand…
- la question exige toute la base (synthèse globale, comparatif massif) : traitement par lots ou agent ;
- l'information vit dans des tableaux ou une base structurée : requête directe (SQL, API) ;
- il faut recommander ou trancher : contrôles dédiés et validation humaine ;
- un moteur de recherche classique répond déjà bien.
Logiciel, SaaS ou sur mesure : choisir le mode d'intégration
La DGE distingue quatre modes d'intégration ; le choix dépend de vos compétences, de votre vocabulaire métier, du délai et de l'endroit où vos données peuvent aller.
| Mode d'intégration | Points forts | Points faibles |
|---|---|---|
| Logiciel sous licence | Déploiement rapide, données chez vous | Personnalisation limitée, coût de maintenance |
| SaaS | Déploiement rapide, hébergement et mises à jour inclus | Cas spécifiques mal couverts, données hors de l'entreprise |
| Intégrateur | Sur mesure, adapté au cas d'usage | Un minimum de compétences pour dialoguer avec lui, coût de maintenance |
| Développement interne | Sur mesure, contrôle total | Compétences internes, déploiement plus long, équipes mobilisées pour la maintenance |
Si un outil du marché suffit, nous vous le dirons, et un consultant digital IA peut le déployer : un SaaS spécialisé, ou Microsoft 365 Copilot quand vos documents sont dans SharePoint (selon Microsoft, il n'affiche que les données que l'utilisateur a le droit de consulter). Le sur-mesure se justifie pour des sources hétérogènes, un processus métier précis ou un hébergement imposé.
RAG souverain : garder vos documents sous contrôle
Trois questions décident de tout : où tourne le modèle, où est l'index, qui peut lire quoi.
API, engagement contractuel et région UE
Le fournisseur s'engage par contrat à ne pas réutiliser vos données et traite en Europe. L'index peut rester chez vous.
Modèle déployé dans votre cloud
Une instance dédiée dans votre cloud : pour la DGE, un équilibre entre contrôle et flexibilité.
Modèle open-weights auto-hébergé
Sur vos serveurs, servi par exemple avec vLLM. Maîtrise maximale, si vous savez maintenir l'infrastructure.
Mistral documente le déploiement de ses modèles sur votre infrastructure ; certains sont sous Apache 2.0, d'autres sous d'autres licences ou seulement par API : la licence se vérifie modèle par modèle. Pour la DGE, le déploiement sur site offre la meilleure maîtrise, à condition de pouvoir le maintenir ; les clouds labellisés SecNumCloud sont une alternative. Foxpilot n'est pas hébergeur : nous intégrons l'architecture chez vous ou chez l'hébergeur retenu.
Les droits d'accès vont jusqu'à l'index
Un RAG mal conçu peut montrer à un stagiaire un passage réservé à la direction. L'ANSSI demande de traiter le besoin d'en connaître dès la conception (recommandations de sécurité pour un système d'IA générative, 29 avril 2024) ; l'OWASP classe le risque en LLM08 de son Top 10 2025. Nous propageons les droits de vos sources jusqu'à l'index, filtrons la recherche selon l'utilisateur et testons les fuites avant la production.
Données personnelles : les fiches pratiques IA de la CNIL servent de grille. AI Act : obligations de transparence, voire régime à haut risque pour certains usages comme le tri de candidatures ; la qualification se fait cas par cas (gouvernance IA et AI Act).
Fiabilité : mesurer les hallucinations au lieu de les promettre
Le RAG réduit les hallucinations sans les supprimer, rappelle la DGE. Plutôt que promettre zéro erreur, nous mesurons la qualité avant la production, puis la suivons.
Un jeu de questions-réponses de référence construit avec vos utilisateurs, comme le recommande la DGE.
Des évaluations outillées (Ragas, promptfoo) rejouées avant chaque mise à jour.
Des citations systématiques et un refus explicite hors périmètre.
Un suivi en production (Langfuse) : retours, questions sans réponse, coût, latence.
À voir : un exemple de dispositif (scénario représentatif) sur un cas de support, et notre article sur le RAG face aux hallucinations.
Combien coûte un RAG d'entreprise : les ordres de grandeur publics
Le coût dépend du volume documentaire, des utilisateurs, des connecteurs et de l'hébergement. Les repères publics sont ceux de la DGE, établis d'après des entretiens avec des professionnels :
| Poste | Ordre de grandeur (DGE) | Précisions du guide |
|---|---|---|
| Installation par un intégrateur | environ 100 000 €, une fois | Délai indicatif : environ 3 mois |
| Développement interne | au moins 3 mois d'un data scientist, d'un développeur et d'un administrateur système | Coût de la main-d'œuvre mobilisée |
| Solution SaaS | de l'ordre de 10 000 € à 100 000 € par an | Selon la gamme, hébergement inclus |
| Calcul en cloud | environ 106 € par utilisateur et par an | Mistral Small, 7,8 € pour 1 000 requêtes, 300 requêtes par semaine |
| Calcul sur site | GPU environ 3 250 €, électricité environ 2 € par utilisateur et par an | Llama 8B quantifié en 4 bits, 300 requêtes par semaine |
Source : guide RAG de la DGE, novembre 2024, p. 7, 12, 13 et 15 (coûts de calcul évalués en juin 2024). Ordres de grandeur à réévaluer, pas des tarifs Foxpilot.
Chez Foxpilot : un prototype au forfait, sur devis
Un prototype au forfait sur un sous-corpus, chiffré sur devis après cadrage, pour mesurer la qualité et le coût d'exploitation réel avant d'industrialiser.
Notre méthode, du corpus à l'exploitation
Cinq étapes, et une décision après le prototype : s'arrêter si la valeur n'y est pas fait partie du jeu.
-
1. Cadrage
Corpus, sources, droits d'accès, questions-types, critères de réussite et refus attendus.
-
2. Prototype sur un sous-corpus
Un périmètre réduit mais réel, au forfait, sur l'hébergement cible.
-
3. Évaluation avec vos utilisateurs
Jeu de référence rejoué avec les métiers : on décide sur des mesures, pas sur une démo.
-
4. Industrialisation
Connecteurs (SharePoint, Google Drive, Confluence, GED…), authentification unique, filtrage par droits, supervision.
-
5. Exploitation
Qualité suivie, réévaluation à chaque évolution du corpus ou du modèle, transfert de compétences.
Questions fréquentes sur le RAG en entreprise
Qu'est-ce que le RAG en entreprise ?
Quelle est la différence entre un LLM et un RAG ?
Le RAG supprime-t-il les hallucinations ?
Nos documents confidentiels sont-ils envoyés à un fournisseur d'IA ?
L'assistant respecte-t-il les droits d'accès de nos collaborateurs ?
RAG sur mesure ou Microsoft 365 Copilot : que choisir ?
Combien coûte un assistant RAG d'entreprise ?
Un assistant RAG sur vos documents : par où commencer ?
Décrivez-nous votre corpus, vos utilisateurs et vos contraintes d'hébergement : nous proposons un cadrage puis un prototype au forfait, chiffré sur devis.
Cadrer mon projet RAGOù nous trouver
Basés à Montpellier, nous accompagnons les entreprises de toute l'Occitanie en présentiel ou à distance.
Adresse
Foxpilot245 Avenue Marie de Montpellier
34000 Montpellier
Occitanie, France
Horaires
Lundi au vendredi : 9h00 à 18h00
Sur rendez-vous le samedi