Aller au contenu
Foxpilot — agence IA à Montpellier Foxpilot
RAG · assistant IA interne · souveraineté Mis à jour le Coût Fiabilité

RAG en entreprise : un assistant IA qui répond à partir de vos documents internes

Le RAG (génération augmentée par récupération) connecte un modèle de langage aux documents de l'entreprise : avant de répondre, l'assistant recherche les passages pertinents dans vos bases, puis rédige une réponse qui les cite.

C'est le moyen le plus direct de créer un assistant IA ou un chatbot interne qui travaille sur votre savoir — procédures, contrats, documentation technique — avec des réponses vérifiables. Foxpilot conçoit, intègre et exploite des assistants RAG pour les DSI et directions métier, hébergés en Europe ou sur site selon vos contraintes.

Qu'est-ce qu'un RAG et comment fonctionne-t-il ?

Le guide RAG de la Direction générale des Entreprises (DGE, novembre 2024, PDF) décrit deux modules : la récupération, qui cherche les extraits pertinents dans votre corpus, et la génération, qui rédige la réponse à partir d'eux. La qualité se joue surtout dans la chaîne qui prépare et retrouve l'information.

  1. Ingestion et nettoyage

    Conversion en texte (OCR pour les scans), dédoublonnage, retrait des versions périmées ou contradictoires.

  2. Découpage et métadonnées

    Des passages calibrés avec vos experts métier, qui gardent source, date et droits du document d'origine.

  3. Vectorisation et index

    Des embeddings stockés dans une base vectorielle (pgvector, Qdrant, Pinecone) choisie selon votre hébergement.

  4. Recherche hybride et reranking

    Mots-clés et proximité de sens combinés, puis reclassement des passages vraiment utiles.

  5. Réponse citée

    Le modèle rédige à partir des seuls passages retenus, cite ses sources et refuse quand l'information manque.

Un assistant RAG répond et cite ; un agent agit (créer un ticket, mettre à jour un dossier) : voir le développement d'agents IA sur mesure.

Quand le RAG est pertinent, et quand il ne l'est pas

Cas d'usage cités par la DGE : assistant juridique sur les contrats, assistant RH sur les conventions collectives, recherche dans la documentation de maintenance, assistant commercial sur le catalogue.

Le RAG est un bon candidat si…

  • la base documentaire est interne et volumineuse ;
  • elle change souvent ;
  • la réponse attendue est rédigée en langage naturel ;
  • il faut pouvoir citer le document source.

Il faut autre chose quand…

  • la question exige toute la base (synthèse globale, comparatif massif) : traitement par lots ou agent ;
  • l'information vit dans des tableaux ou une base structurée : requête directe (SQL, API) ;
  • il faut recommander ou trancher : contrôles dédiés et validation humaine ;
  • un moteur de recherche classique répond déjà bien.

Logiciel, SaaS ou sur mesure : choisir le mode d'intégration

La DGE distingue quatre modes d'intégration ; le choix dépend de vos compétences, de votre vocabulaire métier, du délai et de l'endroit où vos données peuvent aller.

Les quatre modes d’intégration d’un système RAG, avec leurs points forts et leurs points faibles, d’après le guide RAG de la DGE (novembre 2024).
Mode d'intégration Points forts Points faibles
Logiciel sous licence Déploiement rapide, données chez vous Personnalisation limitée, coût de maintenance
SaaS Déploiement rapide, hébergement et mises à jour inclus Cas spécifiques mal couverts, données hors de l'entreprise
Intégrateur Sur mesure, adapté au cas d'usage Un minimum de compétences pour dialoguer avec lui, coût de maintenance
Développement interne Sur mesure, contrôle total Compétences internes, déploiement plus long, équipes mobilisées pour la maintenance

Si un outil du marché suffit, nous vous le dirons, et un consultant digital IA peut le déployer : un SaaS spécialisé, ou Microsoft 365 Copilot quand vos documents sont dans SharePoint (selon Microsoft, il n'affiche que les données que l'utilisateur a le droit de consulter). Le sur-mesure se justifie pour des sources hétérogènes, un processus métier précis ou un hébergement imposé.

RAG souverain : garder vos documents sous contrôle

Trois questions décident de tout : où tourne le modèle, où est l'index, qui peut lire quoi.

API, engagement contractuel et région UE

Le fournisseur s'engage par contrat à ne pas réutiliser vos données et traite en Europe. L'index peut rester chez vous.

Modèle déployé dans votre cloud

Une instance dédiée dans votre cloud : pour la DGE, un équilibre entre contrôle et flexibilité.

Modèle open-weights auto-hébergé

Sur vos serveurs, servi par exemple avec vLLM. Maîtrise maximale, si vous savez maintenir l'infrastructure.

Mistral documente le déploiement de ses modèles sur votre infrastructure ; certains sont sous Apache 2.0, d'autres sous d'autres licences ou seulement par API : la licence se vérifie modèle par modèle. Pour la DGE, le déploiement sur site offre la meilleure maîtrise, à condition de pouvoir le maintenir ; les clouds labellisés SecNumCloud sont une alternative. Foxpilot n'est pas hébergeur : nous intégrons l'architecture chez vous ou chez l'hébergeur retenu.

Les droits d'accès vont jusqu'à l'index

Un RAG mal conçu peut montrer à un stagiaire un passage réservé à la direction. L'ANSSI demande de traiter le besoin d'en connaître dès la conception (recommandations de sécurité pour un système d'IA générative, 29 avril 2024) ; l'OWASP classe le risque en LLM08 de son Top 10 2025. Nous propageons les droits de vos sources jusqu'à l'index, filtrons la recherche selon l'utilisateur et testons les fuites avant la production.

Données personnelles : les fiches pratiques IA de la CNIL servent de grille. AI Act : obligations de transparence, voire régime à haut risque pour certains usages comme le tri de candidatures ; la qualification se fait cas par cas (gouvernance IA et AI Act).

Fiabilité : mesurer les hallucinations au lieu de les promettre

Le RAG réduit les hallucinations sans les supprimer, rappelle la DGE. Plutôt que promettre zéro erreur, nous mesurons la qualité avant la production, puis la suivons.

Un jeu de questions-réponses de référence construit avec vos utilisateurs, comme le recommande la DGE.

Des évaluations outillées (Ragas, promptfoo) rejouées avant chaque mise à jour.

Des citations systématiques et un refus explicite hors périmètre.

Un suivi en production (Langfuse) : retours, questions sans réponse, coût, latence.

À voir : un exemple de dispositif (scénario représentatif) sur un cas de support, et notre article sur le RAG face aux hallucinations.

Combien coûte un RAG d'entreprise : les ordres de grandeur publics

Le coût dépend du volume documentaire, des utilisateurs, des connecteurs et de l'hébergement. Les repères publics sont ceux de la DGE, établis d'après des entretiens avec des professionnels :

Ordres de grandeur du coût d’un système RAG publiés par la DGE en novembre 2024, poste par poste, avec les hypothèses et précisions données par le guide.
Poste Ordre de grandeur (DGE) Précisions du guide
Installation par un intégrateur environ 100 000 €, une fois Délai indicatif : environ 3 mois
Développement interne au moins 3 mois d'un data scientist, d'un développeur et d'un administrateur système Coût de la main-d'œuvre mobilisée
Solution SaaS de l'ordre de 10 000 € à 100 000 € par an Selon la gamme, hébergement inclus
Calcul en cloud environ 106 € par utilisateur et par an Mistral Small, 7,8 € pour 1 000 requêtes, 300 requêtes par semaine
Calcul sur site GPU environ 3 250 €, électricité environ 2 € par utilisateur et par an Llama 8B quantifié en 4 bits, 300 requêtes par semaine

Source : guide RAG de la DGE, novembre 2024, p. 7, 12, 13 et 15 (coûts de calcul évalués en juin 2024). Ordres de grandeur à réévaluer, pas des tarifs Foxpilot.

Chez Foxpilot : un prototype au forfait, sur devis

Un prototype au forfait sur un sous-corpus, chiffré sur devis après cadrage, pour mesurer la qualité et le coût d'exploitation réel avant d'industrialiser.

Notre méthode, du corpus à l'exploitation

Cinq étapes, et une décision après le prototype : s'arrêter si la valeur n'y est pas fait partie du jeu.

  1. 1. Cadrage

    Corpus, sources, droits d'accès, questions-types, critères de réussite et refus attendus.

  2. 2. Prototype sur un sous-corpus

    Un périmètre réduit mais réel, au forfait, sur l'hébergement cible.

  3. 3. Évaluation avec vos utilisateurs

    Jeu de référence rejoué avec les métiers : on décide sur des mesures, pas sur une démo.

  4. 4. Industrialisation

    Connecteurs (SharePoint, Google Drive, Confluence, GED…), authentification unique, filtrage par droits, supervision.

  5. 5. Exploitation

    Qualité suivie, réévaluation à chaque évolution du corpus ou du modèle, transfert de compétences.

FAQ

Questions fréquentes sur le RAG en entreprise

Qu'est-ce que le RAG en entreprise ?
Le RAG, ou génération augmentée par récupération, connecte un modèle de langage aux documents de l'entreprise : un module de récupération cherche les passages pertinents, un module de génération rédige la réponse. Le modèle n'apprend rien de vos données : il les consulte au moment de répondre.
Quelle est la différence entre un LLM et un RAG ?
Un LLM (grand modèle de langage) rédige à partir de ce qu'il a appris à l'entraînement. Le RAG est une architecture qui, avant chaque réponse, va chercher les passages pertinents dans vos documents et les donne au LLM, qui répond en les citant. Les deux se combinent : le RAG ne remplace pas le LLM, il lui fournit vos sources.
Le RAG supprime-t-il les hallucinations ?
Non, il les réduit, et cela se mesure : jeu de questions-réponses de référence construit avec vos utilisateurs, évaluations (Ragas, promptfoo) avant chaque mise à jour, citations systématiques, refus explicite hors périmètre et suivi en production.
Nos documents confidentiels sont-ils envoyés à un fournisseur d'IA ?
Cela dépend de l'architecture, choisie avec vous : API chez un fournisseur qui s'engage à ne pas réutiliser vos données, avec traitement en Europe ; modèle déployé dans votre cloud ; ou modèle open-weights auto-hébergé, par exemple un modèle Mistral servi avec vLLM. Selon la DGE, le déploiement sur site offre la meilleure maîtrise, si vous pouvez le maintenir.
L'assistant respecte-t-il les droits d'accès de nos collaborateurs ?
Il le doit. Un RAG mal conçu peut restituer un passage d'un document que l'utilisateur n'a pas le droit d'ouvrir (OWASP, LLM08 du Top 10 2025). Nous propageons les droits de vos sources (SharePoint, Drive, GED…) jusqu'à l'index, filtrons la recherche selon l'utilisateur et testons les fuites avant la production.
RAG sur mesure ou Microsoft 365 Copilot : que choisir ?
Si vos documents vivent dans Microsoft 365 et que l'usage est la recherche et la rédaction au quotidien, Microsoft 365 Copilot (désormais nommé Microsoft Copilot) peut suffire : selon Microsoft, il n'affiche que les données que l'utilisateur a le droit de consulter. Le sur-mesure se justifie pour des sources hors Microsoft 365 ou un hébergement imposé.
Combien coûte un assistant RAG d'entreprise ?
Il n'y a pas de prix unique. Le guide RAG de la DGE (novembre 2024) estime l'installation par un intégrateur à environ 100 000 € en ordre de grandeur, et le calcul en cloud à environ 106 € par utilisateur et par an (Mistral Small, 300 requêtes par semaine). Foxpilot commence par un prototype au forfait sur un sous-corpus, chiffré sur devis.

Un assistant RAG sur vos documents : par où commencer ?

Décrivez-nous votre corpus, vos utilisateurs et vos contraintes d'hébergement : nous proposons un cadrage puis un prototype au forfait, chiffré sur devis.

Cadrer mon projet RAG

Montpellier | Hérault | Occitanie

Où nous trouver

Basés à Montpellier, nous accompagnons les entreprises de toute l'Occitanie en présentiel ou à distance.

Adresse

Foxpilot
245 Avenue Marie de Montpellier
34000 Montpellier
Occitanie, France

Horaires

Lundi au vendredi : 9h00 à 18h00
Sur rendez-vous le samedi

Voir sur Google Maps