Créer un assistant IA personnalisé entreprise formé à votre jargon métier en 2026 : guide pratique
42% des PME françaises ont déployé au moins une solution IA en 2026 (BPI France Le Lab). Pourtant, si vous posez une question sur vos propres conditions générales de vente à ChatGPT, il invente. Si vous lui demandez de rédiger un CCTP pour un chantier de ravalement, il produit quelque chose de présentable que votre conducteur de travaux va corriger ligne par ligne. Si vous lui soumettez un dossier client en assurance, il vous répond en français correct mais hors contexte réglementaire.
Le problème n'est pas l'IA. C'est que les modèles généralistes ne connaissent pas votre secteur dans le détail : pas vos certifications, pas votre nomenclature interne, pas vos exceptions contractuelles habituelles. Vous avez besoin d'un assistant formé à votre jargon, pas à celui de tout le monde. Pour un contexte plus large sur l'adoption de l'IA dans les PME françaises, voir IA pour PME : pourquoi ChatGPT ne suffit pas.
Dans cet article, je décris trois approches concrètes pour créer un assistant IA qui parle vraiment le langage de votre métier : le system prompt enrichi (sans code, gratuit ou quasi-gratuit), le RAG (quelques centaines d'euros par mois), et le fine-tuning (rare, coûteux, souvent inutile). Je m'appuie sur des données réelles et des cas concrets en BTP, juridique, immobilier et médical. À la fin, vous saurez laquelle de ces approches correspond à votre situation.
Pourquoi ChatGPT ne connaît pas le jargon de votre métier
26% des PME françaises utilisent l'IA chaque jour en 2026, contre 6% en 2023, soit une multiplication par quatre en trois ans. Mais 61% des dirigeants citent le manque de compétences internes comme premier frein à l'adoption (BPI France Le Lab, 2026). Ce diagnostic est imprécis. Le frein réel, celui que j'observe chez mes clients, est plus concret : les outils génériques donnent des résultats génériques, et les équipes abandonnent après quelques semaines parce que la qualité des réponses ne justifie pas le changement d'habitudes.
Un assistant performant dans votre métier nécessite qu'on lui transmette votre contexte : vos documents, votre vocabulaire, vos règles internes. Ce n'est pas une question de technologie avancée. C'est une question de conception.
Trois approches selon votre budget
| Approche | Coût setup | Coût mensuel | Délai | Niveau technique | Idéal pour | Limite principale |
|---|---|---|---|---|---|---|
| System prompt enrichi | 0 € | 0-25 €/user | 1 jour | Aucun (no-code) | Équipes avec moins de 15 pages de docs | Fenêtre de contexte limitée |
| RAG no-code | 0-500 € | 24-400 € | 1-5 jours | Faible | Sans dev, 20 à 1 000 docs | Chunking fixe, précision variable |
| RAG sur mesure | 7 500-13 200 € | 650-1 750 € | 1-6 mois | Élevé (dev requis) | Corpus volumineux, précision critique | Coût et délai de déploiement |
1. Le system prompt enrichi (0 à 25 euros par utilisateur et par mois)
C'est l'entrée de gamme. Un system prompt est le texte d'instruction que vous donnez au modèle avant toute conversation. Dans Claude Teams à 25 euros par siège et par mois, vous créez des Projets avec un system prompt persistant et des fichiers de connaissance partagés. Aucun développeur requis.
Exemple concret : un cabinet comptable peut, sans aucun code, rédiger un system prompt de 4 000 tokens définissant la terminologie du Plan Comptable Général, les structures juridiques de ses clients, et le format attendu pour les emails client. Les réponses utilisent votre vocabulaire, respectent vos conventions et s'adressent à vos interlocuteurs dans le bon registre.
La contrainte est claire : tout votre contexte métier doit tenir dans la fenêtre de contexte, soit environ 8 à 12 pages de texte. Si votre base documentaire dépasse 15 pages, le system prompt ne suffira pas : passez directement au RAG.
Pour un volume de requêtes élevé via l'API Claude, le prompt caching réduit le coût des lectures de system prompt répétées à 10% du tarif standard. Un system prompt de 5 000 tokens vous coûte environ 0,00001 dollar par requête sur Claude Haiku 4.5. À l'échelle d'une PME de 20 personnes, c'est marginal.
2. Le RAG, Retrieval-Augmented Generation (500 à 2 000 euros par mois)
Le RAG vous permet d'indexer de vrais documents dans une base vectorielle et de les récupérer dynamiquement selon la question posée. L'assistant répond en s'appuyant sur vos documents réels, avec citation des sources. Ce qui signifie que chaque réponse est auditable, et vos équipes peuvent vérifier d'où vient l'information.
Pour une PME avec 1 000 à 10 000 documents, le coût de mise en place se situe entre 7 500 et 13 200 euros selon Stratagem Systems, avec 650 à 1 750 euros par mois de coûts opérationnels. C'est accessible pour une équipe de 10 à 20 personnes si le cas d'usage justifie l'investissement.
Pour les équipes sans développeur, des plateformes no-code permettent de démarrer rapidement :
- CustomGPT.ai (35 à 99 euros par mois) : ingère vos PDF et sites web, conforme RGPD et SOC-2.
- Chatbase (24 à 400 euros par mois) : chatbot RAG opérationnel en 30 à 60 minutes sur une base de 20 documents.
- n8n + Notion (environ 20 euros par mois en auto-hébergé) : template RAG préconstruit pour les équipes qui utilisent déjà Notion comme base de connaissance.
Pour le stockage vectoriel, les options principales sont Pinecone Serverless (environ 50 euros par mois), Weaviate Cloud (25 à 45 euros par mois) et Qdrant Cloud (tarification à l'heure, option auto-hébergée à coût quasi nul). Qdrant est préféré pour les charges de travail prévisibles et à fort volume.
3. Le fine-tuning (rare, coûteux, souvent inutile)
Le fine-tuning consiste à réentraîner un modèle sur vos données pour modifier son comportement de base. Cette option a été fortement réduite : OpenAI a fermé son API de fine-tuning en libre-service aux nouveaux utilisateurs le 7 mai 2026, avec fermeture totale prévue le 6 janvier 2027. OpenAI lui-même recommande désormais le RAG et le prompt caching comme alternatives.
Des options existent encore via LoRA et QLoRA sur Mistral 7B ou Llama 3.1 8B (inférence à 0,48 dollar par million de tokens via Together AI après entraînement), ou via les services gérés AWS Bedrock et Google Vertex AI pour les modèles fermés. Cela nécessite une expertise MLOps que peu de PME possèdent en interne.
Mon avis direct : sauf cas très spécifique (génération de code propriétaire à syntaxe interne, classification ultra-précise sur données annotées massives), le fine-tuning ne se justifie pas pour la grande majorité des besoins métier. Commencez par le RAG. Si votre besoin est plutôt d'automatiser des actions que de consulter des documents, les agents IA Claude constituent une approche complémentaire.
Assistant IA formé à votre secteur : BTP, juridique, immobilier, santé
BTP : le secteur le moins équipé, donc la plus grande opportunité
La construction est le secteur le moins équipé en France : 12% d'adoption IA seulement, contre 40% dans les services selon BPI France Le Lab. C'est la disparité la plus marquée entre secteurs, et donc le terrain où un assistant IA métier crée le plus d'avantage concurrentiel immédiat.
Un artisan qui charge un system prompt avec ses certifications (RGE, Qualibat), ses matériaux standards, sa zone géographique et son numéro de police Décennale passe de 8 à 15 heures de travail pour répondre à un marché public à 2 à 4 heures. La génération de devis tombe de 1,5 à 3 heures à 20 à 40 minutes. Point critique : l'IA ne doit jamais générer des certifications ou des données d'assurance qu'elle ne connaît pas. Dans les réponses à appels d'offres publics, cela constitue une fraude et peut entraîner l'annulation du contrat.
Juridique : la précision des références, pas la rhétorique
Un cabinet de 25 avocats spécialisés en droit des affaires (région parisienne, déploiement mi-2025) a indexé 50 ans d'archives dans un système RAG hybride : embeddings vectoriels, recherche BM25 par mots-clés, index d'entités pour les références de jurisprudence. Résultat : 99,2% de précision de citation. Le temps de recherche par dossier est passé de 12 à 15 heures par semaine à moins de 2 heures. 78% des associés utilisaient l'outil chaque semaine au sixième mois.
La clé technique : un index d'entités dédié permet de retrouver "Cour de Cassation 2ème civ., 12 mars 2019" par correspondance exacte, pas par similarité vectorielle approximative. C'est un choix de conception, pas un paramètre par défaut des plateformes RAG du marché.
Immobilier : des centaines de pages interrogées en quelques secondes
Les équipes de développement immobilier qui indexent leurs mémorandums d'offre, promesses de vente, rapports environnementaux de phase I et engagements de titre peuvent interroger des centaines de pages en langage naturel. "Quelles sont les conditions de perte des arrhes dans la promesse ?" La réponse arrive en quelques secondes, à la place d'une revue paralégale de plusieurs heures.
Médical et santé : protocoles et codes actes accessibles en temps réel
Une clinique privée de 80 lits (région lyonnaise, déploiement fin 2025) a déployé un assistant formé sur ses propres protocoles de soin, son formulaire médicamenteux et ses codes de remboursement CCAM et NGAP. La version orientée patient explique les procédures de prise de rendez-vous. La version équipe récupère les codes actes. La disponibilité permanente réduit le volume d'appels administratifs répétitifs sans que le modèle soit exposé aux données personnelles des patients.
Ce qui rate en production, et comment l'éviter
Le schéma d'échec le plus courant : une équipe charge 50 PDF internes, obtient des démos impressionnantes, déploie à son équipe, et deux semaines plus tard l'assistant donne des réponses fausses sur ses propres politiques internes. L'équipe conclut que l'IA hallucine. Ce diagnostic est presque toujours incorrect.
Vous voulez tester un assistant IA sur votre propre jargon métier ? Je vous montre l'approche adaptée en 30 min.
Réserver un appel gratuitLa cause réelle, dans la grande majorité des cas, est la stratégie de découpage des documents : le chunking. Quand vos documents sont découpés à intervalles fixes, par exemple tous les 512 tokens, une règle métier et son exception se retrouvent dans deux chunks séparés. Le système de récupération trouve la règle ("les remboursements sont traités sous 5 jours") mais pas l'exception dans le chunk adjacent ("sauf pour les achats effectués pendant une période promotionnelle, qui nécessitent 21 jours"). Le modèle génère une réponse fausse avec confiance, parce qu'il a reçu un contexte incomplet. Ce n'est pas une hallucination : c'est un échec de récupération.
Le correctif, validé par le cas juridique ayant atteint 99,2% de précision, tient en deux décisions :
- Passer au chunking sémantique : découpez vos documents en respectant les limites de paragraphes et de sections, pas les comptes de caractères. La règle et son exception restent dans le même chunk, car elles appartiennent au même bloc logique.
- Implémenter la récupération hybride : combinez la recherche vectorielle (similarité sémantique) et la recherche BM25 (mots-clés exacts). La récupération hybride surpasse systématiquement la recherche vectorielle seule pour la précision factuelle dans les corpus spécialisés.
Ce problème se produit avec toutes les plateformes RAG majeures, qu'il s'agisse de CustomGPT, Chatbase ou d'une architecture sur mesure. C'est une décision de conception à prendre avant d'ingérer vos documents, pas après.
Conformité RGPD et AI Act : ce que vous devez faire avant de déployer
Depuis le 2 août 2026, l'article 50 de l'AI Act européen est opposable : toute entreprise déployant un chatbot IA doit informer explicitement ses utilisateurs finaux qu'ils interagissent avec un système IA. Cela s'applique aux déploiements orientés clients. Les outils internes ont plus de latitude, mais ne sont pas entièrement exemptés.
La CNIL considère les AIPD (analyses d'impact relatives à la protection des données) légalement requises pour la plupart des systèmes IA traitant des données personnelles. Si votre base RAG ingère des dossiers clients, des données salariés ou toute autre donnée personnelle, une AIPD s'impose avant déploiement.
Ce que vous devez faire avant de déployer
- Vérifier si une AIPD est requise : tout traitement de données personnelles (dossiers clients, données salariés) l'exige.
- Anonymiser les données sensibles dans les documents indexés dans votre base RAG avant ingestion.
- Informer vos utilisateurs finaux qu'ils interagissent avec une IA (AI Act, article 50, depuis le 2 août 2026).
- Opter pour un hébergement européen si votre activité est soumise à des exigences de souveraineté : OVHcloud AI Solutions ou Mistral AI pour l'inférence hébergée en UE.
Questions fréquentes
Le RAG (Retrieval-Augmented Generation) connecte un modèle de langage à une base documentaire externe. Quand vous posez une question, le système récupère d'abord les passages pertinents dans vos documents, puis les transmet au modèle pour qu'il génère une réponse ancrée dans votre contexte réel. Contrairement au fine-tuning, le RAG ne modifie pas le modèle : il lui donne un accès dynamique à vos informations à jour, avec citation des sources à l'appui.
Cela dépend de l'approche. Un system prompt enrichi via Claude Teams coûte 25 euros par utilisateur et par mois, sans frais de mise en place. Un système RAG no-code (CustomGPT.ai, Chatbase) coûte entre 24 et 400 euros par mois selon le volume. Un RAG sur mesure représente entre 7 500 et 13 200 euros de mise en place, puis 650 à 1 750 euros par mois d'exploitation selon Stratagem Systems. Le fine-tuning n'est plus accessible en libre-service aux nouveaux utilisateurs OpenAI depuis mai 2026.
Le RAG connecte l'IA à vos documents en temps réel : elle récupère les passages pertinents et répond en s'appuyant dessus, avec citation des sources. Le fine-tuning modifie le modèle lui-même par un réentraînement sur vos données. Le RAG est plus flexible (mise à jour des documents sans réentraîner le modèle), moins coûteux, et recommandé par OpenAI lui-même comme alternative depuis mai 2026. Le fine-tuning reste utile dans des cas très spécifiques comme la syntaxe propriétaire ou la classification précise sur données annotées, mais rarement justifié pour un assistant métier généraliste.
Oui, pour les deux premières approches. Claude Teams (25 euros par siège et par mois) permet de créer un assistant avec system prompt persistant et fichiers de connaissance partagés, sans aucun code. Pour le RAG, CustomGPT.ai et Chatbase proposent des interfaces no-code avec ingestion de PDF et de sites web. Un développeur devient nécessaire pour un RAG sur mesure avec base vectorielle, chunking sémantique et récupération hybride, ce qui correspond aux projets à fort enjeu documentaire (plusieurs milliers de documents, précision critique).
Oui. Depuis le 2 août 2026, l'AI Act impose d'informer les utilisateurs finaux qu'ils interagissent avec une IA (article 50). Si votre assistant traite des données personnelles (dossiers clients, données salariés), une AIPD est requise par la CNIL avant déploiement. Les documents indexés dans le RAG doivent respecter le principe de minimisation des données. Pour les informations sensibles, envisagez un hébergement européen (OVHcloud, Mistral AI).
Avec Chatbase, 30 à 60 minutes suffisent pour une base de 20 documents. Un système RAG no-code complet peut être opérationnel en une journée. Un RAG sur mesure avec chunking sémantique, récupération hybride et index d'entités prend de 1 à 6 mois selon le volume documentaire et la complexité des règles métier. Le cas du cabinet juridique ayant atteint 99,2% de précision de citation a nécessité 6 mois d'implémentation.
Les secteurs avec un volume élevé de documents internes structurés (contrats, protocoles, normes, références réglementaires) et une terminologie technique précise. En France, le BTP est le secteur le moins équipé (12% d'adoption, BPI France Le Lab) et présente le potentiel de gain le plus immédiat. Le juridique, l'immobilier et la santé présentent des cas d'usage documentés avec des gains de productivité mesurables. Les secteurs à faible intensité documentaire bénéficient davantage d'un system prompt enrichi que d'un RAG complet.
Les deux fonctionnent. Claude présente un avantage pratique pour les assistants à system prompt important : le prompt caching réduit le coût des requêtes répétitives à 10% du tarif standard. Pour une PME qui intègre un contexte métier dense (4 000 à 8 000 tokens), l'économie est significative à l'échelle. Claude Sonnet 5 est à 2 dollars par million de tokens en entrée jusqu'au 31 août 2026, Claude Haiku 4.5 à 1 dollar. OpenAI reste une option viable, mais a fermé son API de fine-tuning en libre-service en mai 2026 aux nouveaux utilisateurs. Le choix dépend surtout des outils no-code que vous utilisez déjà.
Discutons de votre projet, appel découverte gratuit de 30 minutes.
L'appel dure 30 minutes. Je pose 5 questions sur votre activité et vous repartez avec une recommandation d'approche chiffrée.
Prendre rendez-vousSans engagement. Vos informations ne sont pas partagées.