Un assistant documentaire IA ne doit pas ouvrir indistinctement toute la documentation de l’entreprise. Le bon point de départ consiste à définir quels documents sont autorisés, pour quels usages, par quels profils et avec quelles règles de mise à jour. À Marseille comme ailleurs, ce cadrage précède le choix de l’outil : il réduit les réponses fondées sur une mauvaise version, évite d’exposer inutilement des informations sensibles et donne aux équipes une méthode de contrôle compréhensible.
Ce guide propose une démarche de décision pour une direction, un responsable métier, une DSI ou un référent IA. Il traite du corpus et des droits d’accès, sans refaire le choix entre chatbot, copilote et RAG. L’objectif est de préparer une formation, un audit ou un accompagnement à partir d’un périmètre documentaire réellement maîtrisé.

Pourquoi commencer par le corpus autorisé ?
Un assistant documentaire répond à partir d’un ensemble de contenus mis à sa disposition : procédures, modes opératoires, contrats types, notices, référentiels, comptes rendus ou bases de connaissances. Une architecture de type RAG peut rechercher des passages pertinents avant de les transmettre au modèle. Pour comprendre cette place dans l’architecture globale, consultez le guide consacré au choix entre chatbot, copilote et RAG dans une formation IA à Marseille.
La question utile n’est donc pas seulement « quels fichiers avons-nous ? », mais « lesquels une personne donnée est-elle autorisée à consulter pour cette tâche ? ». Appliquez un principe de besoin d’en connaître lorsque des sources internes sensibles peuvent être interrogées. Cette méthode traite le corpus comme un périmètre gouverné, et non comme un simple dossier à indexer.
Cette distinction évite trois confusions. Premièrement, un document accessible sur le réseau interne n’est pas automatiquement destiné à l’assistant. Deuxièmement, une version récente n’est pas nécessairement validée. Troisièmement, une réponse accompagnée d’une référence reste à relire : la présence d’une source ne garantit ni que le bon passage a été sélectionné, ni que la question a été correctement interprétée.
Définir le besoin avant de collecter les documents
Commencez par une tâche précise. Par exemple : retrouver la procédure applicable à une demande client, préparer une synthèse d’un dossier technique, orienter un collaborateur vers un mode opératoire ou comparer deux versions d’une règle interne. Décrivez ensuite la décision humaine qui suit la réponse. Cette étape délimite ce que l’assistant doit faire et, surtout, ce qu’il ne doit pas faire.
Pour intégrer ce chantier dans une démarche plus large, la page cadrer un programme de formation IA en entreprise à Marseille aide à distinguer les publics, les usages et les compétences attendues. Le corpus documentaire devient alors un support pédagogique concret : les participants apprennent à sélectionner, interroger et vérifier les informations autorisées au lieu de manipuler des exemples abstraits.
Formalisez une fiche d’usage avec six éléments : utilisateur visé, question autorisée, documents nécessaires, données exclues, résultat attendu et contrôle humain. Si deux métiers n’ont pas les mêmes droits ou les mêmes décisions à prendre, créez deux fiches. Cette séparation est souvent plus claire qu’un assistant généraliste doté d’exceptions nombreuses et difficiles à expliquer.
Classer les documents avec une matrice de décision
Une revue documentaire associe chaque famille de contenus à un propriétaire, une sensibilité, une validité et un public. Le tableau suivant fournit une méthode éditoriale de classement à adapter avec les responsables métier, sécurité et protection des données.
| Catégorie | Décision de corpus | Contrôle recommandé | Exemple de risque |
|---|---|---|---|
| Procédure validée et courante | Inclure pour les profils concernés | Propriétaire et date de révision | Réponse fondée sur une version remplacée |
| Brouillon ou note de travail | Exclure par défaut | Validation avant indexation | Confondre une hypothèse avec une règle |
| Document contractuel | Inclure seulement si l’usage le justifie | Droits par rôle et journal de versions | Exposition à un utilisateur non habilité |
| Données personnelles | Minimiser, anonymiser ou exclure | Analyse avec le référent compétent | Traitement excessif ou divulgation |
| Archive | Séparer du corpus courant | Recherche explicite dans l’historique | Application d’une consigne obsolète |
| Source externe | Autoriser au cas par cas | Origine, date et conditions d’usage | Information non maîtrisée ou périmée |
Le statut « exclu » n’est pas une suppression. Il signifie que le document ne doit pas alimenter cet usage. Il peut rester nécessaire à une autre équipe, à une obligation d’archivage ou à un traitement distinct. Conservez donc la décision, sa justification et le responsable qui peut la réexaminer.

Appliquer les droits d’accès au moment de la recherche
Copier un espace documentaire entier dans une base séparée peut rompre les règles d’accès existantes. Le dispositif doit donc préciser comment l’identité de l’utilisateur, son rôle et son périmètre sont pris en compte au moment de rechercher les passages. Fixez comme objectif de conception qu’une réponse ne révèle ni l’existence ni le contenu d’un document que cette personne ne peut pas consulter par le canal normal.
Demandez au fournisseur ou à l’équipe technique de montrer le parcours complet : source d’origine, synchronisation, index, requête, passages récupérés, réponse et journaux. Vérifiez ce qui arrive lorsqu’un collaborateur change d’équipe, lorsqu’un droit est retiré ou lorsqu’un document est reclassé. Une démonstration nominale ne remplace pas un test avec plusieurs profils, dont un profil volontairement non autorisé.
La prudence concerne aussi les connecteurs. L’ANSSI recommande de limiter les interactions avec les autres composants du système d’information au strict besoin opérationnel. En pratique, un assistant conçu pour consulter des procédures n’a pas à disposer d’un droit d’écriture dans l’outil source. Séparez la recherche, la génération d’une proposition et toute action qui modifierait un système métier.
Organiser les versions, les retraits et la traçabilité
Un corpus gouverné possède un cycle de vie. Chaque document devrait avoir un propriétaire, un statut, une date de validation et, si nécessaire, une échéance de revue. Définissez comment une nouvelle version remplace l’ancienne, combien de temps la synchronisation prend et comment retirer rapidement un contenu erroné. Prévoyez aussi le traitement des doublons : deux procédures presque identiques peuvent produire une réponse ambiguë.
La traçabilité utile ne consiste pas à accumuler des journaux sans finalité. Elle doit permettre de comprendre quelles sources ont appuyé une réponse, quelle version était disponible et quel profil a effectué la demande. Les durées de conservation et les accès aux journaux doivent être cadrés avec les personnes compétentes. Le but est de faciliter l’analyse d’un incident et l’amélioration du service sans créer un nouveau stock de données incontrôlé.
La CNIL recommande de définir les conditions d’usage de l’outil, les pratiques de vérification et les précautions de confidentialité. Une charte courte peut traduire ces règles en gestes quotidiens : choisir le bon espace, ne pas déposer un fichier hors périmètre, lire les passages cités, signaler une version douteuse et ne pas transformer une réponse en décision automatique.
Tester l’assistant avant un élargissement
Construisez un jeu de questions représentatif avec les experts métier. Il doit contenir des questions simples, des formulations ambiguës, des cas sans réponse dans le corpus et des demandes portant sur des documents interdits. Pour chaque test, notez la réponse attendue, la source autorisée et le comportement souhaité lorsque l’information manque.
Le test doit vérifier au moins quatre dimensions : la pertinence des passages retrouvés, le respect des droits, l’indication claire de l’incertitude et la possibilité de remonter au document. Un bon comportement peut être un refus explicite : « je ne dispose pas d’une source autorisée pour répondre ». Cette limite est préférable à une réponse plausible mais non fondée.
La compétence de vérification mérite un entraînement distinct. Le guide apprendre à vérifier les réponses d’un assistant IA propose une méthode centrée sur les affirmations, les sources et le niveau de risque. Ici, appliquez cette méthode aux documents internes autorisés, avec des scénarios issus du travail réel mais expurgés des informations qui ne doivent pas être utilisées en formation.
Checklist de cadrage du corpus
- Une tâche et une décision humaine sont décrites pour chaque usage.
- Les propriétaires des familles documentaires sont identifiés.
- Les contenus validés, brouillons, archives et sources externes sont séparés.
- Les données confidentielles, personnelles ou stratégiques font l’objet d’une décision explicite.
- Les droits sont testés avec plusieurs profils, y compris un profil non habilité.
- Le retrait d’un droit et d’un document est testé de bout en bout.
- Les versions et dates de validation restent visibles ou traçables.
- L’assistant sait signaler l’absence de source autorisée.
- Les utilisateurs savent ouvrir la source et contrôler la réponse.
- Un responsable reçoit les signalements et arbitre les corrections.
Passer du pilote au déploiement
Un pilote utile reste volontairement étroit : une équipe, une tâche, un corpus limité et des critères de décision connus. Il permet d’observer les erreurs de classement, les questions sans réponse et les difficultés d’usage. L’élargissement intervient seulement après correction de ces points et nouvelle validation des droits.
Le cadrage peut mobiliser plusieurs formats. Une formation développe les compétences des utilisateurs et des responsables de corpus. Un audit examine l’existant, les accès, les risques et les écarts. Un accompagnement organise les choix, les tests et la gouvernance sur la durée. Le guide cadrer une mission de déploiement IA à Marseille aide à distinguer ces contributions avant de fixer un calendrier.
Ne mesurez pas seulement le nombre de réponses. Suivez des indicateurs reliés au travail : questions correctement orientées vers une source autorisée, réponses refusées faute de preuve, signalements de documents obsolètes, délais de correction et compréhension des règles par les utilisateurs. Ces mesures servent à piloter le dispositif ; elles ne démontrent pas à elles seules un gain économique.

Questions fréquentes
Faut-il indexer tous les documents pour ne rien manquer ?
Non. La couverture maximale n’est pas l’objectif. Le corpus doit correspondre à la tâche et aux droits des utilisateurs. Commencez par les sources validées indispensables, puis élargissez après les tests.
Un RAG garantit-il que la réponse est exacte ?
Non. Il peut rapprocher la réponse de passages documentaires sélectionnés, mais la recherche peut retenir un passage incomplet ou une mauvaise version. La lecture de la source et le contrôle humain restent nécessaires.
Peut-on utiliser des documents contenant des données personnelles ?
La réponse dépend de la finalité, de la nécessité et du cadre applicable. Il faut identifier ces données, les minimiser et faire valider le traitement par les responsables compétents. Le présent guide ne remplace pas une analyse juridique ou de protection des données.
Qui doit valider le corpus ?
Le propriétaire métier confirme l’utilité et la validité des documents ; les responsables des accès, de la sécurité et de la protection des données interviennent selon le périmètre. Une seule validation technique n’est pas suffisante.
Conclusion : un assistant limité est plus gouvernable
Limiter le corpus ne réduit pas l’ambition du projet. Cela transforme une idée générale en service compréhensible : des utilisateurs identifiés, des sources autorisées, des droits testés, des versions maîtrisées et un contrôle humain. Cette base permet ensuite de choisir l’architecture et d’élargir progressivement les usages sans perdre la maîtrise documentaire.
Pour discuter d’une formation, d’un audit ou d’un accompagnement à Marseille, vous pouvez présenter à iSoluce un exemple de tâche, trois familles documentaires et les profils qui doivent — ou ne doivent pas — y accéder.
Sources
- CNIL, Utiliser l’IA générative dans les TPE et PME.
- ANSSI via MesServicesCyber, Recommandations de sécurité pour un système d’IA générative.