Le 2 août 2026, un cabinet parisien de 80 avocats spécialisé en droit social a reçu une demande d'information de la CNIL concernant l'outil d'aide à la présélection de candidats qu'il utilisait pour ses propres recrutements. Le fournisseur du logiciel RH, un éditeur américain, n'a pas pu produire de fiche de généalogie du modèle sous-jacent : origine des données d'entraînement, historique de fine-tuning, chaîne de responsabilité. Le cabinet, lui, s'est retrouvé exposé — non pas comme éditeur du système, mais comme déployeur d'un système à haut risque au sens de l'annexe III de l'AI Act, avec une obligation de documentation qu'il ne pouvait pas honorer. Ce scénario, qui n'a rien de théorique depuis que les obligations renforcées de l'AI Act sont pleinement applicables, illustre un basculement : la traçabilité des modèles d'IA n'est plus un sujet de conformité fournisseur, elle devient une responsabilité de premier rang pour tout cabinet ou direction juridique qui déploie ou recommande de l'IA.
Le 26 août 2026, la CNIL a publié une nouvelle version de son démonstrateur permettant d'explorer la généalogie des modèles d'IA open source. Ce n'est pas un simple outil pédagogique : c'est la matérialisation d'une doctrine de contrôle qui va structurer les audits des deux prochaines années. Pour les cabinets d'avocats qui ont fait de l'IA générative un outil de production quotidien, comprendre cette doctrine — et l'architecture technique qui y répond nativement — devient un enjeu de risque, pas seulement de conformité.
Ce qui change concrètement depuis août 2026
Deux événements convergent et doivent être lus ensemble.
Premier fait : la CNIL a une compétence de contrôle élargie. Depuis le 2 août 2026, les obligations du règlement européen sur l'IA pour les systèmes à haut risque sont pleinement applicables. Cela concerne les systèmes listés à l'annexe III : biométrie, emploi et gestion des travailleurs, accès à l'éducation, migration et asile, usages répressifs. Les sanctions prévues sont lourdes — jusqu'à 35 millions d'euros ou 7 % du chiffre d'affaires mondial pour les manquements les plus graves. La CNIL devient autorité de surveillance du marché pour une large part de ces systèmes, ce qui signifie qu'elle articule désormais ses contrôles entre RGPD et AI Act dans un même mouvement d'enquête. Un contrôle qui commence par une question de protection des données personnelles peut se prolonger par une vérification de conformité AI Act, et inversement.
Second fait : la CNIL outille sa doctrine de traçabilité. Le démonstrateur mis à jour le 26 août 2026 permet d'explorer la généalogie des modèles d'IA open source — comprendre de quel modèle de base un système dérive, quelles données et quels fine-tunings ont été appliqués en aval. C'est un signal clair : pour la CNIL, la capacité à retracer l'origine et les transformations d'un modèle devient un critère d'évaluation central, aligné avec les exigences de documentation technique et de tenue de logs de l'AI Act (notamment ses dispositions sur la journalisation et la traçabilité pour les systèmes à haut risque, mais dont l'esprit irrigue désormais l'ensemble de la doctrine de contrôle).
La combinaison des deux fait apparaître un principe simple : on ne peut plus se contenter de faire confiance à un fournisseur d'IA sur parole. Il faut pouvoir documenter, pour chaque système utilisé, sa généalogie, ses flux de données, et la chaîne de responsabilité qui s'y attache.
Pourquoi le modèle propriétaire fermé devient un point de friction en contrôle
La plupart des grands LLM utilisés dans les cabinets — GPT d'OpenAI, Claude d'Anthropic, Gemini de Google — sont des modèles propriétaires fermés. Leurs éditeurs ne publient ni les données d'entraînement complètes, ni le détail des étapes de fine-tuning, ni une généalogie technique exploitable par un tiers. Ce n'est pas un défaut de qualité — ces modèles figurent parmi les plus performants du marché — mais une opacité structurelle qui devient un problème de conformité documentaire lorsqu'un contrôleur CNIL demande : « pouvez-vous nous montrer d'où vient ce modèle, quelles données l'ont entraîné, et quelles garanties existent sur leur licéité ? »
Un cabinet qui a bâti son infrastructure IA autour d'un SaaS propriétaire américain se retrouve, en cas de contrôle, en position de dépendance totale vis-à-vis de la documentation que l'éditeur veut bien fournir — et cette documentation reste, à ce jour, largement standardisée et non spécifique au contexte réglementaire français. C'est un point aveugle rarement anticipé lors du choix d'un outil, mais qui devient central dès qu'un cabinet touche, même indirectement, à des usages sensibles : conseil en droit social avec outils d'aide à la décision RH, pratique en droit des étrangers appuyée par des outils de scoring, conseil éducatif ou accompagnement d'établissements scolaires.
À l'inverse, un modèle open source — ou un système bâti sur une architecture documentée — permet de produire une fiche de généalogie exploitable : base de modèle, jeux de données de pré-entraînement identifiés, historique des fine-tunings appliqués. C'est exactement ce que le démonstrateur de la CNIL formalise et rend consultable.
Ce qui doit rester chez le cabinet, ce qui peut en sortir
La distinction pertinente n'est pas « tout reste en interne » contre « tout part vers le cloud ». Elle est architecturale, et c'est là que se joue la vraie différence de risque.
Une architecture d'IA privée pour cabinet d'avocats peut parfaitement s'appuyer sur un fournisseur LLM externe — Mistral, OpenAI, Anthropic — pour la génération de texte. Ce n'est pas un renoncement à la souveraineté, c'est un choix pragmatique de performance. La question qui compte est : qu'est-ce qui quitte réellement l'infrastructure du cabinet, et qu'est-ce qui y reste sous contrôle ?
| Composant | Reste sur l'infrastructure du cabinet | Peut quitter vers un LLM tiers |
|---|---|---|
| Documents clients complets | ✅ Toujours | ❌ Jamais |
| Index et vector stores | ✅ Toujours | ❌ Jamais |
| Permissions et contrôle d'accès | ✅ Toujours | ❌ Jamais |
| Logs d'audit et traçabilité des requêtes | ✅ Toujours | ❌ Jamais |
| Orchestration agentique et workflows | ✅ Toujours | ❌ Jamais |
| Extraits minimisés nécessaires à une réponse | — | ✅ Selon les conditions API choisies |
Cette séparation change radicalement la posture en cas de contrôle. Le cabinet peut démontrer, document à l'appui, quel fragment de texte a été envoyé, à quel modèle, à quelle date, par quel utilisateur, sous quelle permission — parce que l'intégralité de cette chaîne est journalisée et hébergée localement. C'est précisément la logique de généalogie et de traçabilité que la CNIL formalise avec son démonstrateur, appliquée non pas au modèle lui-même, mais à l'ensemble de la chaîne de traitement documentaire du cabinet.
Comparatif des architectures face à l'exigence de traçabilité
| Solution | Architecture | Données envoyées à l'extérieur | Traçabilité modèle | Coût |
|---|---|---|---|---|
| Harvey | SaaS cloud, LLM propriétaire | Documents et requêtes selon contrat | Limitée, dépendante de l'éditeur | 1 000–1 200 USD/utilisateur/mois |
| CoCounsel (Thomson Reuters) | SaaS cloud | Requêtes et extraits | Limitée | 250–500 USD/utilisateur/mois |
| Lexis+ Protégé | SaaS cloud | Requêtes et extraits | Limitée | 500–1 000+ USD/utilisateur/mois |
| Claude Cowork / ChatGPT Entreprise | SaaS cloud, orchestration chez l'éditeur | Documents, workflows, contexte agentique | Non exploitable par le client | Ordre de grandeur 200–400 USD/utilisateur/mois |
| RAGbase Legal (on-premise) | Orchestration, index, permissions, logs chez le cabinet ; LLM au choix (interne ou API tierce) | Extraits minimisés uniquement, si LLM externe choisi | Traçable de bout en bout, auditable | 20–50 k$ one-time |
Ce tableau ne dit pas que les solutions cloud sont non conformes — plusieurs opèrent des efforts sérieux de contractualisation RGPD et de résidence des données. Il dit que la charge de la preuve, en cas de contrôle CNIL portant sur la généalogie d'un modèle ou la traçabilité d'un traitement, repose sur des éléments que le cabinet ne maîtrise pas lorsque l'orchestration entière — y compris les workflows, les connecteurs et le contexte agentique — est hébergée et opérée par l'éditeur.
L'argument économique : conformité et TCO se rejoignent
Le raisonnement ne doit pas rester théorique. Harvey, avec environ 100 000 avocats utilisateurs, 144 millions de dollars d'ARR et une valorisation de 8 milliards de dollars fin 2025, illustre l'ampleur du marché et la vitesse d'adoption des outils IA dans la profession. Mais une étude Stanford a mesuré un taux d'hallucination d'1 réponse sur 6 sur cet outil — un chiffre qui rappelle que la performance perçue d'un outil n'épuise pas la question de la fiabilité documentaire exigée par un régulateur.
À l'inverse, des déploiements privés existants montrent qu'une architecture maîtrisée n'est pas un compromis de performance. Le cas El Murshid, avec 26 000 dossiers indexés et un gain mesuré de 5 à 70 % de temps de rédaction selon les tâches, démontre qu'une infrastructure documentaire privée, bien indexée via une recherche de jurisprudence IA dédiée, produit des résultats opérationnels tangibles sans dépendre d'un modèle de licence par siège à coût récurrent.
Sur le plan strictement financier, un modèle à 20-50 k$ one-time pour une infrastructure on-premise se compare favorablement, à l'échelle d'un cabinet de 50 à 150 avocats, aux abonnements cumulés de solutions à 250-1 200 USD par utilisateur et par mois. Mais l'argument décisif, dans le contexte réglementaire actuel, n'est plus seulement le coût total de possession — c'est le coût évité en cas de contrôle. Une sanction AI Act peut atteindre 35 millions d'euros ou 7 % du chiffre d'affaires mondial ; même un contrôle sans sanction représente un coût interne significatif en temps de mobilisation juridique et technique si la documentation de traçabilité n'existe pas.
Ce que les DSI et associés gérants doivent auditer maintenant
La mise à jour du démonstrateur CNIL n'est pas un événement isolé, c'est un point de départ pour un audit interne. Cinq actions concrètes :
- Cartographier les usages IA à risque dans le cabinet et chez les clients conseillés — recrutement interne, outils d'aide à la décision RH, conseil en droit des étrangers, accompagnement d'établissements éducatifs.
- Exiger de chaque fournisseur IA une fiche de généalogie du modèle : base de modèle, données de pré-entraînement identifiables, historique de fine-tuning, conditions de licence.
- Vérifier la localisation et le contrôle des logs : qui héberge les journaux d'audit des requêtes IA, et le cabinet peut-il les exporter et les produire en cas de contrôle sans dépendre du bon vouloir de l'éditeur ?
- Tester le démonstrateur de la CNIL sur les modèles open source effectivement utilisés ou envisagés, pour objectiver le niveau de traçabilité disponible avant tout arbitrage fournisseur.
- Documenter précisément le flux de données sortantes vers les API de LLM tiers : quels champs, quelle minimisation, quelle base légale, quelle durée de conservation côté fournisseur.
Ce travail d'audit, détaillé dans notre guide IA pour cabinets, doit désormais figurer à l'agenda des comités de risque au même titre que la cybersécurité ou la conformité anti-blanchiment.
Ce qu'il faut anticiper pour 2027
La doctrine de la CNIL va vraisemblablement s'étendre au-delà du périmètre strict de l'annexe III. L'articulation annoncée entre RGPD et AI Act signifie que les critères de traçabilité et de généalogie des modèles, aujourd'hui pensés pour les systèmes à haut risque, deviendront progressivement une référence de bonnes pratiques opposable dans tout contrôle touchant à l'IA, y compris pour des usages de recherche juridique ou de rédaction assistée qui ne relèvent pas formellement de l'annexe III. Les cabinets qui attendent une classification réglementaire explicite avant d'agir prennent un risque de calendrier : la doctrine de contrôle précède souvent la clarification légale.
Avant le prochain cycle d'audit ou de renouvellement contractuel IA, il vaut la peine d'évaluer concrètement : quelle part de votre chaîne de traitement IA — orchestration, index, logs, permissions — reste sous votre contrôle direct et documentable, et quelle part dépend de la documentation que votre éditeur voudra bien produire en cas de contrôle CNIL. C'est cette réponse, plus que le choix d'un outil en particulier, qui déterminera votre exposition réglementaire en 2027.
Questions fréquentes
Un cabinet d'avocats est-il concerné par les obligations IA à haut risque de l'AI Act ?
Que permet exactement le démonstrateur de traçabilité de la CNIL mis à jour le 26 août 2026 ?
Une IA privée on-premise garantit-elle à elle seule la conformité RGPD et AI Act ?
RAGbase construit des systèmes d'IA privés pour les cabinets d'avocats : déployés sur l'infrastructure du cabinet, zéro rétention de données, propriété complète.
Voyez RAGbase sur vos propres données
30 minutes en visio. Nous cadrons votre besoin et montrons le système en direct.