souverainete donnees

CNIL, AI Act 2026 : l'IA souveraine passe le contrôle de conformité

Depuis le 26 août 2026, la CNIL trace la généalogie des modèles IA. Pourquoi l'IA privée hébergée en France répond nativement à l'AI Act et au RGPD.

RAGbase Legal Research Team1 septembre 2026 10 min de lecture

Le 2 août 2026, un cabinet parisien de 80 avocats spécialisé en droit social a reçu une demande d'information de la CNIL concernant l'outil d'aide à la présélection de candidats qu'il utilisait pour ses propres recrutements. Le fournisseur du logiciel RH, un éditeur américain, n'a pas pu produire de fiche de généalogie du modèle sous-jacent : origine des données d'entraînement, historique de fine-tuning, chaîne de responsabilité. Le cabinet, lui, s'est retrouvé exposé — non pas comme éditeur du système, mais comme déployeur d'un système à haut risque au sens de l'annexe III de l'AI Act, avec une obligation de documentation qu'il ne pouvait pas honorer. Ce scénario, qui n'a rien de théorique depuis que les obligations renforcées de l'AI Act sont pleinement applicables, illustre un basculement : la traçabilité des modèles d'IA n'est plus un sujet de conformité fournisseur, elle devient une responsabilité de premier rang pour tout cabinet ou direction juridique qui déploie ou recommande de l'IA.

Le 26 août 2026, la CNIL a publié une nouvelle version de son démonstrateur permettant d'explorer la généalogie des modèles d'IA open source. Ce n'est pas un simple outil pédagogique : c'est la matérialisation d'une doctrine de contrôle qui va structurer les audits des deux prochaines années. Pour les cabinets d'avocats qui ont fait de l'IA générative un outil de production quotidien, comprendre cette doctrine — et l'architecture technique qui y répond nativement — devient un enjeu de risque, pas seulement de conformité.

Ce qui change concrètement depuis août 2026

Deux événements convergent et doivent être lus ensemble.

Premier fait : la CNIL a une compétence de contrôle élargie. Depuis le 2 août 2026, les obligations du règlement européen sur l'IA pour les systèmes à haut risque sont pleinement applicables. Cela concerne les systèmes listés à l'annexe III : biométrie, emploi et gestion des travailleurs, accès à l'éducation, migration et asile, usages répressifs. Les sanctions prévues sont lourdes — jusqu'à 35 millions d'euros ou 7 % du chiffre d'affaires mondial pour les manquements les plus graves. La CNIL devient autorité de surveillance du marché pour une large part de ces systèmes, ce qui signifie qu'elle articule désormais ses contrôles entre RGPD et AI Act dans un même mouvement d'enquête. Un contrôle qui commence par une question de protection des données personnelles peut se prolonger par une vérification de conformité AI Act, et inversement.

Second fait : la CNIL outille sa doctrine de traçabilité. Le démonstrateur mis à jour le 26 août 2026 permet d'explorer la généalogie des modèles d'IA open source — comprendre de quel modèle de base un système dérive, quelles données et quels fine-tunings ont été appliqués en aval. C'est un signal clair : pour la CNIL, la capacité à retracer l'origine et les transformations d'un modèle devient un critère d'évaluation central, aligné avec les exigences de documentation technique et de tenue de logs de l'AI Act (notamment ses dispositions sur la journalisation et la traçabilité pour les systèmes à haut risque, mais dont l'esprit irrigue désormais l'ensemble de la doctrine de contrôle).

La combinaison des deux fait apparaître un principe simple : on ne peut plus se contenter de faire confiance à un fournisseur d'IA sur parole. Il faut pouvoir documenter, pour chaque système utilisé, sa généalogie, ses flux de données, et la chaîne de responsabilité qui s'y attache.

Pourquoi le modèle propriétaire fermé devient un point de friction en contrôle

La plupart des grands LLM utilisés dans les cabinets — GPT d'OpenAI, Claude d'Anthropic, Gemini de Google — sont des modèles propriétaires fermés. Leurs éditeurs ne publient ni les données d'entraînement complètes, ni le détail des étapes de fine-tuning, ni une généalogie technique exploitable par un tiers. Ce n'est pas un défaut de qualité — ces modèles figurent parmi les plus performants du marché — mais une opacité structurelle qui devient un problème de conformité documentaire lorsqu'un contrôleur CNIL demande : « pouvez-vous nous montrer d'où vient ce modèle, quelles données l'ont entraîné, et quelles garanties existent sur leur licéité ? »

Un cabinet qui a bâti son infrastructure IA autour d'un SaaS propriétaire américain se retrouve, en cas de contrôle, en position de dépendance totale vis-à-vis de la documentation que l'éditeur veut bien fournir — et cette documentation reste, à ce jour, largement standardisée et non spécifique au contexte réglementaire français. C'est un point aveugle rarement anticipé lors du choix d'un outil, mais qui devient central dès qu'un cabinet touche, même indirectement, à des usages sensibles : conseil en droit social avec outils d'aide à la décision RH, pratique en droit des étrangers appuyée par des outils de scoring, conseil éducatif ou accompagnement d'établissements scolaires.

À l'inverse, un modèle open source — ou un système bâti sur une architecture documentée — permet de produire une fiche de généalogie exploitable : base de modèle, jeux de données de pré-entraînement identifiés, historique des fine-tunings appliqués. C'est exactement ce que le démonstrateur de la CNIL formalise et rend consultable.

Ce qui doit rester chez le cabinet, ce qui peut en sortir

La distinction pertinente n'est pas « tout reste en interne » contre « tout part vers le cloud ». Elle est architecturale, et c'est là que se joue la vraie différence de risque.

Une architecture d'IA privée pour cabinet d'avocats peut parfaitement s'appuyer sur un fournisseur LLM externe — Mistral, OpenAI, Anthropic — pour la génération de texte. Ce n'est pas un renoncement à la souveraineté, c'est un choix pragmatique de performance. La question qui compte est : qu'est-ce qui quitte réellement l'infrastructure du cabinet, et qu'est-ce qui y reste sous contrôle ?

ComposantReste sur l'infrastructure du cabinetPeut quitter vers un LLM tiers
Documents clients complets✅ Toujours❌ Jamais
Index et vector stores✅ Toujours❌ Jamais
Permissions et contrôle d'accès✅ Toujours❌ Jamais
Logs d'audit et traçabilité des requêtes✅ Toujours❌ Jamais
Orchestration agentique et workflows✅ Toujours❌ Jamais
Extraits minimisés nécessaires à une réponse—✅ Selon les conditions API choisies

Cette séparation change radicalement la posture en cas de contrôle. Le cabinet peut démontrer, document à l'appui, quel fragment de texte a été envoyé, à quel modèle, à quelle date, par quel utilisateur, sous quelle permission — parce que l'intégralité de cette chaîne est journalisée et hébergée localement. C'est précisément la logique de généalogie et de traçabilité que la CNIL formalise avec son démonstrateur, appliquée non pas au modèle lui-même, mais à l'ensemble de la chaîne de traitement documentaire du cabinet.

Comparatif des architectures face à l'exigence de traçabilité

SolutionArchitectureDonnées envoyées à l'extérieurTraçabilité modèleCoût
HarveySaaS cloud, LLM propriétaireDocuments et requêtes selon contratLimitée, dépendante de l'éditeur1 000–1 200 USD/utilisateur/mois
CoCounsel (Thomson Reuters)SaaS cloudRequêtes et extraitsLimitée250–500 USD/utilisateur/mois
Lexis+ ProtégéSaaS cloudRequêtes et extraitsLimitée500–1 000+ USD/utilisateur/mois
Claude Cowork / ChatGPT EntrepriseSaaS cloud, orchestration chez l'éditeurDocuments, workflows, contexte agentiqueNon exploitable par le clientOrdre de grandeur 200–400 USD/utilisateur/mois
RAGbase Legal (on-premise)Orchestration, index, permissions, logs chez le cabinet ; LLM au choix (interne ou API tierce)Extraits minimisés uniquement, si LLM externe choisiTraçable de bout en bout, auditable20–50 k$ one-time

Ce tableau ne dit pas que les solutions cloud sont non conformes — plusieurs opèrent des efforts sérieux de contractualisation RGPD et de résidence des données. Il dit que la charge de la preuve, en cas de contrôle CNIL portant sur la généalogie d'un modèle ou la traçabilité d'un traitement, repose sur des éléments que le cabinet ne maîtrise pas lorsque l'orchestration entière — y compris les workflows, les connecteurs et le contexte agentique — est hébergée et opérée par l'éditeur.

L'argument économique : conformité et TCO se rejoignent

Le raisonnement ne doit pas rester théorique. Harvey, avec environ 100 000 avocats utilisateurs, 144 millions de dollars d'ARR et une valorisation de 8 milliards de dollars fin 2025, illustre l'ampleur du marché et la vitesse d'adoption des outils IA dans la profession. Mais une étude Stanford a mesuré un taux d'hallucination d'1 réponse sur 6 sur cet outil — un chiffre qui rappelle que la performance perçue d'un outil n'épuise pas la question de la fiabilité documentaire exigée par un régulateur.

À l'inverse, des déploiements privés existants montrent qu'une architecture maîtrisée n'est pas un compromis de performance. Le cas El Murshid, avec 26 000 dossiers indexés et un gain mesuré de 5 à 70 % de temps de rédaction selon les tâches, démontre qu'une infrastructure documentaire privée, bien indexée via une recherche de jurisprudence IA dédiée, produit des résultats opérationnels tangibles sans dépendre d'un modèle de licence par siège à coût récurrent.

Sur le plan strictement financier, un modèle à 20-50 k$ one-time pour une infrastructure on-premise se compare favorablement, à l'échelle d'un cabinet de 50 à 150 avocats, aux abonnements cumulés de solutions à 250-1 200 USD par utilisateur et par mois. Mais l'argument décisif, dans le contexte réglementaire actuel, n'est plus seulement le coût total de possession — c'est le coût évité en cas de contrôle. Une sanction AI Act peut atteindre 35 millions d'euros ou 7 % du chiffre d'affaires mondial ; même un contrôle sans sanction représente un coût interne significatif en temps de mobilisation juridique et technique si la documentation de traçabilité n'existe pas.

Ce que les DSI et associés gérants doivent auditer maintenant

La mise à jour du démonstrateur CNIL n'est pas un événement isolé, c'est un point de départ pour un audit interne. Cinq actions concrètes :

  • Cartographier les usages IA à risque dans le cabinet et chez les clients conseillés — recrutement interne, outils d'aide à la décision RH, conseil en droit des étrangers, accompagnement d'établissements éducatifs.
  • Exiger de chaque fournisseur IA une fiche de généalogie du modèle : base de modèle, données de pré-entraînement identifiables, historique de fine-tuning, conditions de licence.
  • Vérifier la localisation et le contrôle des logs : qui héberge les journaux d'audit des requêtes IA, et le cabinet peut-il les exporter et les produire en cas de contrôle sans dépendre du bon vouloir de l'éditeur ?
  • Tester le démonstrateur de la CNIL sur les modèles open source effectivement utilisés ou envisagés, pour objectiver le niveau de traçabilité disponible avant tout arbitrage fournisseur.
  • Documenter précisément le flux de données sortantes vers les API de LLM tiers : quels champs, quelle minimisation, quelle base légale, quelle durée de conservation côté fournisseur.

Ce travail d'audit, détaillé dans notre guide IA pour cabinets, doit désormais figurer à l'agenda des comités de risque au même titre que la cybersécurité ou la conformité anti-blanchiment.

Ce qu'il faut anticiper pour 2027

La doctrine de la CNIL va vraisemblablement s'étendre au-delà du périmètre strict de l'annexe III. L'articulation annoncée entre RGPD et AI Act signifie que les critères de traçabilité et de généalogie des modèles, aujourd'hui pensés pour les systèmes à haut risque, deviendront progressivement une référence de bonnes pratiques opposable dans tout contrôle touchant à l'IA, y compris pour des usages de recherche juridique ou de rédaction assistée qui ne relèvent pas formellement de l'annexe III. Les cabinets qui attendent une classification réglementaire explicite avant d'agir prennent un risque de calendrier : la doctrine de contrôle précède souvent la clarification légale.


Avant le prochain cycle d'audit ou de renouvellement contractuel IA, il vaut la peine d'évaluer concrètement : quelle part de votre chaîne de traitement IA — orchestration, index, logs, permissions — reste sous votre contrôle direct et documentable, et quelle part dépend de la documentation que votre éditeur voudra bien produire en cas de contrôle CNIL. C'est cette réponse, plus que le choix d'un outil en particulier, qui déterminera votre exposition réglementaire en 2027.

Questions fréquentes

Un cabinet d'avocats est-il concerné par les obligations IA à haut risque de l'AI Act ?
Directement, peu de cabinets opèrent des systèmes classés Annexe III (biométrie, emploi, migration, éducation, usages répressifs). Mais dès qu'un cabinet utilise un outil d'aide au recrutement, de scoring RH ou conseille des clients dans ces secteurs, la doctrine de contrôle de la CNIL — qui articule désormais RGPD et AI Act — s'applique à la chaîne de traitement des données, y compris aux outils d'IA générative utilisés en interne.
Que permet exactement le démonstrateur de traçabilité de la CNIL mis à jour le 26 août 2026 ?
Il permet d'explorer la généalogie des modèles d'IA open source : de quelle base un modèle dérive, quels jeux de données et fine-tunings ont été appliqués, et quelles obligations de documentation en découlent. C'est un outil de référence pour évaluer si un fournisseur peut produire une chaîne de traçabilité auditable, condition de plus en plus attendue en contrôle.
Une IA privée on-premise garantit-elle à elle seule la conformité RGPD et AI Act ?
Non, la conformité reste une obligation de gouvernance, pas un simple choix d'infrastructure. Mais héberger l'orchestration, les index documentaires, les permissions et les logs sur l'infrastructure du cabinet — en n'envoyant au LLM que des extraits minimisés — facilite considérablement la production des preuves de traçabilité exigées lors d'un contrôle CNIL.
R
RAGbase Legal Research Team
Recherche

RAGbase construit des systèmes d'IA privés pour les cabinets d'avocats : déployés sur l'infrastructure du cabinet, zéro rétention de données, propriété complète.

Voyez RAGbase sur vos propres données

30 minutes en visio. Nous cadrons votre besoin et montrons le système en direct.

Nous utilisons des cookies de mesure d'audience et de marketing (Google Analytics, LinkedIn). Aucun traceur ne se charge sans votre accord. En savoir plus