souverainete donnees

Genmod CNIL 2026 : pourquoi l'IA privée évite le problème

La CNIL trace la mémorisation des modèles open source avec Genmod. Découvrez pourquoi l'IA privée on-premise évite ce risque par conception dès 2026.

RAGbase Legal Research Team31 août 2026 10 min de lecture

Le 26 août 2026, la CNIL a annoncé qu'une recherche sans limite de profondeur dans son outil Genmod prend désormais environ 20 secondes. Cette information technique, presque anecdotique en apparence, dit en réalité quelque chose de beaucoup plus lourd : un régulateur français a dû construire un moteur de recherche généalogique pour savoir ce que contiennent les modèles d'IA que des milliers d'organisations utilisent déjà en production. Si la CNIL a besoin d'un outil dédié pour reconstituer a posteriori la lignée d'un modèle et vérifier s'il a mémorisé des données personnelles, c'est qu'aucun mécanisme natif ne permettait de répondre à cette question au moment du déploiement. Pour un cabinet d'avocats qui traite des données clients hautement sensibles — secret professionnel, données de santé dans des dossiers de préjudice corporel, informations financières dans du M&A —, ce constat mérite qu'on s'y arrête sérieusement.

Genmod : un outil forensique qui révèle un vide structurel

Développé avec le laboratoire d'innovation numérique de la CNIL (LINC), Genmod permet d'explorer la généalogie des modèles d'IA publiés en source ouverte : de quel modèle de base dérive tel modèle fine-tuné, quels jeux de données ont pu y être injectés, et surtout, quels indices suggèrent une mémorisation de données personnelles identifiables. L'objectif affiché est de faciliter l'exercice des droits RGPD — accès, opposition, effacement — sur des modèles qui, par nature, n'ont pas de base de données interrogeable classique : les informations sont diluées dans des milliards de paramètres.

Ce que révèle Genmod, c'est un problème d'architecture, pas seulement un problème de conformité. Un modèle de langage open source publié sur une plateforme communautaire peut avoir été fine-tuné plusieurs fois par plusieurs acteurs, chacun ajoutant potentiellement ses propres données d'entraînement, parfois sans traçabilité claire de la provenance. La CNIL a dû construire un outil d'investigation généalogique parce qu'il n'existe, pour l'essentiel de ces modèles, aucun registre fiable de ce qu'ils ont "appris" ni de la façon dont ils l'ont appris. C'est l'équivalent, pour des données personnelles, d'un système de traçabilité alimentaire qu'on installerait après la mise en rayon des produits plutôt qu'à la production.

Pour un directeur innovation ou un DSI de cabinet, la question à se poser n'est pas "est-ce que la CNIL va contrôler mon usage de tel modèle open source", mais "suis-je capable, aujourd'hui, de répondre en interne à la question que Genmod met 20 secondes à traiter de l'extérieur" ? Si la réponse nécessite de solliciter un fournisseur tiers, d'attendre une réponse à un ticket support, ou pire, de ne pas avoir d'interlocuteur du tout, le cabinet a un problème de gouvernance, indépendamment de toute sanction.

Le RGPD sur les modèles entraînés : un droit théorique, un exercice impossible

Le RGPD prévoit des droits clairs : accès, rectification, opposition, effacement. Ces droits ont été pensés pour des bases de données structurées, où une ligne correspond à une personne et peut être supprimée. Un modèle de langage ne fonctionne pas ainsi. Une donnée personnelle mémorisée pendant l'entraînement n'est pas stockée à un endroit identifiable : elle est distribuée statistiquement dans les poids du réseau. Effacer une personne d'un modèle déjà entraîné suppose, dans l'état actuel de l'art, soit un ré-entraînement coûteux, soit des techniques de "unlearning" encore expérimentales et rarement garanties.

C'est précisément le vide que Genmod tente de combler côté régulateur : identifier quels modèles, dans quelle généalogie, portent un risque de mémorisation, pour orienter les responsables de traitement et les personnes concernées. Mais du point de vue d'un cabinet d'avocats client d'un modèle tiers — qu'il s'agisse d'un modèle open source fine-tuné en interne ou d'un service cloud mutualisé s'appuyant sur des modèles propriétaires —, la charge de la preuve reste largement de son côté. Si un client demande l'effacement de ses données et que ces données ont pu, à un moment du pipeline, contribuer à l'amélioration ou au fine-tuning d'un modèle tiers, le cabinet se retrouve à devoir démontrer une négative : que ses données n'ont jamais quitté le périmètre contractuel, ou qu'elles n'ont jamais servi à l'entraînement.

La note exploratoire publiée le 20 juillet 2026 par la CNIL et le CIANum sur les risques de l'IA agentique ajoute une couche de complexité. Un agent doté d'autonomie décisionnelle, de mémoire persistante et de chaînes de traitement multi-étapes multiplie les points où une donnée personnelle peut transiter, être reformulée, stockée temporairement ou définitivement dans un contexte de session, puis potentiellement réutilisée. Plus la chaîne de traitement est opaque, plus la démonstration de conformité devient difficile — et plus le risque de contrôle, dans un contexte où l'AI Act entre en pleine application en août 2026 pour les systèmes à haut risque, devient concret pour un secteur juridique qui manipule par nature des données sensibles à grande échelle.

Ce qui change réellement selon l'architecture choisie

Il faut être honnête sur un point : opter pour une IA privée hébergée en interne ne signifie pas qu'aucune donnée ne quitte jamais l'infrastructure du cabinet. Dès lors qu'un cabinet interroge un LLM via une API — qu'il s'agisse d'un modèle propriétaire ou open source hébergé chez un tiers cloud — des extraits de texte transitent nécessairement vers ce fournisseur pour générer une réponse. La différence structurelle ne se joue pas sur ce point, mais sur ce qui reste maîtrisé et sur la nature de ce qui transite.

Dans une architecture de type IA privée pour cabinet d'avocats, l'orchestration agentique, les connecteurs vers les systèmes de gestion documentaire, l'index vectoriel constitué à partir des dossiers du cabinet, les permissions d'accès par utilisateur ou par matière, et l'intégralité des logs d'usage restent hébergés sur l'infrastructure du cabinet. Ce qui peut, le cas échéant, être envoyé au fournisseur du modèle de langage choisi par le cabinet, c'est uniquement l'extrait minimal nécessaire à la génération d'une réponse ponctuelle — un chunk de quelques centaines de mots, pas le dossier complet, pas l'historique du client, pas la base documentaire entière. Ce chunk part selon les conditions API négociées par le cabinet lui-même, pas selon les conditions générales d'un service mutualisé.

Dans un modèle SaaS par siège ou une IA généraliste cloud, c'est l'ensemble du pipeline — orchestration, mémoire de session, indexation, logique agentique — qui est géré par le fournisseur, souvent sur une infrastructure mutualisée entre des milliers de clients. Ce n'est pas nécessairement un problème de sécurité en soi : des acteurs comme Harvey, dont la base dépasse 100 000 avocats pour environ 144 millions de dollars d'ARR fin 2025, ou Thomson Reuters CoCounsel, ou Claude Cowork côté offre entreprise, investissent massivement dans la sécurité contractuelle et technique de leurs plateformes. Mais la question posée par Genmod n'est pas "le fournisseur est-il sérieux", elle est "le cabinet peut-il démontrer, à tout moment, exactement où se trouve chaque donnée personnelle traitée, et peut-il l'effacer sans dépendre du cycle de vie produit d'un tiers". Sur ce point précis, l'architecture on-premise change fondamentalement la réponse.

Tableau comparatif : traçabilité et exercice des droits RGPD

CritèreSaaS juridique par siègeAssistant IA généraliste (cloud mutualisé)IA privée on-premise
Localisation des documents completsChez le fournisseurChez le fournisseurInfrastructure du cabinet
Ce qui transite vers le LLMPipeline complet géré par le fournisseurPipeline complet géré par le fournisseurExtraits minimaux uniquement
Orchestration agentique et logsContrôlée par le fournisseurContrôlée par le fournisseurContrôlée par le cabinet
Effacement d'un dossier clientDépend du contrat et du cycle produitDépend du contrat et du cycle produitImmédiat, sur l'infrastructure du cabinet
Réponse à un contrôle CNIL sur la mémorisationNécessite l'appui du fournisseurNécessite l'appui du fournisseurAuditable directement en interne
Modèle tarifaire indicatif250-1 000+ USD/utilisateur/mois selon l'éditeurOrdres de grandeur similaires selon l'offre20-50 k$ en investissement one-time

Ce tableau ne dit pas que le SaaS mutualisé est non conforme — les grands éditeurs disposent de certifications et de clauses contractuelles robustes. Il dit que la charge de démonstration, en cas de contrôle CNIL ou d'audit AI Act, est structurellement différente selon qui détient le pipeline complet.

AI Act, contrôles CNIL 2026 : anticiper plutôt que subir

L'entrée en pleine application de l'AI Act en août 2026 place la CNIL en position d'autorité de contrôle pour les systèmes à haut risque, une catégorie qui recoupe largement les usages juridiques automatisés : aide à la décision, analyse de risque contractuel, systèmes touchant à l'accès au droit. Combinée à la note du 20 juillet 2026 sur l'IA agentique, cette évolution réglementaire dessine un cadre de contrôle qui va au-delà de la simple vérification des CGU d'un fournisseur : les autorités vont regarder les chaînes de traitement, la mémoire persistante des agents, et la capacité de l'organisation responsable à documenter chaque étape.

Pour un cabinet de 10 à 500 avocats, l'enjeu pratique se résume à trois questions qu'un audit ou un contrôle posera inévitablement :

  • Où sont physiquement stockées les données des dossiers clients utilisées pour entraîner, indexer ou interroger un système d'IA ?
  • Quelles données précises transitent vers un fournisseur tiers de modèle de langage, et sous quelles conditions contractuelles ?
  • Le cabinet peut-il exécuter une demande d'effacement ou d'opposition sans dépendre du calendrier produit d'un éditeur externe ?

Une architecture on-premise apporte une réponse directe aux deux premières questions par construction, et à la troisième par le contrôle opérationnel qu'elle confère. Ce n'est pas un argument marketing, c'est une conséquence mécanique de qui héberge quoi. Un cabinet qui a construit sa recherche de jurisprudence IA sur un index interne, alimenté par ses propres dossiers et mis à jour sous son propre contrôle, n'a pas besoin d'attendre qu'un outil comme Genmod lui dise si ses données ont fuité dans un modèle tiers : la question ne se pose pas dans les mêmes termes, parce que l'index et l'orchestration n'ont jamais quitté son périmètre.

Le calcul économique derrière la décision de gouvernance

La décision d'architecture n'est pas seulement une question de conformité, c'est aussi une question de coût total et de risque financier. Un déploiement Harvey pour un cabinet de taille moyenne, à raison de 1 000-1 200 USD par utilisateur et par mois, représente un engagement récurrent significatif, avec une dépendance continue à l'infrastructure et aux choix produits du fournisseur. CoCounsel, positionné entre 250 et 500 USD par utilisateur et par mois, ou Lexis+ Protégé entre 500 et plus de 1 000 USD, suivent la même logique de coût récurrent par siège, indépendamment des évolutions réglementaires qui pourraient exiger des ajustements de gouvernance côté cabinet.

Une architecture privée de type RAGbase Legal se positionne différemment : un investissement one-time de l'ordre de 20 à 50 000 dollars pour une infrastructure hébergée en interne, sans dépendance récurrente par siège, avec un contrôle direct sur les évolutions de gouvernance nécessaires face aux exigences CNIL et AI Act. Des cas d'usage concrets comme El Murshid, avec 26 000 dossiers indexés et des gains de temps de rédaction évalués entre 5 et 70 % selon les tâches, montrent que la performance opérationnelle n'est pas sacrifiée sur l'autel de la souveraineté — l'architecture on-premise ne signifie pas une IA moins capable, elle signifie une IA dont le périmètre est mesurable.

Cela ne signifie pas qu'il faille écarter les outils cloud : pour des tâches de premier niveau, à faible sensibilité, un assistant généraliste ou un SaaS par siège reste pertinent et rapide à déployer. La bonne question pour un comité de direction n'est pas "cloud ou on-premise", mais "quels workflows, quels types de dossiers, quelles données justifient un contrôle architectural total plutôt qu'une délégation contractuelle à un tiers" — et cette cartographie devrait précéder tout arbitrage budgétaire, comme le détaille notre guide IA pour cabinets d'avocats.

Ce que Genmod annonce pour 2027

La trajectoire est lisible : la CNIL construit les outils d'un contrôle a posteriori de plus en plus rapide et systématique — 20 secondes pour une généalogie sans limite de profondeur, c'est un rythme d'audit industriel, pas artisanal. Cette capacité va inévitablement s'étendre des modèles open source vers des vérifications plus larges sur les chaînes de traitement agentiques, portées par la note de juillet 2026 et par le cadre AI Act. Les cabinets qui auront anticipé cette évolution en documentant précisément leur architecture — quelles données restent internes, quels extraits minimaux transitent, sous quelles conditions contractuelles — aborderont un contrôle CNIL comme un exercice de démonstration plutôt que comme une reconstitution d'urgence.


Avant tout arbitrage, un comité innovation ou un DSI de cabinet devrait cartographier trois éléments : quels workflows juridiques manipulent des données personnelles sensibles à volume significatif, quelle part de ces workflows dépend aujourd'hui d'un pipeline IA entièrement externalisé, et quel serait le délai réel pour répondre à une demande d'effacement RGPD ou à un contrôle CNIL sur chacun de ces workflows. Cette cartographie, plus qu'un choix de fournisseur, est ce qui déterminera la robustesse du cabinet face aux contrôles 2026-2027.

Questions fréquentes

Qu'est-ce que Genmod, l'outil mis à jour par la CNIL le 26 août 2026 ?
Genmod est un démonstrateur développé par la CNIL avec son laboratoire LINC pour explorer la 'généalogie' des modèles d'IA publiés en source ouverte et détecter s'ils ont mémorisé des données personnelles issues de leurs jeux d'entraînement. La version 2026 permet une recherche sans limite de profondeur en environ 20 secondes, contre un temps nettement plus long auparavant, grâce à l'optimisation du moteur de traçabilité.
Un cabinet d'avocats utilisant un modèle open source est-il concerné par les contrôles CNIL 2026 ?
Oui, dès lors qu'un cabinet fine-tune, héberge ou expose un modèle entraîné avec des données personnelles de clients ou de dossiers, il devient responsable de traitement au sens du RGPD et peut être soumis à un contrôle CNIL, d'autant plus que l'AI Act entre en pleine application en août 2026 pour les systèmes à haut risque. La capacité à démontrer l'absence de mémorisation ou à exercer les droits RGPD sur le modèle devient un point d'audit concret.
L'IA privée on-premise supprime-t-elle totalement le risque de fuite de données vers un fournisseur de modèle ?
Non, et il ne faut pas le prétendre : les extraits minimaux nécessaires à une réponse peuvent transiter vers l'API du LLM choisi par le cabinet. La différence structurelle est que les documents complets, l'index vectoriel, les permissions et les logs restent sur l'infrastructure du cabinet, alors qu'avec un SaaS mutualisé, l'ensemble du pipeline — y compris l'orchestration et la mémoire des interactions — est géré par le fournisseur.
R
RAGbase Legal Research Team
Recherche

RAGbase construit des systèmes d'IA privés pour les cabinets d'avocats : déployés sur l'infrastructure du cabinet, zéro rétention de données, propriété complète.

Voyez RAGbase sur vos propres données

30 minutes en visio. Nous cadrons votre besoin et montrons le système en direct.

Nous utilisons des cookies de mesure d'audience et de marketing (Google Analytics, LinkedIn). Aucun traceur ne se charge sans votre accord. En savoir plus