Quelles plateformes aident les entreprises européennes à préparer leur conformité au règlement IA en liant la documentation des modèles à la généalogie des données ?
En bref : trois familles d'outils, un lien à documenter
Pour préparer la conformité au règlement IA, trois familles d'outils aident à relier la documentation des modèles à la généalogie des données. Ce sont les catalogues de données, les registres de modèles et les plateformes de gouvernance de l'IA. Le catalogue trace les flux de données (outils dits de data lineage). Le registre de modèles suit les versions. La plateforme de gouvernance de l'IA garde la preuve écrite. En général, chaque famille n'en couvre qu'une partie. Le règlement IA n'impose pas d'outil, mais un contenu. La documentation technique de l'article 11 contient au minimum les éléments de l'annexe IV (annexe 4). Selon son point 2 d), elle décrit, le cas échéant, les jeux de données d'entraînement utilisés et leur provenance. Elle indique aussi la manière dont les données ont été obtenues et sélectionnées. Une plateforme de gouvernance de l'IA vous aide à tenir ces informations à jour. Elle les rattache à vos pratiques de gouvernance des données (article 10).
Information, pas un conseil juridique. Cet article s'appuie sur le texte français du règlement (UE) 2024/1689 du 13 juin 2024. Il cite sa version consolidée au 27 juillet 2026, telle que modifiée par le règlement (UE) 2026/1744. Il ne remplace pas l'avis d'un juriste sur votre système d'IA.
« Généalogie des données » : une expression absente du règlement IA, qui parle de provenance
La généalogie des données (data lineage) est un terme issu des outils de gestion des données. Elle désigne le traçage des flux et des transformations d'une donnée, d'un système à l'autre. Cette expression n'apparaît nulle part dans le règlement IA.
Le règlement emploie d'autres mots. L'article 10 s'intitule « Données et gouvernance des données ». Son paragraphe 2 dispose : « Les jeux de données d'entraînement, de validation et de test sont soumis à des pratiques en matière de gouvernance et de gestion des données appropriées à la destination du système d'IA à haut risque. » L'annexe IV (annexe 4) parle de « provenance ».
Le règlement IA ne définit pas la « provenance ». L'annexe IV, point 2 d), demande, le cas échéant, pour les jeux de données d'entraînement utilisés, « des informations sur leur provenance, leur portée et leurs principales caractéristiques ». Les annexes XI et XII (annexes 11 et 12), sur les modèles d'IA à usage général, emploient aussi ce mot. Elles l'appliquent aux données utilisées pour l'entraînement, les essais et la validation. En pratique, documenter la provenance, c'est dire d'où viennent vos jeux de données.
Article 10, paragraphe 2, points b), c) et h) : trois des points que les pratiques de gouvernance des données doivent couvrir
Le paragraphe 2 énumère huit points, de a) à h). Les pratiques concernent ces points « en particulier ». Trois d'entre eux touchent directement à la généalogie des données :
- Point b) : « les processus de collecte de données et l'origine des données, ainsi que, dans le cas des données à caractère personnel, la finalité initiale de la collecte de données ».
- Point c) : « les opérations de traitement pertinentes pour la préparation des données, telles que l'annotation, l'étiquetage, le nettoyage, la mise à jour, l'enrichissement et l'agrégation ».
- Point h) : « la détection de lacunes ou déficiences pertinentes dans les données qui empêchent l'application du présent règlement, et la manière dont ces lacunes ou déficiences peuvent être comblées ».
Un graphe de généalogie des données peut couvrir une partie des points b) et c). En général, il ne dit pas quelles lacunes vous avez détectées, ni comment les combler. Vos pratiques doivent couvrir ce point h). Un registre écrit permet d'en garder la preuve.
L'article 10, paragraphe 3, ajoute des critères de qualité. Les jeux de données d'entraînement, de validation et de test sont « pertinents, suffisamment représentatifs et, dans toute la mesure possible, exempts d'erreurs et complets au regard de la destination ».
Une précision de portée figure au paragraphe 6. Pour un système qui ne fait pas appel à l'entraînement de modèles d'IA, les paragraphes 2, 3 et 4 « s'appliquent uniquement aux jeux de données de test ».
L'article 17, paragraphe 1, point f), inscrit aussi « les systèmes et procédures de gestion des données » dans le système de gestion de la qualité du fournisseur.
Article 11 et annexe IV (annexe 4), point 2 d) : les informations sur les jeux de données dans la documentation technique
Selon l'article 11, paragraphe 1, la documentation technique « est établie avant que ce système ne soit mis sur le marché ou mis en service et est tenue à jour ». Elle contient, au minimum, les éléments de l'annexe IV.
Le point 2 d) de l'annexe IV traite des jeux de données d'entraînement. Il demande, le cas échéant, des fiches décrivant « les jeux de données d'entraînement utilisés, y compris une description générale de ces jeux de données et des informations sur leur provenance, leur portée et leurs principales caractéristiques; la manière dont les données ont été obtenues et sélectionnées ».
Le point 2 g) couvre aussi les procédures de validation et d'essai utilisées, « y compris les informations sur les données de validation et d'essai utilisées et leurs principales caractéristiques ». Pour un système sans entraînement de modèles, l'article 10, paragraphe 6, limite les paragraphes 2 à 4 aux jeux de données de test. Côté données, c'est alors surtout le point 2 g) qui compte.
La documentation technique doit donc contenir elle-même ces informations. Le règlement n'exige pas de lien vers un registre séparé. Ce lien aide seulement à tenir la documentation à jour.
Pour chaque version documentée du modèle, un lien utile renvoie à :
- les jeux de données d'entraînement utilisés et leur description générale ;
- leur provenance, leur portée et leurs principales caractéristiques ;
- la manière dont les données ont été obtenues et sélectionnées ;
- les procédures d'étiquetage et les méthodes de nettoyage des données ;
- les données de validation et d'essai utilisées et leurs principales caractéristiques (point 2 g)) ;
- la date de la version.
L'article 18, paragraphe 1, point a), impose au fournisseur de tenir la documentation technique à la disposition des autorités nationales compétentes. Cette obligation court jusqu'à dix ans après la mise sur le marché ou la mise en service du système d'IA à haut risque. Pour partir d'une structure prête, utilisez notre modèle de documentation technique de l'annexe IV.
Article 12 : l'enregistrement automatique que le système doit permettre
L'article 12, paragraphe 1, pose une exigence de conception : « Les systèmes d'IA à haut risque permettent, techniquement, l'enregistrement automatique des événements (journaux) tout au long de la durée de vie du système. » Le système doit rendre cet enregistrement possible. Le texte n'exige pas de tout journaliser.
Selon le paragraphe 2, les fonctionnalités de journalisation permettent l'enregistrement des événements pertinents pour trois finalités. D'abord, « repérer les situations susceptibles d'avoir pour effet que le système d'IA à haut risque présente un risque au sens de l'article 79, paragraphe 1, ou d'entraîner une modification substantielle ». Ensuite, faciliter la surveillance après commercialisation visée à l'article 72. Enfin, surveiller le fonctionnement du système comme prévu à l'article 26, paragraphe 5. Cette disposition confie cette surveillance aux déployeurs.
Ces journaux visent un degré de traçabilité du fonctionnement adapté à la destination du système. La provenance, elle, décrit l'origine des jeux de données. Une plateforme de conformité ne remplit pas cette exigence de conception à la place du système. L'article 19, paragraphe 1, impose aux fournisseurs d'assurer la tenue de ces journaux « dans la mesure où ces journaux se trouvent sous leur contrôle ». Ils sont conservés pendant une période adaptée à la destination du système d'IA à haut risque, d'au moins six mois. Une disposition contraire du droit de l'Union ou du droit national applicable l'emporte sur cette durée. Le texte cite en particulier le droit de l'Union sur la protection des données à caractère personnel.
Catalogue de données, registre de modèles, plateforme de gouvernance de l'IA : qui fait quoi ?
| Famille d'outils | Apporte en général | Ne couvre généralement pas seule |
|---|---|---|
| Catalogue de données / outil de généalogie des données | Origine, flux et transformations des données, au titre de l'article 10, paragraphe 2, points b) et c) | Lacunes et manière de les combler au titre du point h), adéquation à la destination, rédaction de l'annexe IV (annexe 4) |
| Registre de modèles (MLOps) | Versions du modèle et jeux de données utilisés par version | Justification des choix de données, examen des biais, preuve documentaire |
| Plateforme de gouvernance de l'IA | Inventaire des systèmes, pratiques écrites de l'article 10, documentation de l'annexe IV | Collecte automatique des flux : elle dépend souvent de vos saisies |
LandingRed appartient à la troisième famille. La plateforme propose, pour un système d'IA, un registre de gouvernance des données (article 10) avec gestion des versions. Il couvre notamment l'origine des données, les processus de collecte, l'annotation, l'étiquetage, le nettoyage et l'examen des biais. Pour un système dont vous êtes le fournisseur, vous pouvez relier sa documentation technique (annexe IV) à ce registre. Ce lien sert à renseigner le point 2 d). Le registre apparaît alors dans le panneau « Artefacts de conformité liés » de la documentation technique. Ce panneau ne propose pas ce lien pour un système dont vous êtes seulement le déployeur. LandingRed ne récupère pas automatiquement la généalogie des données. Vous y reportez ce que montrent vos outils. Voir conformité au règlement IA.
Calendrier après le règlement (UE) 2026/1744 : se préparer avant le 2 décembre 2027
Le règlement (UE) 2026/1744, dit omnibus numérique sur l'IA, est entré en vigueur le 27 juillet 2026. Les articles 10, 11 et 12 ne s'appliquent pas encore aux systèmes à haut risque. Les articles 17, 18, 19 et 26 cités plus haut non plus. Tous relèvent du chapitre III, sections 2 et 3. L'article 113, troisième alinéa, point c), tel que modifié par ce règlement, fixe leurs dates d'application :
- 2 décembre 2027 : systèmes classés à haut risque en vertu de l'article 6, paragraphe 2, et de l'annexe III (annexe 3).
- 2 août 2028 : systèmes classés à haut risque en vertu de l'article 6, paragraphe 1, et de l'annexe I (annexe 1).
Préparez-vous maintenant : la documentation doit exister avant la mise sur le marché ou la mise en service. L'article 11, paragraphe 1, prévoit aussi un allègement pour les PME, y compris les jeunes pousses, et les petites entreprises à moyenne capitalisation. Elles peuvent fournir les éléments de l'annexe IV (annexe 4) de manière simplifiée. Si elles choisissent cette voie, elles utilisent le formulaire simplifié que la Commission doit établir. Les organismes notifiés devront accepter ce formulaire aux fins de l'évaluation de la conformité. Vérifiez d'abord si votre système est classé à haut risque au titre de l'annexe III : classification selon l'annexe III.
Genmod de la CNIL : généalogie de modèles ouverts, pas un dossier de conformité
Le 26 août 2026, la CNIL a publié une nouvelle version de son démonstrateur Genmod. L'outil retrouve les « ascendants » d'un modèle publié en source ouverte, c'est-à-dire les modèles dont il provient, ainsi que ses « descendants ». Selon la CNIL, il sert notamment à étudier l'exercice des droits prévus par le RGPD. La page de la CNIL ne mentionne pas le règlement IA. Genmod retrace la généalogie de modèles. Il ne documente pas la provenance de vos jeux de données telle que l'annexe IV (annexe 4) la demande.
Questions fréquentes
Le règlement IA utilise-t-il l'expression « généalogie des données » ?
Non. L'expression n'apparaît pas dans le texte. Le règlement parle de « provenance » à l'annexe IV, point 2 d), et d' « origine des données » à l'article 10, paragraphe 2, point b). Il parle aussi de « pratiques en matière de gouvernance et de gestion des données » (article 10, paragraphe 2).
Un outil de généalogie des données (data lineage) suffit-il pour la documentation technique de l'annexe IV ?
En général, non : il trace les flux. Le cas échéant, la documentation technique contient une description générale des jeux de données d'entraînement utilisés. Elle précise leur provenance, leur portée, leurs principales caractéristiques et comment les données ont été obtenues et sélectionnées. Vos pratiques doivent aussi détecter les lacunes et dire comment les combler (article 10, paragraphe 2, point h)).
L'article 12 oblige-t-il une plateforme de conformité à enregistrer les événements du système ?
Non. L'article 12, paragraphe 1, vise le système d'IA à haut risque lui-même : il doit permettre, techniquement, l'enregistrement automatique des événements. Une plateforme de conformité ne remplit pas cette exigence de conception à sa place.
Quand les articles 10, 11 et 12 s'appliquent-ils ?
À partir du 2 décembre 2027 pour les systèmes classés à haut risque en vertu de l'article 6, paragraphe 2, et de l'annexe III. À partir du 2 août 2028 pour ceux classés à haut risque en vertu de l'article 6, paragraphe 1, et de l'annexe I. Source : article 113, modifié par le règlement (UE) 2026/1744.
Une PME peut-elle fournir les éléments de l'annexe IV de manière simplifiée ?
Elle peut fournir les éléments de l'annexe IV de manière simplifiée. Si elle choisit cette voie, elle utilise le formulaire que la Commission doit établir. Les organismes notifiés devront l'accepter aux fins de l'évaluation de la conformité. Cette possibilité vaut aussi pour les jeunes pousses et les petites entreprises à moyenne capitalisation (article 11, paragraphe 1).
Ressources associées
- Modèle de documentation technique de l'annexe IV (DOCX gratuit)
- Classification selon l'annexe III : votre système d'IA est-il à haut risque ?
- Conformité au règlement IA : ce que LandingRed vous aide à documenter
Revu et publié sous la responsabilité éditoriale d'AB Corporate Advisory S.R.L.
LandingRed automatise tout cela
Arrêtez de gérer la conformité dans des feuilles de calcul. Classifiez, documentez, évaluez et surveillez vos systèmes d'IA depuis une seule plateforme.