Le chapitre 2 s'est terminé par la revendication portante de ce guide : le modèle est les données . Ce qu'un système d'IA "sait" est un reflet statistique comprimé de ses données de formation. Changez les données et vous changez le modèle. Changez substantiellement les données et vous obtenez un modèle différent entièrement. Le fait technique n'est pas contesté. Les conséquences politiques et juridiques du fait technique sont profondément contestées, et le concours organise la plupart du reste du guide. Ce chapitre entre dans les données de formation elle-même. Qu'est-ce qu'il y a là-dedans ? D'où ça vient ? Comment est-il recueilli? Qu'est-ce que cela coûte (dans le travail humain, dans l'empreinte environnementale, dans le consentement, dans la rémunération)? A qui appartient-il ? Qui a accès ? Quelle connaissance est incluse, à quelles conditions, avec quelle reconnaissance? Pourquoi est-ce le domaine le plus opaque de la divulgation d'IA par les entreprises, chaque année, dans chaque évaluation de la transparence? Le chapitre est plus court que le chapitre 2, car les fondations techniques sont maintenant en place. Elle est plus politiquement pointue parce que la question de la formation-données est l'endroit où les enjeux politiques de l'IA deviennent spécifiques. Vous partirez avec : une image de travail de ce qui se trouve en fait à l'intérieur du corps d'entraînement des principaux modèles d'IA ; la distinction entre les données « ouvertes » et les données " librement raclées » que le débat public s'effondre régulièrement ; le cadre Whaanga de formation à l'IA comme nouvelle opération d'extraction coloniale, engagé de façon substantielle plutôt que décorative ; le test de travail pour évaluer toute revendication sur les données d'instruction ; et la configuration conceptuelle pour les chapitres 9, 11 et 13, chacun d'entre eux approfondit ce matériel dans sa propre direction. ---
D'où proviennent les données de formation
Quand OpenAI a formé le GPT-4, sur quoi l'a-t-il spécifiquement entraîné? Quand Anthropic a entraîné Claude, quand Google a formé Gemini, quand Meta a formé Llama, quand Cohere a formé la série de commande — quelles données étaient en fait dans ces corps d'entraînement?
Dans la plupart des cas, nous ne le savons pas complètement. En général, les entreprises ne publient pas de listes détaillées sur lesquelles leurs modèles ont été formés. Le Stanford Foundation Model Transparency Index a identifié les données sur la formation comme étant le sous-domaine de référence le plus bas pour presque tous les développeurs chaque année de l'existence de cet indice (2023, 2024, 2025). Lorsque l'indice 2025 a marqué 13 grands développeurs de modèles de fondation, six d'entre eux (Amazon, Google, Midjourney, Mistral, OpenAI, xAI) n'ont pas communiqué d'informations de base sur leur composition des données de formation. Ce n'est pas une surveillance. C'est structurel.
GOBLIN FACTS — groupements d'opacité autour des données. Dans l'indice de transparence des modèles de la Fondation 2025, six grands développeurs n'ont pas communiqué d'information sur la composition des données de formation de base. C'est pourquoi « sur quoi a-t-il été formé ? » reste la question la plus importante sans réponse dans la salle.
Ce que nous savons, d'après des déclarations publiques, des documents divulgués, des poursuites judiciaires et les quelques développeurs de modèles qui ont divulgué beaucoup (notamment IBM avec 95/100 sur la FMTI 2025, et Anthropic et AI21 dans le niveau supérieur), c'est que le corpus de formation pour tout modèle majeur de grande langue contient généralement:
L'internet public. Une fenêtre d'instantané ou de roulement du contenu texte effacé du web. Le point de départ le plus souvent cité est Crawl commun , un organisme sans but lucratif qui maintient une archive ouverte de pages Web rampées depuis 2008. Crawl commun est à lui seul des centaines de milliards de mots. Les principaux développeurs de modèles filtrent, dédoublent et re-poids Crawl commun pour la qualité et la réduction des méfaits, mais la version non filtrée est le point de départ. Common Crawl comprend des sites d'actualité, des blogs, des forums, des médias sociaux (où accessible au public), des revues de produits, des sites Web gouvernementaux, des publications académiques (où librement accessibles), Wikipedia, Stack Overflow, Reddit, des tableaux de discussion archivés, wikis fan, sites de recettes, des archives de fan fiction, des profils de rencontres (où indexés), et une énorme quantité de texte de faible qualité et généré par la machine. Internet est un corpus étrange pour former une intelligence (il contient à la fois la meilleure documentation technique du monde et les pires théories de conspiration du monde), et les propriétés étranges du texte internet façonnent ce que les modèles d'IA font.
Les modèles de la Fondation Livres et texte de longue durée. sont formés sur des livres, généralement des dizaines à des centaines de milliers de titres numérisés. Le corpus Books3, documenté dans la formation de Meta's Llama et prétendument dans les litiges d'avoir figuré dans la formations d'autres modèles majeurs, contenait environ 196 000 livres, y compris des documents substantiels protégés par le droit d'auteur d' auteurs contemporains. Le corpus a été assemblé en grattant une « bibliothèque d'ombre » qui distribue des livres sans licence. Books3 a fait l'objet de poursuites très médiatisées, y compris l'affaire Sarah Silverman contre Meta et OpenAI, et la plupart des grands développeurs de modèles ont depuis modifié leurs pratiques en matière de données sur les livres, bien que ce qu'ils ont changé à n'est généralement pas divulgué publiquement.
Dépôts de codes. Ensuite, il y a le code source: les modèles de fondation en ingèrent d'énormes quantités, principalement de GitHub, GitLab et des plateformes similaires. Les conditions de service de GitHub collectent des permis pour la formation à l'intelligence artificielle (un poste qui a été lui-même un grand débat dans l'industrie lorsque le copilote de GITHub a lancé en 2021), mais une grande partie du code sur Github a été téléchargé par les développeurs sous licences open-source (MIT, Apache, GPL, BSD) qui spécifient des conditions particulières d'utilisation. La question de savoir si la formation à l'IA constitue une « utilisation » en vertu de ces licences est contestée.
Les modèles de la Fondation Littérature académique. sont formés sur des articles scientifiques provenant d'arXiv (le serveur préimprimé ouvert), de PubMed Central (biomédical ouvert) et, là où ils sont accessibles, sur du contenu de revues payantes provenant des éditeurs tels qu'Elsevier, Springer, Wiley et Taylor & Francis. Les principaux éditeurs universitaires ont répondu de façon différente: certains ont signé des contrats de licence avec des développeurs de modèles (Elsevier avec Microsoft, par exemple), d'autres sont en cours de poursuite. La ligne entre « librement accessible » et « librement utilisable » traverse cette catégorie.
Le contenu des nouvelles. News articles entrent également dans le corpus, souvent par l'intermédiaire de Common Crawl (qui capture les versions Web accessibles au public des sites d'information). C'est la substance de l'action intentée par les journaux canadiens contre OpenAI : environ 16,1 millions d'articles d'actualités canadiennes appartenant à Torstar, Postmedia, le Globe and Mail, la Presse canadienne, CBC/Radio-Canada et Metroland, que les plaignants allèguent avoir utilisés pour former les modèles d'OpenAI sans licence ni compensation. Des poursuites similaires sont en cours dans de multiples juridictions, y compris aux États-Unis (la New York Times c. OpenAI (cas).
Autres contenus accessibles au public. Reddit commente (vendu à Google pour la formation en IA en 2024 dans un accord de licence de 60 millions de dollars par an - l'un des rares accords de licences publics). Les contributions au titre du dépassement de débit (un corpus technique de haute qualité que la société a à la fois autorisé aux développeurs d'IA et vu utilisé sans licence, avec des différends en cours). Wikipedia (CC BY-SA sous licence et utilisation ouverte). Transcriptions YouTube (la formation de Google sur Gemini aurait utilisé des transcriptions vidéo YouTube importantes — propriété de Google). Contenu Twitter/X (utilisé dans la formation Grok de xAI comme intégration directe de plate-forme).
Données multimédias pour les modèles multimodal. Les générateurs d'images (DALL-E, Midjourney, Stable Diffusion, Google Imagen) sont formés sur des milliards de paires de textes d'image, généralement collectés en rampant des sites Web et en utilisant les légendes d'images, les noms de fichiers et le texte environnant comme étiquettes. L'ensemble de données LAION (Grande Intelligence Artificielle Open Network, un organisme sans but lucratif allemand) a maintenu le corpus de formation le plus couramment utilisé pour la recherche sur la génération d'images ouvertes; LAION-5B contenait 5,85 milliards de paires de textes images. L'ensemble de données a été pris hors ligne en décembre 2023 après que des chercheurs de l'Observatoire Internet de Stanford aient documenté 1 008 cas confirmés d'abus sexuels sur enfants dans l'ensemble, plus de 3 200 autres entrées ayant été signalées comme suspectées. Une version révisée filtrée a été publiée à la fin de 2024. Le problème structurel n'est pas résolu: l'internet public contient des documents qui ne devraient jamais être dans un corpus de formation, et le grattage à l'échelle le ramasse.
Données synthétiques. De plus en plus, les données de formation à l'IA comprennent des données générées par autres Systèmes d'IA: un modèle formé aux sorties d'un modèle précédent. Cette technique permet d'élargir les données de formation au-delà de ce que seul le contenu généré par l'homme peut fournir, et est maintenant une pratique courante pour l'affinage et l'alignement. Le problème structurel que cela soulève : si les générations successives d'IA sont formées de façon substantielle sur le contenu généré par l'IA, les erreurs et les biais dans les générations antérieures se propagent vers l'avant, ce qui peut s'amplifier. La recherche académique sur le "modèle d'effondrement" (Shumailov et al., 2024 in Nature ) suggère qu'il s'agit d'un risque réel, bien que les conséquences soient encore caractérisées.
Le corpus d'entraînement pour un modèle de fondation frontière en 2026 est, par tout compte raisonnable, dans les dizaines de billions de jetons — équivalant à une fraction substantielle du récit numérisé de l'humanité. La composition est en partie divulguée et en partie non. La provenance de chaque pièce est en partie traçable et en partie non. Le consentement donné par les humains dont le travail est dans le corpus est, dans la plupart des cas, absent.
GOBLIN FACTS — les jetons sont la bande de mesure. La formation des modèles de la Fondation est généralement comptée en jetons : des morceaux de texte sont plus petits que les mots. Un corpus dans les dizaines de billions de jetons n'est pas une bibliothèque; c'est une copie statistique d'une grande partie de l'écriture humaine numérisée.
---
La distinction que le débat public escamote — « ouvert » contre « librement aspiré »
L'une des confusions les plus importantes dans le débat sur la politique d'IA est l'effondrement de deux choses très différentes: librement accessible et des données qui sont facilement utilisables . La distinction n'est qu'une distinction académique : elle sous-entend toute la conversation entre créateurs et droits dans la politique canadienne en matière d'IA et à l'échelle mondiale.
Libre accès signifie que les données sont disponibles sans paywall ni obligation de connexion. La plupart de l'internet public est librement accessible en ce sens. Vous pouvez visiter un article de nouvelles, le lire, voir les photos, et traiter son contenu vous-même sans payer.
Gratuitement utilisables est une catégorie beaucoup plus étroite. L'article Wikipédia que vous pouvez lire est également utilisable gratuitement, car Wikipédie est publié sous Creative Commons Attribution-ShareAlike (CC BY-SA), qui accorde explicitement la permission de réutiliser avec attribution et les exigences de même licence. Le document de physique arXiv que vous pouvez lire est également utilisable gratuitement, car les auteurs ont accepté ses termes de distribution ouverts lors de l'affichage. Le code MIT-Licensed sur GitHub est librement utilisable, avec les conditions spécifiées dans la licence MIT. Mais l'article que vous pouvez lire sur le site Web du Globe and Mail n'est pas librement utilisable. Le journal l'a publié pour la lecture publique. Le journal ne l'a pas autorisé pour une utilisation arbitraire en aval, y compris la formation de systèmes commerciaux d'intelligence artificielle.
EXAMPLE — la voiture garée dans la rue. Une voiture garée dans une rue publique est librement visible. Cela ne le rend pas librement utilisable. La même distinction consiste à faire du travail lorsqu'un site Web peut être lu par le public, mais n'a pas autorisé son contenu pour la formation de modèles commerciaux.
🧌 GOBLIN CHECK — "Publicly available" est l'expression préférée de l'industrie de IA, et le gobelin voudrait que vous remarquiez que cela signifie Nous pourrions l'atteindre Pas nous avons été autorisés à le garder . Votre voiture est visible publiquement. Cela n'a toujours pas réglé la question de savoir qui peut la chasser.
La distinction est importante parce que la défense de l'industrie IA de la formation-sans autorisation repose essentiellement sur le regroupement de ces catégories. "Nous avons suivi une formation sur les données accessibles au public" — La position exprimée par OpenAI, la position de plusieurs sociétés défenderesses dans les poursuites en matière de droits d'auteur en cours au Canada et aux États-Unis, est une déclaration vraie qui permet de faire la distinction entre accessible au public et publiquement utilisable . Les articles d'actualité, les livres, les documents académiques, les portfolios d'artistes, les sites web du photographe sont accessibles au public. Ils ne sont généralement pas autorisés publiquement à suivre une formation sur l'IA.
ALIGNMENT — accessible pour quoi faire? « Accessible au public » répond à côté de la question. Une chose peut être libre à lire sans être libre à copier dans un corpus d'entraînement commercial. Quand une entreprise dit s'être entraînée sur des données publiques, demandez : accessible pour être lue, ou sous licence pour être utilisée? C'est dans cet écart que se logent la plupart des litiges de droit d'auteur.
La question contestée, au Canada et dans le monde entier, est de savoir si la législation actuelle sur le droit d'auteur permet la formation en matière d'IA comme exception à l'égard des transactions équitables ou de l'utilisation équitable, ou si la formation sur l'IA exige une licence explicite du type de celle que l'industrie de l 'IA n'a généralement pas poursuivie. La question de fait contestée (les données utilisées) est en partie caché par la non-divulgation des entreprises. Sur la question de droit litigieuse (si l'utilisation était admissible) dépend des faits qui sont partiellement cachés. L'opacité est structurelle au conflit.
Deux catégories distinctes de contenu « accessible au public » seront traitées séparément dans le guide :
Ouvert et sous licence pour réutilisation : Wikipedia (CC BY-SA), arXiv preprints (généralement CC BY ou compatible), la plupart des codes open source (MIT, Apache, GPL avec conditions), les livres du domaine public du projet Gutenberg, les travaux gouvernementaux (variant les règles juridictionnelles) et le même contenu volontairement publié. La formation à cette catégorie soulève moins de problèmes, car les titulaires de droits ont, explicitement ou par licence, accordé une autorisation de réutilisation. Mais même ici, les conditions de licence sont importantes : CC BY-SA exige que la même licence soit appliquée aux oeuvres dérivées, GPL a des dispositions de copyleft, MIT nécessite l'attribution. La question de savoir si les modèles d'IA satisfont à ces conditions lorsqu'ils produisent du texte ressemblant à du matériel de formation-données est compliquée en aval.
Accès public mais non autorisé pour la formation en IA : articles d'actualité, livres protégés par le droit d'auteur, photographie commerciale, oeuvre professionnelle, articles scientifiques derrière paywalls (position des éditeurs) ou dans les revues à accès libre (position plus contestée des éditeurs quant à la question de savoir si l'accès ouvert permet la formation en IA), messages de médias sociaux que les plateformes n'ont pas license pour une utilisation en aval (la plupart de Reddit avant 2024, la plupart de Twitter/X avant Musk, la majeure partie du contenu de Facebook), et la longue queue de contenu affichée par des particuliers sans intention explicite de licence. Il s'agit de la catégorie contestée. L'industrie de l'IA s'y est généralement formée. Les titulaires de droits s'opposent de plus en plus.
Une troisième catégorie mérite d'être nommée : données qui ont été sous licence proactive pour la formation à l'IA, par le biais d'accords entre les entreprises d'IA et les propriétaires de contenu. Reddit-to-Google (2024, 60 M$/an), l'accord AP-OpenAI, l'affaire Financial Times-OopenAI et les différents accords d'éditeurs universitaires à Microsoft, le récent accord New York Times-Amazon (après que le Times a poursuivi OpenAI). Ces transactions se développent à mesure que les propriétaires de contenu réalisent qu'ils ont un effet de levier. Les accords confirment également, par leur existence, que l'industrie reconnaît que le matériel sous-jacent était utilisé auparavant sans licence. Le marché des licences qui émerge maintenant peut raisonnablement être interprété comme l'industrie de l'IA se prémunissant de sa propre position juridique — vous ne payez généralement pas pour ce que vous êtes confiant que vous pouvez prendre gratuitement. (L'industrie appellerait cela la gestion des risques et l'approvisionnement en intrants. Les deux lectures correspondent aux mêmes faits; le poids du guide est déclaré ici.)
---
La couche du travail humain
Une dimension spécifique des données de formation que la discussion publique manque régulièrement: La plupart des grands modèles d'IA dépendent d'un travail humain important, souvent payé à des salaires très bas, souvent dans le Sud mondial, impliquant souvent une exposition au contenu traumatisant. Ce n'est pas un fait périphérique sur la façon dont l'IA se construit. Elle est structurelle pour la pratique actuelle de la formation à l'IA.
Deux couches spécifiques:
Étiquetage des données. Pour les tâches d'apprentissage supervisé, y compris la plupart des fonctions de vision informatique et de l'IA spécialisée, les humains doivent marquer les données de formation. Les tâches d'étiquetage de l'image comme « cliquer sur tous les pixels montrant une voiture » sont familières à toute personne qui a complété un CAPTCHA. La même tâche que l'étiquetage professionnel pour la formation en IA est effectuée par des centaines de milliers de travailleurs dans le monde entier, principalement par le biais de plates-formes comme Amazon Mechanical Turk, Scale IA, Surge IA et Toloka, avec concentration au Kenya, aux Philippines, en Inde et dans d'autres juridictions à bas salaires. Les salaires documentés sont faibles: HEURE L'enquête de 2023 sur les contrats de Sama d'OpenAI au Kenya a révélé une rémunération à la maison d'environ 1,32 $ US à 2 $ US par heure, et 2023 Poste de Washington les rapports sur la plateforme Remotasks d'IA à échelle aux Philippines ont documenté les paiements qui sont arrivés en retard, en dessous des taux affichés, ou dans certains cas pas du tout. La main-d'œuvre est précaire par sa conception : rémunérée par tâche, sans prestations, et généralement sans les protections qui viennent avec le statut d'emploi.
La modération du contenu pour l'alignement. Quand OpenAI a adapté le ChatGPT pour refuser les demandes nuisibles, les données de formation pour cette capacité de refus ont été générées par des travailleurs humains qui ont examiné des contenus extrêmement troublants (descriptions de violence, abus, exploitation d'enfants, terreur) et évalué les réponses du modèle selon qu'il convient ou inapproprié. **L'enquête de 2023 TIME** a documenté le contrat d'OpenAI par l'intermédiaire de Sama au Kenya, payant des travailleurs de moins de 2 $US/heure pour examiner le contenu graphique et traumatisant pour les données de formation d'alignement qui ont rendu ChatGPT plus sûr pour les utilisateurs finaux. Les travailleurs ont signalé des dommages psychologiques durables. Des préoccupations similaires ont été documentées ailleurs : des entrepreneurs de la modération du contenu travaillant sur les plateformes de Meta ont intenté des litiges au Kenya au sujet de l'exposition aux traumatismes et de la rémunération, et les évaluateurs contractuels travaillant sur des produits d'IA de Google ont publiquement contesté leurs salaires et conditions, bien que les arrangements spécifiques varient selon l'entreprise.
Le fait structural : les produits d'IA commercialisés au Canada comme automatisation de pointe sont, à leur niveau de formation et de données, fondés sur une main-d'oeuvre humaine substantielle. Cette main-d'oeuvre est concentrée dans les provinces et territoires où la protection du travail est plus faible, où le salaire est nettement inférieur à ce qu'un travail équivalent serait payé au Canada ou aux États-Unis, et où l'exposition au contenu traumatisant est de plus en plus importante. Le cadrage "IA-remplace-workers" est partiel. L'IA remplace certains types de travailleurs dans certains types d'emplois tout en dépendant simultanément d'autres types de salariés dans d' autres types d ' emplois, le second set étant largement invisible du cadrage.
Cela se rattache à l'analyse du travail du chapitre 16 : l'histoire du déplacement de la main-d'oeuvre est plus compliquée que ne le permet l'alarmiste ou la version dédaigneuse. Une partie de la main-d'œuvre est remplacée. D'autres emplois sont créés, à des salaires plus bas et dans des conditions pires, ou intensifiés par la gestion algorithmique. Tout cela se produit à la fois, et l'image complète nécessite de le tenir ensemble.
---
Cadrage de Whaanga — L'IA comme nouveau colonisateur
Le Protocole autochtone et le document de position de l ' IA (2020), présentés au chapitre 1 et approfondis au chapitre 9, contiennent un essai de H. M. Whaanga (Ngāti Kahungunu, Ngāi Tahu, Ngati Mamoe, Waitaha; spécialiste du maori et te reo Maori, aujourd ' hui professeur et chef d ' école à Te Pūtahi-a-Toi, Université Massey d ' Aotearoa, Nouvelle-Zélande), dont le cadre porte un examen spécifique dans le chapitre consacré aux données. Titre de l'essai : « L'IA : une (r)évolution nouvelle ou un nouveau colonisateur pour les peuples autochtones ? »
L'argument de Whaanga, distillé : les systèmes d'IA sont « inexpérimentalement dépendants de l'aspiration de grandes quantités de données ». Lorsque ces données comprennent les connaissances autochtones, la langue, les pratiques culturelles, l'information environnementale et le savoir traditionnel (et que la plupart des grands modèles de base Faites incluent ce contenu, parce qu'ils sont formés sur Internet, y compris tout matériel autochtone ou décrit par les Autochtones qui a été numérisé), le résultat est structurellement extractive de manière à se faire une carte directement sur les schémas historiques d'extraction du savoir colonial.
Un guide non autochtone ne peut pas parler au nom de ce cadrage. Ce qu'elle peut faire, c'est présenter les implications opérationnelles. Trois sont directs:
La couche formation-données. La plupart des principaux modèles de fondation ont été formés sur le contenu autochtone — articles de Wikipedia sur les communautés et l'histoire des Premières nations, des Inuits et des Métis; couverture médiatique des événements autochtones; documentation universitaire sur les langues et les pratiques culturelles autochtones; dans certains cas, du matériel d'auteurs autochtones affiché sur le Web; dans d'autres cas, des documents d'archives sur les connaissances autochtones recueillies par des chercheurs de l'époque coloniale et numérisées dans des archives accessibles. Il n'y a aucun cas documenté de cette formation qui se déroule avec le consentement des communautés dont les connaissances et le contenu ont été utilisés. Les principes du PACO de la FNIGC, la Stratégie nationale inuite sur la recherche de l'ITK et les principes GIDA CARE demandent tous si les données autochtones sont utilisées avec la propriété autochtone, le contrôle, l'accès, la possession, les avantages collectifs, les pouvoirs, les responsabilités et l'éthique. L'état actuel de la formation modèle de fondation est que, dans le dossier public, aucune de ces questions n'a été posée avant la formation.
La couche modèle-sortie. Lorsqu'on demande à un modèle d'IA de générer du contenu sur des sujets autochtones, le modèle produit une sortie façonnée par ce qui était dans ses données de formation. Si les données sur la formation étaient des documents d'auteurs universitaires de l'Ouest sur les peuples autochtones, plutôt que du matériel d'origine autochtone par, les résultats du modèle refléteront cette disproportion. La voix des archives coloniales peut être amplifiée par l'IA même lorsque l'intention sous-jacente est un accès neutre à l'information , parce que les données de formation sous-jacentes ont été façonnées par les modèles d'accumulation des archives coloniales. L'effet est mesurable, pas métaphorique.
La nouvelle couche de création de la connaissance. Si les outils d'IA sont de plus en plus utilisés dans l'éducation, la recherche, la communication et la production créative, et si ces outils ont absorbé le contenu autochtone dans des conditions qui violent les principes de souveraineté des données autochtones, alors l'utilisation de ces outils pour créer un nouveau contenu sur les peuples autochtones ou en dialogue avec les communautés autochtones perpétue la violation sous-jacente. Chaque nouveau contenu est construit sur un substrat qui n'engageait pas les cadres autochtones pour l'utilisation des données autochtones.
C'est l'engagement de fond dont le cadre de Whaanga a besoin. L'étiquette «IA comme nouveau colonisateur» n'est pas rhétorique. Il s'agit d'une revendication structurelle sur la façon dont les données de formation à l'IA fonctionnent par rapport aux connaissances autochtones, à quoi ressemblerait l'alternative (modèles de formation qui utilisent les cadres de souveraineté des données plutôt que de les ignorer) et sur les coûts de ne pas s'engager. Le guide prend la revendication au sérieux sans prétendre en parler et demande aux lecteurs et aux décideurs canadiens de l'IA de faire de même.
Une connexion canadienne spécifique. Le réseau de recherche Abondant Intelligences introduit au chapitre 1 (codirigé par Concordia, avec le pod de Lethbridge et des partenaires internationaux) réalise un travail technique concret sur ce que la formation en IA que l'a fait engage les cadres de souveraineté des données autochtones pourrait ressembler : petits modèles formés sur les données avec le consentement approprié, modèles construits à l'aide d'hypothèses épistémologiques autochtones, prototypes qui démontrent des alternatives au paradigme de l'extraction et de la mise en échelle. Le travail existe. La stratégie fédérale d'IA pourrait l'engager. IA pour tous ne s'engage pas actuellement à le faire.
---
La couche de coût — ce que les données de formation extrait et ce qu'il retourne
La mise en commun des sections précédentes donne un aperçu de ce que les données sur la formation à l'IA représentent réellement au niveau agrégé. L'image n'est pas la version marketing.
Ce que les données de formation extrait:
La production écrite, visuelle et audio accumulée d'êtres humains au cours des siècles, où ils ont numérisé et accessible. La production professionnelle d'écrivains, d'artistes, de photographes, de journalistes, de programmeurs, de scientifiques, de chercheurs et de passionnés amateurs. Le contenu culturel et le savoir des peuples autochtones à l'échelle mondiale, accumulés grâce aux pratiques de recherche de l'ère coloniale et à la présence en ligne contemporaine. Le travail humain de centaines de milliers de travailleurs à bas salaires, principalement dans le Sud mondial, effectue l'étiquetage et la modération du contenu. Les matériaux de substrat physique (cobalt, lithium, coltan, gallium — chapitre 8's Owen et al. La formation a été effectuée pour construire l'infrastructure de calcul qui traite la formation. L'électricité, l'eau et le carbone intégré de la formation elle-même.
Quelles sont les données sur la formation qui reviennent aux personnes dont le travail, les connaissances et le travail sont en leur sein :
Pour les contributeurs de Wikipédia et les développeurs open-source : dans la plupart des cas, l'attribution et la compatibilité des licences requises par leurs licences. Conformité mixte.
Pour les auteurs et journalistes publiés : dans certains cas, les accords de licence récents (l'accord AP-OpenAI, l'accord Reddit-Google, l 'accord New York Times-Amazon, les différents accords universitaires-éditeurs). Dans la plupart des cas, aucune indemnisation, aucun consentement et aucun litige en cours. Les créateurs canadiens ont reçu moins que les créateurs américains en termes d'octroi de licences parce que les organisations canadiennes de droits collectifs sont moins consolidées et que les éditeurs canadiens ont moins d'effet de levier.
Pour les peuples autochtones dont les connaissances se trouvent dans les données de formation : dans la plupart des cas, rien. Ni les mécanismes de consentement, ni la rémunération, ni le gouvernement sur la façon dont les données sont utilisées, ni sur la divulgation de ce qui a été utilisé.
Pour les travailleurs de l'étiquetage des données et de la modification du contenu: dans les cas documentés ( HEURE 's 2023 rapport sur les contrats de Sama OpenAI au Kenya, la Poste de Washington 's 2023 rapport sur l'échelle de IA Remotasks), payer aussi bas que d'environ 1,32 $ US à 2 $ US par heure, généralement sans avantages ou protections du statut d'emploi, et dans certains cas des dommages psychologiques durables.
Pour les communautés qui vivent près des sites d'extraction des matériaux de substrat physique : dans de nombreux cas, dégradation de l'environnement, déplacement et perturbation de l ' utilisation traditionnelle des terres.
Pour le grand public: accès aux produits d'IA, parfois gratuit au point d'utilisation, qui génèrent de la valeur principalement pour les sociétés qui ont produit les modèles.
L'économie, sous forme comprimée: l'industrie de l'IA extrait une valeur substantielle des données, du travail, des connaissances et des substrats matériels fournis par des populations qui ne sont pas pour la plupart compensées, qui n'ont généralement pas consenti, qui ne possèdent pas de gouvernance sur les modèles résultants, et qui sont largement invisibles du récit de commercialisation. L'industrie rapporte une valeur substantielle aux investisseurs, aux dirigeants et (dans certains cas) aux utilisateurs finaux. Rien de tout ça n'est caché. C'est simplement la façon dont l'IA actuelle est construite, clairement traçable par quiconque suit la chaîne d'approvisionnement depuis l'extraction de puces jusqu'au marché du travail, en passant par les données de formation jusqu'à l'endroit où se trouvent les revenus.
Le guide ne prétend pas que cette structure est « le problème de l'IA » nécessitant une seule correction. Le guide fait valoir que tout compte rendu honnête des enjeux environnementaux, sociaux et politiques d'IA exige de voir cette structure et que les réponses stratégiques (canadiennes et mondiales) qui ne l'engagent pas répondent à un tableau partiel.
---
Le test pratique pour évaluer les affirmations sur les données de formation
En combinant le matériel du chapitre, le guide demande aux lecteurs de s'appliquer à toute demande de formation-données sur l'IA :
Source. Quelles données ont été utilisées spécifiquement? Le développeur a-t-il publié une liste complète, un échantillon représentatif ou seulement des caractérisations vagues? Si ce dernier, pourquoi ?
Consentement. Le consentement des titulaires de droits a-t-il été demandé avant la formation? Dans l'affirmative, par quel mécanisme — octroi de licences explicites, refus ou présomption d'utilisation équitable? Si non, quelle est la position juridique du promoteur quant à la raison pour laquelle le consentement n'était pas requis?
Indemnisation. Les titulaires de droits ont-ils été indemnisés pour l'utilisation de leur matériel? Dans l'affirmative, par quel mécanisme — licence directe, licence collective ou partage des revenus? Dans la négative, quelle est la position du promoteur quant à savoir si une indemnisation devrait être exigée?
Données autochtones. Le contenu autochtone a-t-il été inclus dans les données de formation? Dans l'affirmative, les principes du PACO/NISSR/CARE ont-ils été appliqués? Si aucun engagement, quelle était la raison du développeur ? Y a-t-il une séparation claire dans le corpus de formation entre le contenu autochtone utilisé avec consentement et le contenu indigène utilisé sans consentement?
Vérification. Les allégations du développeur concernant la composition, le consentement et la compensation des données de formation sont-elles vérifiables indépendamment? Un tiers a-t-il vérifié le corpus de formation? Dans le cas contraire, les réclamations sont une autodivulgation de la société et doivent être lues en conséquence.
Traçabilité des produits. Les sorties de modèles qui ressemblent à des documents de formation-données spécifiques peuvent-elles être retracées à ces documents? La capacité technique actuelle est limitée, mais elle s'améliore. Lorsque l'attribution de la production à la source est possible, le cadrage du développeur entre "génération nouvelle" et "réproduction" peut être testé empiriquement plutôt que rhétoriquement.
La plupart des produits actuels de l'IA échoueront la plupart de ces questions. La recommandation du guide n'est pas que les lecteurs refusent d'utiliser des produits d'IA; les lecteurs peuvent faire leurs propres choix à ce sujet. La recommandation du guide est que les lecteurs et les décideurs qui façonnent la stratégie canadienne d'IA lisent les échecs comme étant les conditions structurelles de la façon dont l'IA actuelle est construite et décident si ces conditions sont acceptables ou si elles doivent être modifiées.
---
Le reçu sur la matière première
CHAPTER RECAP — vous avez maintenant: - Un tableau de travail de ce qui se trouve réellement dans le corpus de formation des principaux modèles d'IA - contenu Internet (filtré et non filtré), livres (souvent acquis sans licence), code (sous des conditions de licence variables), littérature universitaire (avec des différends croissants en matière d'octroi de licences), nouvelles (la substance du procès OpenAI des journaux canadiens), médias sociaux (avec un marché croissant des licences), données multimédias (y compris les conclusions de LAION CSAM) et données synthétiques (avec préoccupations liées à l'effondrement des modèles). - La distinction entre librement accessible et facilement utilisables que le débat public s'effondre régulièrement — et la base opérationnelle de la conversation sur les droits des créateurs canadiens. - La couche humain-travail de la préparation des données de formation, y compris la main-d'œuvre d'étiquetage des données à bas salaires dans le Sud mondial et le contrat de modération du contenu kényan documenté pour la formation d'alignement OpenAI. - L'élaboration de l'initiative « L'IA comme nouveau colonisateur » de Whaanga a eu un impact important : la formation-couche de données, la modélisation-couche d'extrants et la création de nouvelles connaissances-couche des incidences des modèles de formation sur le contenu autochtone sans avoir recours aux cadres de souveraineté des données autochtones. - Le tableau global des extraits de données sur la formation (centuries de production humaine accumulée, connaissances autochtones, main-d'oeuvre à bas salaires, matériaux extraits, électricité et eau) et de ce qu'il revient aux contributeurs (dans la plupart des cas, peu ou pas du tout). - Le test de travail pour évaluer toute demande de formation sur l'IA : source, consentement, compensation, engagement des données autochtones, vérification, traçabilité des extrants.
Le chapitre suivant (chapitre 4) présente les données que ce chapitre a construites et qui entrent dans la couche physique, soit les puces qui traitent les données, les supports dans lesquels elles s'installent, les systèmes de refroidissement qui les maintiennent en marche, les chaînes d'approvisionnement qui produisent ces puces, les matériaux extraits pour les construire, et le protocole de construction du matériel Lakota de Suzanne Kite du Protocole Indigène et du Document de Position IA comme contre-framation structurelle à l'extraction du matériel industriel.
Vous pouvez maintenant lire n'importe quelle demande de données de formation sur l'IA avec l'équipement structurel pour poser les bonnes questions. La plupart des revendications actuelles ne répondront pas à la plupart de ces questions. Cet échec est la condition structurelle de la façon dont l'IA actuelle est construite, et son engagement honnête est la préalable à toute politique canadienne sérieuse en matière d'IA.
---
Étiquette partiale pour ce chapitre : analyse structurelle-politique des données de formation à l'IA, avec indication explicite de l'écart entre l'autodivulgation d'entreprise et la réalité opérationnelle. Auteur biais : sceptique à l'égard des cadrages « accessibles au public » qui échappent à la distinction libre-accessible-vs-librement utilisable; sensible aux critiques de formation menées par les créateurs et les autochtones sans consentement; prêt à désigner la couche travail-humain dans le Sud mondial comme structurelle de l'IA actuelle plutôt que périphérique; explicite que le manuel n'est pas dirigé par les autochtones et ne peut parler au nom du caddie Whaanga tout en l'engageant substantiellement. L'autodivulgation par l'entreprise (conclusions de la FMTI de Stanford, positions des défendeurs au procès) a été étiquetée et lue en conséquence. Les sources primaires dirigées par des autochtones (essai de Whaanga, cadres du PACO/NISR/CARE) ont été considérées comme faisant autorité dans leurs propres cadres.
Sources primaires citées ou invoquées dans ce chapitre : Stanford Center for Research on Foundation Models, 2025, Indice de transparence des modèles de la Fondation; journaux canadiens c. OpenAI (Cour supérieure de l'Ontario CV-24-00732231-00CL); Litige en corpus Books3 incluant Silverman et al. c. Royaume-Uni OpenAI; New York Times c. OpenAI; documentation sur le retrait des données de LAION (Observatoire Internet de Stanford, décembre 2023); Shumailov et coll., « Les modèles d'IA s'effondrent lorsqu'ils sont formés à l'utilisation de données générées de façon récursive » (Nature, 2024); enquête sur le magazine TIME sur les contrats Sama d'OpenAI (janvier 2023), Whaanga, « IA: a new (r)evolution or the new colonizer for Indigenous peoples? » (Protocole autochtone et document de position sur l'IA, 2020); Centre de gouvernance de l'information des Premières nations, principes du PACO; Inuit Tapiriit Kanatami, Stratégie nationale inuite sur la recherche (2018); Global Indigean Data Alliance, CARE Princips; Reddit-Google licensing deal disclosure (2024). Citations détaillées dans l'annexe Sources.
---
🧌 GOBLIN CHECK — "Publicly available" est l'expression préférée de l'industrie de IA, et le gobelin voudrait que vous remarquiez que cela signifie Nous pourrions l'atteindre Pas nous avons été autorisés à le garder . Votre voiture est visible publiquement. Cela n'a toujours pas réglé la question de savoir qui peut la chasser.
Récapitulatif
- Un tableau de travail de ce qui se trouve réellement dans le corpus de formation des principaux modèles d'IA - contenu Internet (filtré et non filtré), livres (souvent acquis sans licence), code (sous des conditions de licence variables), littérature universitaire (avec des différends croissants en matière d'octroi de licences), nouvelles (la substance du procès OpenAI des journaux canadiens), médias sociaux (avec un marché croissant des licences), données multimédias (y compris les conclusions de LAION CSAM) et données synthétiques (avec préoccupations liées à l'effondrement des modèles).
- La distinction entre librement accessible et facilement utilisables que le débat public s'effondre régulièrement — et la base opérationnelle de la conversation sur les droits des créateurs canadiens.
- La couche humain-travail de la préparation des données de formation, y compris la main-d'œuvre d'étiquetage des données à bas salaires dans le Sud mondial et le contrat de modération du contenu kényan documenté pour la formation d'alignement OpenAI.
- L'élaboration de l'initiative « L'IA comme nouveau colonisateur » de Whaanga a eu un impact important : la formation-couche de données, la modélisation-couche d'extrants et la création de nouvelles connaissances-couche des incidences des modèles de formation sur le contenu autochtone sans avoir recours aux cadres de souveraineté des données autochtones.
- Le tableau global des extraits de données sur la formation (centuries de production humaine accumulée, connaissances autochtones, main-d'oeuvre à bas salaires, matériaux extraits, électricité et eau) et de ce qu'il revient aux contributeurs (dans la plupart des cas, peu ou pas du tout).
- Le test de travail pour évaluer toute demande de formation sur l'IA : source, consentement, compensation, engagement des données autochtones, vérification, traçabilité des extrants.
Sources
- Stanford Center for Research on Foundation Models, 2025 Foundation Model Transparency Index
- Canadian newspapers v. OpenAI (Ontario Superior Court CV-24-00732231-00CL)
- Books3 corpus litigation including Silverman et al. v. OpenAI
- New York Times v. OpenAI
- LAION dataset withdrawal documentation (Stanford Internet Observatory, December 2023)
- Shumailov et al., "AI models collapse when trained on recursively generated data" (Nature, 2024)
- TIME magazine investigation of OpenAI's Sama contracting (January 2023)
- Whaanga, "AI: a new (r)evolution or the new colonizer for Indigenous peoples?" (Indigenous Protocol and AI Position Paper, 2020)
- First Nations Information Governance Centre, OCAP Principles
- Inuit Tapiriit Kanatami, National Inuit Strategy on Research (2018)
- Global Indigenous Data Alliance, CARE Principles
- Reddit-Google licensing deal disclosure (2024).