Méthodologie · Notre infrastructure
Notre infrastructure de données
Chaque donnée affichée sur ce site a traversé une chaîne précise avant d'apparaître à l'écran : elle est captée automatiquement depuis sa source, mise en forme, analysée par nos modèles, puis publiée. Cette page décrit cette chaîne dans ses grandes lignes : ce qu'elle capte, comment l'information y circule, et où elle est hébergée.
Nos valeurs
Une infrastructure entièrement automatisée. Aucune intervention humaine n'est nécessaire au jour le jour : la collecte, le calcul des indices et la publication du site se déclenchent seuls, à heure fixe, sept jours sur sept.
Une chaîne traçable. Les données brutes, les données mises en forme et les résultats calculés sont conservés à des étapes distinctes plutôt qu'écrasés les uns par les autres : n'importe quel chiffre publié peut être retracé jusqu'à la manchette ou à l'intervention parlementaire qui l'a produit.
Hébergée au Québec. Les données sont hébergées au Québec, dans les infrastructures infonuagiques du CAPP (Amazon Web Services). Aucune donnée personnelle n'est transmise à des tiers.
Comment les données circulent
De la manchette à l'écran : sept étapes, jamais de saisie manuelle entre les deux.
Sources. Treize médias québécois et canadiens pour la couverture de presse, et les débats de l'Assemblée nationale pour la vie parlementaire.
Collecte. Des programmes automatisés captent la page frontale des médias toutes les quatre heures, et les débats parlementaires à chaque jour de séance.
Lac de données. Les données brutes sont conservées telles quelles, dans leur format d'origine, dès leur collecte.
Entrepôt de données. Elles sont ensuite converties dans une forme structurée et interrogeable, organisée par source, sans jamais perdre leur origine ni leur trace dans le lac de données.
Raffinage. Des programmes automatisés et nos modèles d'intelligence artificielle (voir Nos modèles d'intelligence artificielle) calculent les indices publiés sur ce site : saillance médiatique, ton, part de voix des partis, enjeux dominants, promesses tenues.
Comptoirs de données. Les résultats du raffinage sont organisés en jeux de données thématiques, prêts à être consultés ou republiés.
Diffusion. Le site se reconstruit automatiquement à partir de ces jeux de données et republie une nouvelle édition, en continu.
Ce que cela permet
- Une donnée toujours fraîche : mise à jour au plus tard quatre heures après un fait nouveau dans les médias.
- Un historique interrogeable : chaque étape de la chaîne conserve ses propres données, ce qui permet de reconstituer et de vérifier n'importe quel chiffre publié.
- Une mise à l'essai avant chaque changement : tout ajout ou correctif est d'abord vérifié dans un environnement séparé de celui qui alimente le site public.
- Un code ouvert : le traitement des données est public sur nos dépôts GitHub (voir le § 11 de la méthodologie, Éthique et transparence).
Ce qu'elle ne fait pas encore
- Ce n'est pas une diffusion instantanée : la fraîcheur maximale est de quatre heures pour les médias, et d'un jour de séance pour l'Assemblée nationale.
- Une partie du repérage des sujets saillants dans les manchettes passe encore par un grand modèle de langue externe, en attendant la validation complète de nos propres modèles : voir Nos modèles.
- L'historique ne remonte pas à la même date pour toutes les régions couvertes : chaque source a été ajoutée à un moment différent de la vie du projet.