Méthodes et couverture

Comment HealthArchive.ca est développé

Cette page décrit comment les instantanés du corpus actuel de contenu Web de santé publique de HealthArchive.ca ont été capturés et sont préservés, indexés et relus. La couverture est limitée au corpus existant; toute future capture ou extension nécessite une décision de continuité des données autorisée séparément.

Portée actuelle de l’archive

La phase initiale se concentre sur des sites fédéraux canadiens de santé publique dont le contenu soutient directement les directives cliniques, la surveillance ou des communications publiques à fort impact. Exemples :

  • Agence de la santé publique du Canada (p. ex. pages sur les maladies, rapports de surveillance, directives d’immunisation).
  • Santé Canada (p. ex. pages sur les vaccins et les médicaments, informations sur la sécurité environnementale et des produits).

Les sources provinciales, territoriales et internationales se trouvent hors de la portée actuelle. L’examen de toute source supplémentaire nécessiterait une décision de continuité des données autorisée séparément; aucune extension n’est présumée.

La portée est volontairement limitée et définie, source par source, par des règles explicites d’inclusion et d’exclusion afin que le projet privilégie une provenance fiable plutôt que l’ampleur.

Le corpus existant comprend des éditions annuelles étiquetées et, lorsque pertinent, des captures ponctuelles explicitement étiquetées. Il n’existe aucune cadence de capture future par défaut : toute nouvelle campagne annuelle ou ponctuelle nécessite une décision de continuité des données autorisée séparément.

Méthodes de capture

HealthArchive.ca utilise une exploration Web basée sur un navigateur et des formats d’archives Web normalisés (WARC). À haut niveau, chaque capture fonctionne ainsi :

  1. Des URL de départ sont définies pour chaque domaine et chemin cibles, avec des règles précises sur ce qu’il faut inclure ou exclure.
  2. Un robot d’exploration basé sur un navigateur visite les pages dans le périmètre, exécute JavaScript lorsque nécessaire et enregistre les réponses dans des fichiers d’archives Web.
  3. Les réponses sont stockées dans des fichiers d’archives avec des métadonnées telles que l’heure de capture, le statut HTTP et le type de contenu.

Les captures sont stockées dans des WARC et indexées dans une base de données consultable. Le site public relit le HTML archivé via le backend et, lorsque disponible, peut offrir une navigation de meilleure fidélité via un service de relecture. La fidélité de relecture varie selon le site et le type de contenu.

Les filtres de plage de dates dans l’explorateur d’archives utilisent des dates de capture en UTC.

Stockage et relecture

L’archive s’appuie sur un stockage dédié pour les fichiers WARC. Lorsque la relecture est activée, un moteur tel que pywb peut rendre des instantanés historiques de meilleure fidélité dans un navigateur. Les objectifs de la relecture sont :

  • Préserver la structure des URL originales lorsque possible.
  • Étiqueter clairement les horodatages de capture et rendre évident que la vue est archivistique, pas en direct.
  • Conserver les éléments interactifs (p. ex. tableaux de bord) aussi fidèlement que les contraintes techniques le permettent.

L’interface est volontairement conservatrice : elle privilégie la clarté que vous consultez du contenu archivé. Certains tableaux de bord interactifs, visualisations intégrées ou ressources tierces peuvent ne pas se relire parfaitement en raison de contraintes JavaScript, d’API ou d’hébergement.

Suivi des changements

HealthArchive.ca compare des captures archivées afin de mettre en évidence les changements de texte entre éditions. Cela est conçu pour la vérifiabilité et la citation, et non pour l’interprétation.

  • Les changements sont calculés à partir de captures HTML archivées.
  • Les comparaisons sont uniquement descriptives (par exemple : sections ajoutées, retirées ou mises à jour) et ne fournissent pas de recommandations.
  • Les flux de changements tiennent compte des éditions par défaut et reflètent les éditions étiquetées du corpus existant, sans engagement envers une future cadence annuelle.

Limites et interprétation

  • Pas des directives officielles : Le contenu archivé reflète ce que les sites publics montraient au moment de la capture. Il peut être incomplet, périmé ou remplacé, et ne doit pas être traité comme des directives cliniques actuelles ni comme un avis médical.
  • Échantillonnage et couverture : Les premières phases se concentrent sur des domaines et des chemins spécifiques à forte valeur. Les lacunes de couverture et les limites connues seront documentées afin que l’« absence » d’une page archivée ne soit pas mal interprétée.
  • Artefacts techniques : Certains tableaux de bord interactifs, visualisations intégrées ou ressources tierces peuvent ne pas se relire parfaitement en raison de contraintes JavaScript, d’API ou d’hébergement.