Dr. Mark Paradis

Les jeux de données

← Matériel en ligne · Le livre · English · Dernière mise à jour : août 2026

Les quatre jeux de données de Comprendre les données sociales, gratuits, en format CSV et R. Chacun est accompagné d’un dictionnaire des variables en texte brut, pour qu’un fichier téléchargé il y a six mois ne soit jamais séparé du document qui l’explique.

Toutes ces données sont simulées. Elles ont été construites pour l’enseignement. Certains tableaux emploient de vrais noms de pays et de villes, mais aucune ligne ne décrit une personne, un ménage, une ville ou un pays réels, et rien ici ne doit être cité comme un fait sur le monde. L’annexe B du livre explique comment chaque jeu a été construit et à quoi il sert.

Télécharger

Les fichiers ne sont pas encore en ligne. Le livre est en préparation et les données paraîtront avec lui. Les liens ci-dessous montrent exactement ce qui s’y trouvera et sous quels noms, pour qu’un plan de cours ou un document de laboratoire rédigé maintenant fonctionne encore plus tard.

Les jeux de données, un par un
Jeu de données Unité d’analyse Fichiers
worldsim Pays
Une ligne par pays. Indicateurs internationaux pour la comparaison, les échelles logarithmiques et l’erreur écologique.
cma_panel Région métropolitaine × vague
Une ligne par région métropolitaine et par vague. Tendance dans le temps, rupture de définition et saisonnalité.
socsurvey Personnes répondantes
Une ligne par personne répondante. Échelles d’attitude, énoncés à codage inversé et codes de non-réponse.
censuspop Personnes, au sein de ménages
Une population synthétique. Assez grande pour qu’un échantillon de cinquante n’en prélève qu’une petite part, ce que supposent les formules d’inférence.
pool Personnes, au sein de ménages
Le bassin d’échantillonnage : un court extrait de censuspop, assez court pour être imprimé et échantillonné à la main, avec une table de nombres aléatoires et un crayon.

Les tableaux, pour qui préfère lire que charger

L’annexe B du livre documente chaque jeu de données — ce qu’il contient, comment il a été construit, et chaque variable avec ses valeurs permises. Ce qu’elle n’imprime pas, ce sont les lignes elles-mêmes : en entier, elles dépassent la soixantaine de pages, et un tableau de deux mille lignes n’est pas quelque chose qui se lit sur papier. Ces tableaux sont donc publiés ici, présentés exactement comme l’annexe les décrit.

Si vous comptez analyser les données plutôt que les lire, prenez plutôt le CSV ou le .rds ci-dessus. Le PDF sert à chercher une valeur, à vérifier un chiffre à la main, et à imprimer le bassin d’échantillonnage pour y tirer un échantillon au crayon.

À savoir avant d’ouvrir un fichier

Ces conventions sont celles des dictionnaires imprimés : ce que vous voyez dans un fichier téléchargé signifie ce que le livre dit que cela signifie.

Le format CSV français

Les fichiers français emploient la convention européenne : point-virgule comme séparateur et virgule comme marque décimale. Un double-clic les ouvre donc comme un tableau dans un Excel en français, et non comme une seule colonne illisible.

# R — read.csv2(), et non read.csv()
socsurvey <- read.csv2("socsurvey.csv")
socsurvey <- readRDS("socsurvey.rds")

Les noms de colonnes restent en anglais, parce que ce sont ceux qui sont imprimés dans le livre. Les codes de pays ISO, les codes de province et les noms de régions métropolitaines ne sont pas traduits non plus : qui joint ce fichier à un fichier réel a besoin qu’ils concordent. Les noms de pays, eux, sont en français.

Les fichiers anglais, à point décimal et virgule séparatrice, sont sur la page anglaise. Ne mélangez pas les deux jeux : ils portent les mêmes noms de fichiers.

Code de réplication

Chaque jeu de données, chaque tableau et chaque figure du livre est produit par R, et les scripts sont publiés pour que vous puissiez voir exactement comment, changer ce que vous voulez, et confronter le livre à ses propres données.

L’archive contient les scripts de génération, les scripts de vérification qui font échouer la compilation si un jeu de données cesse de correspondre à ce que le livre en dit, et un fichier README indiquant quel script produit quel tableau et quelle figure.

Une seule archive pour les deux éditions : les générateurs vivent dans l’arbre anglais et produisent les deux langues. Les commentaires du code sont en anglais.

Licence et attribution

Les jeux de données et le code R sont diffusés sous licence Creative Commons Attribution 4.0 International (CC BY 4.0). Utilisez-les, modifiez-les, rediffusez-les, y compris commercialement et dans vos propres matériels pédagogiques — en citant la source.

Paradis, M. (2026). Comprendre les données sociales [Jeu de données]. https://www.markparadispolitics.com/books/comprendre-les-donnees-sociales/online/data.html

Un problème avec un fichier ?

Si un téléchargement est corrompu, si un dictionnaire contredit les données, ou si une variable ne se comporte pas comme l’annexe B l’annonce, dites-le-moi. Un jeu de données qui contredit sa propre documentation est un défaut, et non une particularité.