Les jeux de données
Les quatre jeux de données de Comprendre les données sociales, gratuits, en format CSV et R. Chacun est accompagné d’un dictionnaire des variables en texte brut, pour qu’un fichier téléchargé il y a six mois ne soit jamais séparé du document qui l’explique.
Toutes ces données sont simulées. Elles ont été construites pour l’enseignement. Certains tableaux emploient de vrais noms de pays et de villes, mais aucune ligne ne décrit une personne, un ménage, une ville ou un pays réels, et rien ici ne doit être cité comme un fait sur le monde. L’annexe B du livre explique comment chaque jeu a été construit et à quoi il sert.
Télécharger
Les fichiers ne sont pas encore en ligne. Le livre est en préparation et les données paraîtront avec lui. Les liens ci-dessous montrent exactement ce qui s’y trouvera et sous quels noms, pour qu’un plan de cours ou un document de laboratoire rédigé maintenant fonctionne encore plus tard.
| Jeu de données | Unité d’analyse | Fichiers |
|---|---|---|
worldsim |
Pays |
CSV R Dictionnaire |
cma_panel |
Région métropolitaine × vague |
CSV R Dictionnaire |
socsurvey |
Personnes répondantes |
CSV R Dictionnaire |
censuspop |
Personnes, au sein de ménages |
CSV R Dictionnaire |
pool |
Personnes, au sein de ménages |
CSV R Dictionnaire |
Les tableaux, pour qui préfère lire que charger
L’annexe B du livre documente chaque jeu de données — ce qu’il contient, comment il a été construit, et chaque variable avec ses valeurs permises. Ce qu’elle n’imprime pas, ce sont les lignes elles-mêmes : en entier, elles dépassent la soixantaine de pages, et un tableau de deux mille lignes n’est pas quelque chose qui se lit sur papier. Ces tableaux sont donc publiés ici, présentés exactement comme l’annexe les décrit.
Si vous comptez analyser les données plutôt que
les lire, prenez plutôt le CSV ou le .rds ci-dessus. Le
PDF sert à chercher une valeur, à vérifier un chiffre à la main, et à
imprimer le bassin d’échantillonnage pour y tirer un échantillon au
crayon.
À savoir avant d’ouvrir un fichier
Ces conventions sont celles des dictionnaires imprimés : ce que vous voyez dans un fichier téléchargé signifie ce que le livre dit que cela signifie.
- Les catégories sont enregistrées sous forme de
nombres. Une variable comme
regioncontient 1, 2, 3 plutôt que « Afrique », « Asie », « Europe ». Le dictionnaire donne la correspondance, et les tableaux imprimés montrent aussi les codes. - Les codes de non-réponse sont laissés tels
quels. Les codes sentinelles 97, 98 et 99 ne sont
pas convertis en
NA. Les recoder est un exercice dans plusieurs chapitres, et le faire à votre place supprimerait la leçon. Si vous calculez une moyenne sans les recoder d’abord, vous obtiendrez une réponse fausse qui a l’air parfaitement raisonnable — et c’est précisément le but. - Deux variables existent en deux versions.
socsurveycontientincome, complète pour chaque personne répondante, et — dans le téléchargement seulement —income_rep, la même variable avec le profil de refus qu’une véritable enquête aurait produit.worldsimfait de même avecginietgini_rep. - L’encodage est UTF-8, avec une ligne d’en-tête, sans noms de lignes, et les valeurs manquantes écrites vides.
Le format CSV français
Les fichiers français emploient la convention européenne : point-virgule comme séparateur et virgule comme marque décimale. Un double-clic les ouvre donc comme un tableau dans un Excel en français, et non comme une seule colonne illisible.
# R — read.csv2(), et non read.csv()
socsurvey <- read.csv2("socsurvey.csv")
socsurvey <- readRDS("socsurvey.rds")
Les noms de colonnes restent en anglais, parce que ce sont ceux qui sont imprimés dans le livre. Les codes de pays ISO, les codes de province et les noms de régions métropolitaines ne sont pas traduits non plus : qui joint ce fichier à un fichier réel a besoin qu’ils concordent. Les noms de pays, eux, sont en français.
Les fichiers anglais, à point décimal et virgule séparatrice, sont sur la page anglaise. Ne mélangez pas les deux jeux : ils portent les mêmes noms de fichiers.
Code de réplication
Chaque jeu de données, chaque tableau et chaque figure du livre est produit par R, et les scripts sont publiés pour que vous puissiez voir exactement comment, changer ce que vous voulez, et confronter le livre à ses propres données.
L’archive contient les scripts de génération, les scripts de vérification qui font échouer la compilation si un jeu de données cesse de correspondre à ce que le livre en dit, et un fichier README indiquant quel script produit quel tableau et quelle figure.
Une seule archive pour les deux éditions : les générateurs vivent dans l’arbre anglais et produisent les deux langues. Les commentaires du code sont en anglais.
Licence et attribution
Les jeux de données et le code R sont diffusés sous licence Creative Commons Attribution 4.0 International (CC BY 4.0). Utilisez-les, modifiez-les, rediffusez-les, y compris commercialement et dans vos propres matériels pédagogiques — en citant la source.
Paradis, M. (2026). Comprendre les données sociales [Jeu de données]. https://www.markparadispolitics.com/books/comprendre-les-donnees-sociales/online/data.html
Un problème avec un fichier ?
Si un téléchargement est corrompu, si un dictionnaire contredit les données, ou si une variable ne se comporte pas comme l’annexe B l’annonce, dites-le-moi. Un jeu de données qui contredit sa propre documentation est un défaut, et non une particularité.