Comprendre les données sociales
Also available in English: Making Sense of Social Data
Comprendre les données sociales
Un manuel de méthodes quantitatives pour les sciences humaines
Première édition française · 2026 · Mark Paradis, Ph. D.
Traduction en cours. L’édition française paraît chapitre par chapitre. Le livre, le corrigé et le matériel en ligne se remplissent à mesure ; ce qui est déjà publié est complet et vérifié, et ce qui ne l’est pas est signalé comme tel partout sur ce site. Rien ici n’est annoncé avant d’exister.
La plupart des étudiantes et des étudiants rencontrent le devis de recherche dans un cours et les statistiques dans un autre, sans jamais voir qu’il s’agit de la même matière. Ce livre les enseigne ensemble : comment une question devient un concept mesurable, comment un concept devient des données, et ce que l’on a le droit de conclure une fois le calcul fait. Il s’adresse aux sciences humaines du cégep et du premier cycle universitaire, où la classe réunit d’un seul coup des sociologues, des économistes, des psychologues, des géographes, des historiennes et des historiens, des politologues et des anthropologues.
Les mathématiques qu’on y trouve sont de l’arithmétique appliquée avec soin. Chaque symbole est nommé en toutes lettres à sa première apparition, chaque formule est suivie d’un énoncé en langue courante de ce qu’elle fait, et des rappels mathématiques figurent à la fin comme référence — jamais comme préalable. Rien dans ce livre ne suppose que vous devriez déjà savoir quelque chose.
Ses quatre jeux de données sont simulés, et c’est le principe même plutôt qu’un compromis. L’un d’eux est une population complète : vous pouvez en tirer un échantillon, calculer une estimation, puis consulter la vraie valeur et voir de combien vous vous en approchez. Aucun jeu de données réel ne peut faire cela.
Les jeux de données, le code, les tables statistiques et le corrigé des exercices de fin de chapitre sont gratuits et ne nécessitent aucun achat.
Ce que contient le livre
Le livre se divise en trois parties, et l’ordre est celui d’une véritable recherche. La partie I demande comment passer d’une question à des données défendables. La partie II décrit les données une fois qu’on les a. La partie III demande ce qu’un échantillon autorise à dire d’une population, et parcourt les tests et les modèles qui y répondent.
Partie I — Méthodes de recherche
- Introduction aux méthodes quantitatives
- Concepts statistiques fondamentaux
- Introduction au devis de recherche
- Méthodes de collecte de données
- Techniques d’échantillonnage
Partie II — Statistiques descriptives
- Organiser et visualiser les données
- Mesures de tendance centrale
- Mesures de dispersion
- La distribution normale
- Statistiques descriptives bivariées
Partie III — Statistiques inférentielles
- Notions de base en probabilité
- Inférence et estimation
- Les tests d’hypothèses
- Le test du khi carré
- La comparaison de moyennes
- La régression simple
- L’analyse de variance
- Évaluation et interprétation
Annexes
- A. Rappels mathématiques — une référence, non un préalable
- B. Les jeux de données — comment chacun a été construit, et le dictionnaire de chaque variable
S’y ajoutent un glossaire, une bibliographie et un index.
Les tables z, t, du khi carré et F sont en ligne plutôt qu’imprimées, tout comme les plus longs des tableaux de données. Les unes et les autres sont gratuites, et la raison se trouve à la section suivante.
À qui s’adresse ce livre
- Aux étudiantes et étudiants du cégep inscrits en Méthodes quantitatives ou en Méthodes de recherche dans le programme de Sciences humaines
- Au premier cycle universitaire, en sociologie, science politique, psychologie, économie, géographie, histoire et anthropologie
- À celles et ceux qui arrivent en s’attendant à ce que les mathématiques soient le plus difficile, et qui ont besoin d’un livre qui ne le suppose pas
- Aux enseignantes et enseignants qui cherchent un manuel réunissant le devis et l’analyse en un seul volume, avec des données librement réutilisables
Les données
Tous les jeux de données du livre sont simulés. Ils ont été construits pour l’enseignement, ils sont décrits en détail à l’annexe B, et ils sont documentés jusqu’aux valeurs permises de chaque variable. Certains tableaux emploient de vrais noms de pays et de villes, mais aucun chiffre du livre ne décrit une personne, un ménage, une ville ou un pays réels, et aucun ne doit être cité comme un fait sur le monde.
Ils sont quatre, et chacun montre quelque chose que les autres ne peuvent pas montrer.
| Jeu de données | Unité d’analyse | Ce que lui seul peut montrer |
|---|---|---|
socsurvey |
Personne répondante | Échelles d’attitude, inversion de codage, codes de non-réponse, association au niveau individuel |
censuspop |
Personne, au sein d’un ménage | Une population dans laquelle on peut réellement échantillonner — distributions d’échantillonnage, effet de grappe, hypothèse d’indépendance |
cma_panel |
Région métropolitaine × vague | Le temps — tendance, rupture de définition, saisonnalité |
worldsim |
Pays | Le pays comme cas — échelles logarithmiques, comparaison internationale, erreur écologique |
Les jeux de données et les scripts R qui les produisent et les vérifient sont diffusés sous licence Creative Commons Attribution 4.0 International. Ils peuvent être utilisés, modifiés et rediffusés, y compris commercialement et dans d’autres matériels pédagogiques, à condition d’en citer la source. Le personnel enseignant d’ailleurs devrait pouvoir enseigner à partir de ces données sans demander la permission. Les jeux de données existent pour servir.
Télécharger les jeux de données et les dictionnaires →
Tout ce qui accompagne le livre
Certaines choses ont leur place dans un livre, d’autres non. Un tableau de deux mille lignes n’est pas quelque chose qui se lit sur papier ; le corrigé de tous les exercices de fin de chapitre aurait ajouté près de quatre-vingt-seize pages et, pire, aurait plafonné le nombre d’exercices que chaque chapitre peut porter ; et les quatre tables statistiques coûtaient vingt pages qu’on atteint plus vite sur un téléphone. Tout cela est donc en ligne — gratuit, et sans achat.
| Ressource | Consulter en ligne | Télécharger |
|---|---|---|
| Corrigé des exercices de fin de chapitre | Liste des chapitres | Tous les chapitres (PDF) |
| Tables statistiques — z, t, khi carré, F | Les quatre tables | |
| Tableaux de données — les longs, en entier | Au sujet des données | |
| Les quatre jeux de données, avec leurs dictionnaires | Page des données | ZIP |
| Code de réplication — tous les scripts qui produisent le livre | Ce qu’il contient | ZIP |
| Errata | Corrections connues | — |
Le corrigé des exercices situés à l’intérieur de chaque section reste dans le livre imprimé, immédiatement après les exercices auxquels il répond. C’est délibéré : ce sont des autoévaluations, et la réponse immédiate en est tout l’intérêt. Les déplacer en ligne transformerait une autoévaluation en devoir.
Parcourir tout le matériel en ligne →
Éditions
- Première édition française (2026) — cette page.
- Making Sense of Social Data — l’édition anglaise.
Quand paraîtra une deuxième édition, cette page se déplacera vers
/books/comprendre-les-donnees-sociales/1e/ et gardera son
propre matériel en ligne de façon permanente, pour qu’aucun lien ni
aucune citation vers la première édition ne se brise, et pour qu’une
personne travaillant à partir d’un tirage antérieur obtienne le
corrigé qui correspond à son livre.
Errata et commentaires
Les corrections entrent dans le tirage suivant, et elles sont véritablement bienvenues — de la part des étudiantes et des étudiants autant que du personnel enseignant. Si vous trouvez une erreur, ou simplement un passage obscur, dites-le-moi et je le corrigerai.