Cette section présente les données contenues dans le jeu de données. Elle permet notamment de prendre connaissance des statistiques relatives aux différentes variables d’intérêt et de visualiser leur distribution.
Comme mentionné dans la section Importation et préparation des données, les données sur la vaccination sont disponibles sur une base quotidienne, mais tous les pays ne procédent pas à la mise à jour de leurs données avec la même fréquence.
Commençons par analyser la distribution des pays selon la plus récente observation en lien avec la vaccination.
ggplot(df_pays, aes(date, fill = continent)) +
geom_histogram() +
scale_x_date(name = "Date de l'observation") +
scale_y_continuous(name = "Fréquence") +
ggtitle("Distribution des pays selon la plus récente observation") +
theme_economist() +
theme(legend.position = "top", legend.direction = "horizontal",
legend.box = "horizontal",
legend.key.size = unit(0.6, "cm"),
plot.title = element_text(family="Tahoma", size = 14),
text = element_text(family = "Tahoma"),
axis.title = element_text(size = 10),
legend.text = element_text(size = 10),
legend.title= element_blank())

En analysant le graphique de la distribution des pays, le premier constat est que la majorité des observations sont datées après le mois de novembre. Il y a toutefois quelques pays dont les données les plus récentes se détachent des autres. De quel pays s’agit-il?
old %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Pays | Continent | Observation la plus récente |
|---|---|---|
| Turkmenistan | Asia | 2021-08-29 |
| Nauru | Asia | 2021-08-31 |
| Monaco | Europe | 2021-09-16 |
| Tuvalu | Asia | 2021-10-22 |
Si on exclut les 4 pays qui ont des observations qui datent de plus d’un mois, on obtient des observations dont la date varie entre le 2021-11-23 et le 2021-12-20, avec le 2021-12-16 comme date moyenne. En d’autres mots, l’écart varie de 1 à 28 jours avec une moyenne de 5 jours. Visuellement, voici la distribution :
ggplot(new, aes(date, fill = continent)) +
geom_histogram() +
scale_x_date(name = "Date de l'observation") +
scale_y_continuous(name = "Fréquence") +
ggtitle("Distribution des pays selon la plus récente observation") +
theme_economist() +
theme(legend.position = "top", legend.direction = "horizontal",
legend.box = "horizontal",
legend.key.size = unit(0.6, "cm"),
plot.title = element_text(family="Tahoma", size = 14),
text = element_text(family = "Tahoma"),
axis.title = element_text(size = 10),
legend.text = element_text(size = 10),
legend.title= element_blank())

Toujours en utilisant le jeu de données avec les observations les plus récentes par pays, explorons maintenant les statistiques descriptives des données sur la vaccination.
Statistiques descriptives des données sur la vaccination, selon l’observation la plus récente chaque payssommaire %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Variable | Minimum | Maximum | Moyenne | Écart type | Données manquantes |
|---|---|---|---|---|---|
| Vaccins administrés | 6086 | 2695181000 | 46330533 | 224735252 | 2 |
| Vaccins administrés par 100 hab. | 0 | 259 | 96 | 62 | 2 |
| Doses de rappels administrées | 1234 | 60715948 | 4519472 | 9243227 | 121 |
| Doses de rappels administrées par 100 hab. | 0 | 55 | 17 | 14 | 121 |
| Personnes vaccinées | 4010 | 829219869 | 17342271 | 67202500 | 8 |
| Personnes vaccinées par 100 hab. | 0 | 99 | 48 | 27 | 8 |
| Personnes pleinement vaccinées | 2076 | 551003319 | 13438338 | 46654532 | 7 |
| Personnes pleinement vaccinées par 100 hab. | 0 | 90 | 41 | 27 | 7 |
L’analyse de ce tableau montre beaucoup de disparités pour les 191 pays présents. En effet, l’écart entre les minimums et les maximums est généralement grand. Des minimums sont même nuls. Il est également possible de constater que 121 pays n’ont pas encore commencé à administrer des doses de rappel du vaccin.
Les statistiques précédentes sont très intéressantes. Toutefois, les statistiques ont été calculées sur les données de l’ensemble des pays. En considérant qu’il y a beaucoup de disparités entre les différentes régions du monde, il serait intéressant de voir comment les statistiques changent quand on groupe les pays par continent.
Données sur la vaccination, moyennemean_ens %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Continent | Vaccins administrés | Doses de rappels administrés | Personnes vaccinées | Personnes pleinement vaccinées |
|---|---|---|---|---|
| Africa | 5416231 | 701546 | 3488142 | 2220480 |
| America North | 34816263 | 7571546 | 17482795 | 14641773 |
| America South | 52637325 | 4933247 | 27219033 | 22647310 |
| Asia | 106509725 | 2952319 | 33486800 | 24545377 |
| Europe | 25629429 | 4372592 | 11868319 | 10991688 |
| Ensemble des pays | 46330533 | 4519472 | 17342271 | 13438338 |
mean100_ens %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Continent | Vaccins administrés par 100 hab. | Doses de rappels administrés par 100 hab. | Personnes vaccinées par 100 hab. | Personnes pleinement vaccinées par 100 hab. |
|---|---|---|---|---|
| Africa | 33.2 | 5.9 | 20.0 | 14.7 |
| America North | 104.0 | 8.0 | 52.8 | 45.1 |
| America South | 132.3 | 14.8 | 67.0 | 56.0 |
| Asia | 111.7 | 12.3 | 57.0 | 48.6 |
| Europe | 135.3 | 21.3 | 63.8 | 58.5 |
| Ensemble des pays | 95.8 | 16.7 | 48.2 | 41.3 |
Déjà avec ce tableau, il est possible de constater que les données varient beaucoup d’un continent à l’autre.
Observons maintenant la distribution des pays selon la variable personnes pleinement vaccinées par 100 habitants.
ggplot(df_pays) +
aes(x = continent, y = people_fully_vaccinated_per_hundred) +
geom_boxplot(shape = "circle") +
geom_jitter(position = position_jitter(width = 0.1, height = 0), alpha = 1/4, color = "#440154") +
labs(
x = "Continent",
y = "Personnes pleinements vaccinées par 100 habitants",
title = "Distribution des pays selon les personnes \npleinements vaccinées par 100 habitants"
) +
theme_economist() +
theme(plot.title = element_text(face = "bold", size = 14))

Ce graphique de boîtes à moustaches illustre bien la distribution des pays à l’intérieur des continents. L’Afrique, l’Asie et l’Europe se démarquent avec des pays qui se retrouvent répartis sur toute la distribution.
ggplot(df_pays) +
aes(x = continent, y = total_boosters_per_hundred) +
geom_boxplot(shape = "circle") +
geom_jitter(position = position_jitter(width = 0.1, height = 0), alpha = 1/4, color = "#440154") +
labs(
x = "Continent",
y = "Doses de rappels administrés par 100 hab.",
title = "Distribution des pays selon les doses de \nrappels administrés par 100 habitants"
) +
theme_economist() +
theme(plot.title = element_text(face = "bold", size = 14))

Voici les tableaux présentants les statistiques descritives et les graphiques de distributions des autres variables disponibles dans le jeu de données.
Statistiques descriptive de la variable populations_pop %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Continent | Médiane | Moyenne | Écart type | Minimum | Maximum |
|---|---|---|---|---|---|
| Africa | 13497237 | 25812940 | 36898867 | 98910 | 211400704 |
| America North | 4381583 | 25748347 | 72287712 | 53546 | 332915074 |
| America South | 18550418 | 36162513 | 58496108 | 591798 | 213993441 |
| Asia | 9749625 | 83487743 | 267583697 | 10873 | 1444216102 |
| Europe | 5680832 | 17725682 | 29391841 | 34010 | 145912022 |
ggplot(df_pays) +
aes(x = continent, y = population) +
geom_boxplot(shape = "circle") +
geom_jitter(position = position_jitter(width = 0.1, height = 0), alpha = 1/4, color = "#440154") +
labs(
y = "Population",
title = "Distribution des pays selon la population"
) +
theme_economist() +
theme(plot.title = element_text(face = "bold", size = 14))

On note ici que les données extrêmes rendent le graphique moins intéressant ou plus difficile à comprendre.
Statistiques descriptive de la variable espérance de vies_life %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Continent | Médiane | Moyenne | Écart type | Minimum | Maximum |
|---|---|---|---|---|---|
| Africa | 66.0 | 66.7 | 5.1 | 53.6 | 79.1 |
| America North | 75.1 | 76.0 | 3.4 | 66.3 | 82.5 |
| America South | 76.9 | 76.6 | 3.4 | 69.7 | 81.2 |
| Asia | 74.2 | 74.8 | 6.0 | 59.3 | 85.4 |
| Europe | 79.9 | 79.2 | 3.7 | 71.0 | 84.6 |
ggplot(df_pays) +
aes(x = continent, y = life_expectancy) +
geom_boxplot(shape = "circle") +
geom_jitter(position = position_jitter(width = 0.1, height = 0), alpha = 1/4, color = "#440154") +
labs(
y = "Espérance de vie",
title = "Distribution des pays selon l'espérance de vie"
) +
theme_economist() +
theme(plot.title = element_text(face = "bold", size = 14))

s_pib %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Continent | Médiane | Moyenne | Écart type | Minimum | Maximum |
|---|---|---|---|---|---|
| Africa | 36.6 | 121.5 | 240.7 | 0.8 | 1251.1 |
| America North | 34.3 | 1145.5 | 4401.9 | 0.8 | 21145.7 |
| America South | 169.7 | 519.4 | 858.7 | 8.3 | 3079.4 |
| Asia | 137.2 | 1134.4 | 3686.0 | 0.1 | 25626.5 |
| Europe | 180.7 | 662.2 | 1078.6 | 1.9 | 4435.5 |
ggplot(df_pays) +
aes(x = continent, y = gdp) +
geom_boxplot(shape = "circle") +
geom_jitter(position = position_jitter(width = 0.1, height = 0), alpha = 1/4, color = "#440154") +
labs(
y = "PIB réel estimé",
title = "Distribution des pays selon le PIB réel estimé (G$)"
) +
theme_economist() +
theme(plot.title = element_text(face = "bold", size = 14))

Ici encore on note que les données extrêmes rendent le graphique moins intéressant ou plus difficile à comprendre.
Statistiques descriptive de la variable PIB par habitant estimés_pib_capita %>%
kbl() %>%
kable_styling(bootstrap_options = c("striped", "hover", "condensed"), full_width = F)
| Continent | Médiane | Moyenne | Écart type | Minimum | Maximum |
|---|---|---|---|---|---|
| Africa | 3230 | 5444 | 5485 | 673 | 25346 |
| America North | 13347 | 17669 | 14233 | 2758 | 63517 |
| America South | 14052 | 14271 | 5416 | 5285 | 24346 |
| Asia | 11289 | 20841 | 22742 | 1950 | 94610 |
| Europe | 37790 | 39341 | 21020 | 12745 | 113004 |
ggplot(df_pays) +
aes(x = continent, y = income_per_person) +
geom_boxplot(shape = "circle") +
geom_jitter(position = position_jitter(width = 0.1, height = 0), alpha = 1/4, color = "#440154") +
labs(
y = "PIB réel estimé par habitant",
title = "Distribution des pays selon le PIB réel estimé par habitant"
) +
theme_economist() +
theme(plot.title = element_text(face = "bold", size = 14))

Les données utilisées pour les analyses sont disponibles pour le téléchargement sur la page Données pour téléchargement.
If you see mistakes or want to suggest changes, please create an issue on the source repository.
For attribution, please cite this work as
Lapierre (2021, Dec. 21). Projet final: Exploration des données. Retrieved from https://fas1002.github.io/FAS1002_projet-final
BibTeX citation
@misc{lapierre2021exploration,
author = {Lapierre, Stéphanie},
title = {Projet final: Exploration des données},
url = {https://fas1002.github.io/FAS1002_projet-final},
year = {2021}
}