Nos étudiants en MBA spécialisés en journalisme de données ont réalisé une série de tutoriels pour leur projet final du cours Low Code : Transformer des données en articles d'actualité sans programmation, dispensé par le professeur Adriano Belisário. Ce mois-ci, découvrez certains de leurs travaux et explorez les tutoriels qu'ils ont créés. Le premier de la liste est l'œuvre de l'étudiante Beatriz Pinheiro.
Malgré les récents développements du football féminin brésilien, marqués par des modifications du calendrier, une meilleure diffusion des matchs et un intérêt accru des médias et du public, la professionnalisation de ce sport, interdit par décret pendant 40 ans au Brésil, accuse encore un certain retard. Ce retard se reflète dans les archives historiques du football féminin, ce qui complique considérablement le travail journalistique, car il est difficile de trouver des données systématiques pour étayer les articles.
Compte tenu de ce contexte, l'objectif de ce tutoriel est de présenter Web Scraper comme un outil permettant d'explorer et de créer des bases de données plus conviviales sur les équipes, les joueurs et les compétitions, afin non seulement de faciliter le travail journalistique, mais aussi de contribuer aux archives historiques du développement du football féminin brésilien.
Comprendre l'outil
Web Scraper est une extension Google Chrome qui permet d'extraire des données à partir du code HTML des sites web. Ce code structure les informations du site en éléments qui fonctionnent comme des « boîtes » dans lesquelles les données sont organisées. Le rôle de Web Scraper est d'extraire les données de ces boîtes et de les transformer en une feuille de calcul structurée.
La source de données utilisée dans ce tutoriel sera Soccerway Women, un site web qui compile des statistiques sur les matchs de football féminin du monde entier et des informations telles que : équipes, athlètes, championnats, matchs, résultats, etc. Pour cet exercice, nous utiliserons le tableau du Championnat féminin brésilien A1 – 2020 comme exemple et extrairons des informations sur toutes les athlètes qui ont participé à la compétition.
L'objectif est de sélectionner les données suivantes pour chaque joueur : club, nom, poste, âge, nombre de matchs joués et buts marqués en championnat. Si cette opération était effectuée manuellement, il faudrait accéder individuellement à la page de chacune des 16 équipes, saisir les informations de chaque joueur, puis copier-coller les données souhaitées dans un tableur.
Outre le fait d'être extrêmement laborieux et fastidieux, ce processus serait également plus sujet aux erreurs s'il était effectué manuellement, ce qui compromettrait l'analyse des données collectées. C'est là qu'intervient Web Scraper, qui permet d'automatiser les étapes mentionnées ci-dessus.
Mains en main
Pour commencer le processus d'extraction de données, la première étape consiste à installer Web Scraper, ce que vous pouvez faire en suivant ce lien. Ensuite, cliquez simplement sur l'icône des extensions en haut à droite de Google Chrome et sélectionnez Web Scraper pour l'activer.
Une fois l'extension installée et le classement du championnat féminin brésilien ouvert, nous ferons un clic droit et sélectionnerons l'option. InspecterRemarquez qu'un onglet s'ouvre en bas de l'écran, affichant des informations sur...
Codes de la page. Intéressons-nous à l'onglet. Grattoir Web, le dernier qui apparaît dans le menu, à droite.
Avec l'onglet Web Scraper ouvert, cliquez sur le bouton. Créer un nouveau plan de site et sélectionnez l'option créer un plan du siteDeux champs vides apparaîtront – le premier, Nom du plan du siteCe champ sera rempli avec le nom de votre robot, qui extraira les informations. Dans notre exemple, nous l'appellerons « brasileirao-feminino-2020 ». Le champ apparaîtra ci-dessous. URL de démarrageDans cette section, nous définirons la page de départ pour l'extraction des données. Dans cet exemple, il s'agit de la page du classement du championnat féminin brésilien.
Ensuite, nous définirons le premier paramètre que le robot devra extraire. Pour ce faire, nous cliquerons sur le bouton. Ajouter un nouveau sélecteur et travailler avec les champs ID, type et sélectionLe champ Id est utilisé pour nommer les informations que nous souhaitons extraire, et dans ce cas, nous voulons des informations sur chacune des équipes du championnat féminin brésilien, nous appellerons donc le sélecteur « équipes ».
Le champ « Type » indique le type d'élément de code HTML à extraire : texte, lien, image, etc. D'autres options apparaissent lorsqu'on clique dessus. En consultant le classement du Championnat féminin brésilien, on constate que chaque équipe du tableau est un lien qui renvoie vers sa page. Par conséquent, nous sélectionnerons cette option. lien.
L'étape suivante consiste à activer le bouton. Sélectionner Cliquez ensuite sur le nom de chaque équipe. Le lien est encadré en rouge et, à partir du deuxième clic, l'outil reconnaît automatiquement votre sélection. Vérifiez que tout est correct et confirmez en cliquant sur le bouton vert. sélection terminée, qui apparaît au-dessus de la barre d'inspection.
N'oubliez pas de cocher l'option. MultiplePour garantir que tous les éléments sélectionnés, c'est-à-dire toutes les équipes, soient reconnus par le sélecteur, il suffit de cliquer sur le bouton. sélecteur de sauvegarde tout en bas de la page, et voilà, le premier scraper.
Notre objectif est ici de recueillir des informations sur les athlètes de chaque équipe. Nous allons donc accéder à la page des Corinthians, première au classement, à titre d'exemple, et descendre jusqu'à la section où se trouvent les informations sur les athlètes.
Dans la barre de contrôle du Web Scraper, cliquez sur le sélecteur « teams » déjà créé et répétez la procédure précédente, cette fois pour chaque athlète de l'équipe : créez un nouveau sélecteur, saisissez « players » dans le champ ID, sélectionnez à nouveau le type d'élément « lien » pour que le robot accède à la page de chaque joueur, puis cliquez sur le bouton « Sélectionner ». Ensuite, sélectionnez simplement le nom de chaque joueur et cliquez sur « Terminer la sélection », en veillant à cocher l'option « Sélection multiple ». Enfin, enregistrez le sélecteur.
L'étape suivante consiste à accéder à la page d'un athlète, à cliquer sur le sélecteur « joueurs » dans la barre de contrôle du Web Scraper, et à répéter le processus pour obtenir les informations recherchées. Cette fois-ci, nous souhaitons sélectionner le poste occupé par chaque athlète ; nommons donc le sélecteur « position ». Le type d'élément que nous voulons sélectionner est un texteet nous n'aurons pas besoin de sélectionner l'option MultipleComme nous ne disposons que d'un seul bloc d'informations qui nous intéresse, il nous suffit de sauvegarder le sélecteur.
À partir de là, le processus reste le même pour les autres informations sur les athlètes que nous recherchons : l’âge, le nombre de matchs joués et les buts marqués cette saison.
Extraction des données
Une fois cette étape terminée, il est temps de procéder à l'extraction des données. Dans la barre de contrôle de l'outil d'extraction Web, cliquez sur le bouton. plan du site brasileirao-feminino-2020, sélectionnez l'option gratter, puis cliquez sur le bouton commencer à gratter.
Il est temps de se reposer, car le robot est déjà au travail : remarquez qu’une nouvelle fenêtre de navigateur s’ouvre, dans laquelle l’outil accède aux pages de chaque équipe et de chaque athlète du Championnat féminin brésilien 2020 pour extraire les données que nous avons spécifiées.
Une fois le processus terminé, cliquez simplement sur le bouton. rafraîchirL'outil d'extraction de données affichera ensuite un aperçu du tableau organisé. Il vous suffit ensuite de cliquer à nouveau sur le bouton « Plan du site ». Championnat féminin brésilien 2020 et sélectionnez l'option Exporter au format CSV.
Voilà ! Nous avons maintenant le tableau complet, avec des informations sur toutes les joueuses qui ont participé au Championnat féminin brésilien 2020.