Master 1 Plurital 2012
November 15 2012
L'aspiration des pages en python a été assez simple et la plupart des pages ont été aspirées sans problème. Malgré tout, il reste quelques pages toujours problématiques. Il faut voir si nous pouvons résoudre ces problèmes et vérifier surtout que ces sites-là existent toujours.
Aspirer les pages ressemble beaucoup à la manipulation des fichiers, il s'agit d'ouvrir un flux vers une page, lire dedans, et puis de fermer.
Ceci nécessite l'importation de la bibliothèque urllib et s'effectue ainsi :
flux = urllib.urlopen(ligne)
codehtml = flux.read()
flux.close()
Maintenant il s'agit de stocker le code html récupéré dans un fichier sous le répertoire PAGES-ASPIREES. Pour l'organisation des pages aspirées, j'utilise la méthode citée dans l'article précédent, où les fichiers sont numérotés et placés dans les sous-dossiers qui portent le titre de chaque fichier url (sans l'extension) :
pageaspiree=open("../PAGES-ASPIREES/"+filenametitle+"/page"+str(i)+".html", "w" )
print>>pageaspiree, codehtml
pageaspiree.close()
Dans notre tableau, une troisième colonne sera ajoutée avec un lien vers chaque page aspirée.