Script d'aspiration des pages

Published on November 15 2012

Attention à bien initialiser la variable de comptage (que j'appelle k) des pages aspirées en dehors de la boucle, sans quoi les fichiers sont écrasés à chaque « passage » de boucle.

Problème : J'ai commencé par tester les aspirations avec wget, mais très peu de pages ont été aspirées. La plupart des fichiers de mon dossier PAGES-ASPIREES sont vides pour la plupart. Je ne comprends pas...

J'ai donc remplacé wget par curl et cette fois environ les trois quarts des urls ont été aspirées correctement, mais le reste renvoie toujours vers une page « 400 bad request » ou « Fichier introuvable ». Pourtant les URLs sont valides (aucune erreur 404). J'ai sélectionné plusieurs URLs sur le site d'information Rue89 et je remarque qu'aucune n'a pu être aspirée...

Le script d'aspiration

Le script d'aspiration

Par ailleurs j'ai modifié le code html pour que les URLs apparaissent sous un lien de type "URLx", afin de rendre le tableau plus "esthétique", ou du moins plus clair.

Script d'aspiration des pages

Written by Lucie

Repost0
To be informed of the latest articles, subscribe:
Comment on this post