Problème d’encodage des dump-text
Published on December 19 2012
Problème d’encodage en UTF-8
Nous avons rencontré un petit souci lors de l’exécution du script sur certaines dump-text des pages en français. C’est-à-dire, que lorsque nous lançons l’exécution pour convertir une page encodé en UTF-8 de départ, qu’on puisse avoir le même résultat pour un Dump-text, cela pose un souci car les Dump-text des pages en français pour wikipédia.
iconv -f $encodage -t utf-8 ../DUMP-TEXT/$k.txt >> ../DUMP-TEXT/$k-utf8.txt; #commande ICONV pour la conversion des pages dans un autre encodage vers un encodage en utf-8.
Par ailleurs deux de nos professeurs en programmation du projet encadré, monsieur Daube et monsieur Fleury nous ont donné un coup de main. Il essayé de résoudre ou voir quel était le problème des dump textes. Pourquoi, le dump-text des pages wikipédia en français émet des caractères non reconnu, alors qu’elle est bien encodée en UTF-8. Notre script posé de problème au niveau de l’encodage des dumps des pages wikipédia (aussi bien qu’en français qu’en français qu’en japonais).
Concernant l’aspiration des pages, celle en Japonaise s’aspirent presque toutes très bien, alors que les pages française renvoient beaucoup de 400 Bad request. Lucie, ma camarade, a ré-exécuter le script en dehors des postes de l’ILPGA, car nous avons constaté que peut-être c’est un problème de navigateur web. Elle a constaté que le résultat était encore pire c’est-à-dire que le retour http est 200 alors que la page aspirée affiche bad request.
Nous avons fait un va-et-vient sur le script et le résultat du tableau, aucun changement. Par contre, certaines pages en japonais encodé en uft-8 au départ se retrouver avec un encodage en ANSI, donc il suffisait de dérouler le menu affichage, encodage et coché utf-8 et le tour est joué.