Master 1 Plurital 2012
Les pages ont été aspirées. Celles qui n'ont pas été aspirées ont renvoyé un code erreur, qui a été récupéré, afin d'étudier l'erreur et/ou de procéder avec le traitement uniquement des pages qui ont été correctement aspirées. La prochaine étape est de...
Durant cette séance, nous sommes revenues sur les problèmes d'encodage et nous avons vu le filtrage de motifs dans un fichier. Ceci va se faire à travers la commande "egrep" et avec le programme "minigrep" multilingue pour obtenir directement des contextes...
Suite aux problèmes rencontrés avec la détection de l'encodage avec chardet, nous avons cherché une autre solution. Nous avons entendu parler de la bibliothèque 'BeautifulSoup', qui pourrait peut-être mieux détecter l'encodage. C'est une bibliothèque...
1ère partie: Nous avons commencé le cours en apprenant une nouvelle commande d'unix : $locale Elle s'utilise pour savoir la configuration locale : On voit bien là que mon ordinateur suit les usages de la langue française et utilise UTF-8 pour l'encodage....
Le trameur est un logiciel de textométrie qui fonctionne sur windows. Il sert à compter les unités d’un texte en tenant en compte les éventuelles parties du texte, afin d’évaluer par exemple l’évolution du vocabulaire dans une chronologie ou de comparer...
Comme nous avons vu pendant la dernière séance, nous visons d’extraire le contenu textuel des pages aspirées. Les étapes qui suivent nécessitent du travail sur les pages que nous avons aspirées en utilisant "wget" ou "curl". Donc, la première étape qu’il...
La dernière étape de la création du tableau est l'extraction des contextes de notre mot choisi par une expression régulière, à partir du texte brut qu'on vient d'extraire. Nous avons déjà vu les expressions régulières dans l'extraction du charset (avec...
Cette étape du projet est un peu en retard par rapport au script en bash et il est facile de comprendre pourquoi on m'a demandé pourquoi je voulais faire l'aspiration des sites en C au lieu de la faire en bash ou en python. La première grande étape était...
Nous allons travailler uniquement dans un environnement Unicode. Il est donc nécessaire que tous les textes soient encodés en Unicode. Nous avons vu pour l’instant que ce n’est pas le cas, et qu’il faudrait convertir les pages qui ne sont pas en UTF-8...
Jusqu'à maintenant nous sommes arrivées à aspirer les pages web contenu dans plusieurs fichiers et stocker les liens vers les pages aspirées dans le tableau. Le processus est le même qu'avec Bash. ll faudrait : vérifier que l'aspiration du site n'a pas...
Second script : Le second script consiste à créer un tableau de liens avec des liens externes vers les pages visées et de liens internes vers les pages correspondantes aspirées. Il s’agit ainsi de modifier le script 1 en ajoutant la commande « wget »...
Comment écrire mon premier script? Sur mon mac, j'ouvre l'éditeur de text aquamacs, qui me permet de créer des fichiers .txt. Sur cet éditeur, j'écris le script suivant, lequel j'ai nommé primerescript.txt: La première ligne commence par les symboles...
La dernière étape dans la rédaction du script consiste à ajouter quelques lignes de code pour la création des fichiers globaux nécessaires pour la deuxième phase du projet. Pour chaque langue, il faut créer un fichier global "dump" pour le trameur et...
Premier script: La création d’un tableau en HTML qui contient les urls des sites que nous avons trouvés. Il est possible de changer le formatage du tableau en ajoutant des attributs et des valeurs à l’intérieur des balises : Pour faire une "jolie"!! table...
La première étape dans la phase 2 du projet consiste à faire des nuages de mots en utilisant des logiciels en ligne comme Wordle, Tagclouder ou Word it out. Ces logiciels travaillent sur la fréquence des mots dans le corpus et certains reposent sur un...
Un script en C pour générer le même fichier de tableau : (à voir s'il est possible de le simplifier) fichierin désigne le fichier où on se liront les informations à utiliser (les fichiers des urls). C’est l’input ! fichierout désigne le fichier où s’écriront...
L'intégration dans le script: Nous avons 3 étapes à ajouter cette semaine : la détection d'encodage niveau 2 l'extraction des contextes et le nombre d'occurrences du motif choisi (fichier texte) l'extraction des contextes par le programme minigrep (fichier...
Solutions des exercices concernant les scripts Bash: 1)Création d'une page HTML ayant comme titre nos noms et contenant un tableau avec 2 lignes (sur la première, votre nom, sur la seconde, le mot choisi pour votre projet) et 2 colonnes. 2)Exercice 1:...
Pour interagir avec un terminal, il faut lui donner des commandes à réaliser. Sous Unix, la commande commence par son nom (ressource) unique et univoque. On peut y accéder par un chemin relatif ou un chemin absolu. Quelques commandes peuvent être créées...
L'aspiration des pages en python a été assez simple et la plupart des pages ont été aspirées sans problème. Malgré tout, il reste quelques pages toujours problématiques. Il faut voir si nous pouvons résoudre ces problèmes et vérifier surtout que ces sites-là...
Avant-propos: La première étape dans notre projet est la constitution d'un corpus multilingue. Ceci signifie la recherche des sites sur Internet correspondants à notre thématique choisie et le stockage de leurs URL dans un fichier .txt pour chaque langue...
Le système de stockage est organisé sous une forme d’arborescence - une hiérarchie de répertoires et de sous-répertoires structurés dans des branches depuis la racine. Pour pouvoir accéder à un fichier ou à un répertoire, il faut suivre un chemin d’accès....
Le choix d'une thématique pour le projet consiste, en effet, à définir un thème et choisir un couple de langues (ou plus) sur lequel nous travaillerons. Il faut repérer les URL des pages correspondant à notre thématique, tout en constituant un ficher...
Afin d'avoir le même environnement de travail, nous devons toutes construire la même arborescence avec le script suivant :
La création de ce blog marque le début de notre projet sur lequel nous travaillerons dans le cadre du cours « Programmation et Projet Encadré » en M1 Ingénierie Linguistique. Ce blog nous servira, en effet, d'un journal de bord tout au long du semestre....