Overblog All blogs Top blogs Jobs, Education & Studies
Follow this blog Administration + Create my blog
MENU
L'Américanisation

Master 1 Plurital 2012

Advertising

Top posts

  • Python : vérification de l'encodage et extraction du contenu textuel

    31 December 2012

    Les pages ont été aspirées. Celles qui n'ont pas été aspirées ont renvoyé un code erreur, qui a été récupéré, afin d'étudier l'erreur et/ou de procéder avec le traitement uniquement des pages qui ont été correctement aspirées. La prochaine étape est de...

  • Egrep et les Expression régulières:

    05 December 2012

    Durant cette séance, nous sommes revenues sur les problèmes d'encodage et nous avons vu le filtrage de motifs dans un fichier. Ceci va se faire à travers la commande "egrep" et avec le programme "minigrep" multilingue pour obtenir directement des contextes...

  • Python : extraction du contenu textuel et encodage (2ème essai)

    01 January 2013

    Suite aux problèmes rencontrés avec la détection de l'encodage avec chardet, nous avons cherché une autre solution. Nous avons entendu parler de la bibliothèque 'BeautifulSoup', qui pourrait peut-être mieux détecter l'encodage. C'est une bibliothèque...

  • Séance du 14 de novembre:

    19 November 2012

    1ère partie: Nous avons commencé le cours en apprenant une nouvelle commande d'unix : $locale Elle s'utilise pour savoir la configuration locale : On voit bien là que mon ordinateur suit les usages de la langue française et utilise UTF-8 pour l'encodage....

  • Le Trameur:

    19 December 2012

    Le trameur est un logiciel de textométrie qui fonctionne sur windows. Il sert à compter les unités d’un texte en tenant en compte les éventuelles parties du texte, afin d’évaluer par exemple l’évolution du vocabulaire dans une chronologie ou de comparer...

  • Séance du 21/11/2012 (Vérification de l'aspiration):

    27 November 2012

    Comme nous avons vu pendant la dernière séance, nous visons d’extraire le contenu textuel des pages aspirées. Les étapes qui suivent nécessitent du travail sur les pages que nous avons aspirées en utilisant "wget" ou "curl". Donc, la première étape qu’il...

  • Python : extraction des contextes

    01 January 2013

    La dernière étape de la création du tableau est l'extraction des contextes de notre mot choisi par une expression régulière, à partir du texte brut qu'on vient d'extraire. Nous avons déjà vu les expressions régulières dans l'extraction du charset (avec...

  • Aspiration en C:

    27 November 2012

    Cette étape du projet est un peu en retard par rapport au script en bash et il est facile de comprendre pourquoi on m'a demandé pourquoi je voulais faire l'aspiration des sites en C au lieu de la faire en bash ou en python. La première grande étape était...

  • Séance du 21/11/2012 continuée (Une question d'encodage):

    27 November 2012

    Nous allons travailler uniquement dans un environnement Unicode. Il est donc nécessaire que tous les textes soient encodés en Unicode. Nous avons vu pour l’instant que ce n’est pas le cas, et qu’il faudrait convertir les pages qui ne sont pas en UTF-8...

  • Python : Vérification de l'aspiration

    12 December 2012

    Jusqu'à maintenant nous sommes arrivées à aspirer les pages web contenu dans plusieurs fichiers et stocker les liens vers les pages aspirées dans le tableau. Le processus est le même qu'avec Bash. ll faudrait : vérifier que l'aspiration du site n'a pas...

  • Aspiration des URLs...

    13 November 2012

    Second script : Le second script consiste à créer un tableau de liens avec des liens externes vers les pages visées et de liens internes vers les pages correspondantes aspirées. Il s’agit ainsi de modifier le script 1 en ajoutant la commande « wget »...

  • Premier script Bash

    23 October 2012

    Comment écrire mon premier script? Sur mon mac, j'ouvre l'éditeur de text aquamacs, qui me permet de créer des fichiers .txt. Sur cet éditeur, j'écris le script suivant, lequel j'ai nommé primerescript.txt: La première ligne commence par les symboles...

  • Séance du 05/12/2012:

    09 December 2012

    La dernière étape dans la rédaction du script consiste à ajouter quelques lignes de code pour la création des fichiers globaux nécessaires pour la deuxième phase du projet. Pour chaque langue, il faut créer un fichier global "dump" pour le trameur et...

  • Un Script bash pour générer des tableaux html...

    05 November 2012

    Premier script: La création d’un tableau en HTML qui contient les urls des sites que nous avons trouvés. Il est possible de changer le formatage du tableau en ajoutant des attributs et des valeurs à l’intérieur des balises : Pour faire une "jolie"!! table...

  • Les nuages :

    17 December 2012

    La première étape dans la phase 2 du projet consiste à faire des nuages de mots en utilisant des logiciels en ligne comme Wordle, Tagclouder ou Word it out. Ces logiciels travaillent sur la fréquence des mots dans le corpus et certains reposent sur un...

  • Des scripts dans d'autres langages pour générer des tableaux html...

    05 November 2012

    Un script en C pour générer le même fichier de tableau : (à voir s'il est possible de le simplifier) fichierin désigne le fichier où on se liront les informations à utiliser (les fichiers des urls). C’est l’input ! fichierout désigne le fichier où s’écriront...

  • Séance du 28/11/2012 :

    05 December 2012

    L'intégration dans le script: Nous avons 3 étapes à ajouter cette semaine : la détection d'encodage niveau 2 l'extraction des contextes et le nombre d'occurrences du motif choisi (fichier texte) l'extraction des contextes par le programme minigrep (fichier...

  • Séance du 24/10/2012:

    05 November 2012

    Solutions des exercices concernant les scripts Bash: 1)Création d'une page HTML ayant comme titre nos noms et contenant un tableau avec 2 lignes (sur la première, votre nom, sur la seconde, le mot choisi pour votre projet) et 2 colonnes. 2)Exercice 1:...

  • UNIX: Les commandes

    14 October 2012

    Pour interagir avec un terminal, il faut lui donner des commandes à réaliser. Sous Unix, la commande commence par son nom (ressource) unique et univoque. On peut y accéder par un chemin relatif ou un chemin absolu. Quelques commandes peuvent être créées...

  • Aspiration des URLs en python

    15 November 2012

    L'aspiration des pages en python a été assez simple et la plupart des pages ont été aspirées sans problème. Malgré tout, il reste quelques pages toujours problématiques. Il faut voir si nous pouvons résoudre ces problèmes et vérifier surtout que ces sites-là...

  • A la recherche des URL...

    05 November 2012

    Avant-propos: La première étape dans notre projet est la constitution d'un corpus multilingue. Ceci signifie la recherche des sites sur Internet correspondants à notre thématique choisie et le stockage de leurs URL dans un fichier .txt pour chaque langue...

  • UNIX : Introduction au système de stockage et aux chemins d'accès

    14 October 2012

    Le système de stockage est organisé sous une forme d’arborescence - une hiérarchie de répertoires et de sous-répertoires structurés dans des branches depuis la racine. Pour pouvoir accéder à un fichier ou à un répertoire, il faut suivre un chemin d’accès....

  • Séance du 10/10/2012:

    10 October 2012

    Le choix d'une thématique pour le projet consiste, en effet, à définir un thème et choisir un couple de langues (ou plus) sur lequel nous travaillerons. Il faut repérer les URL des pages correspondant à notre thématique, tout en constituant un ficher...

  • Arborescence de travail du projet

    05 November 2012

    Afin d'avoir le même environnement de travail, nous devons toutes construire la même arborescence avec le script suivant :

  • Séance du 03/10/2012 :

    03 October 2012

    La création de ce blog marque le début de notre projet sur lequel nous travaillerons dans le cadre du cours « Programmation et Projet Encadré » en M1 Ingénierie Linguistique. Ce blog nous servira, en effet, d'un journal de bord tout au long du semestre....

1 2 > >>