Vers des moteurs de recherche 'intelligents' : un outil de détection automatique de thèmes. Méthode basée sur l'identification automatique des chaînes de référence
Autor: | Longo, Laurence |
---|---|
Jazyk: | francouzština |
Rok vydání: | 2013 |
Předmět: |
[SCCO:LING] Cognitive science/Linguistics
[SCCO:LING] Sciences cognitives/Linguistique [SCCO:COMP] Cognitive science/Computer science [SCCO:COMP] Sciences cognitives/Informatique [SHS:LANGUE] Humanities and Social Sciences/Linguistics [SHS:LANGUE] Sciences de l'Homme et Société/Linguistique [INFO:INFO_TT] Computer Science/Document and Text Processing [INFO:INFO_TT] Informatique/Traitement du texte et du document RefGen Détection automatique de thèmes chaînes de référence traitement automatique des langues sémantique lexicale coréférence genres textuels segmentation thématique marqueurs linguistiques cohésion linguistique de corpus |
Druh dokumentu: | Diplomová práce |
Popis: | Cette thèse se situe dans le domaine du Traitement Automatique des Langues et vise à optimiser la classification des documents dans les moteurs de recherche. Les travaux se concentrent sur le développement d'un outil de détection automatique des thèmes des documents (ATDS-fr). Utilisant peu de connaissances, la méthode hybride adoptée allie des techniques statistiques de segmentation thématique à des méthodes linguistiques identifiant des marqueurs de cohésion. Parmi eux, les chaînes de référence - séquence d'expressions référentielles se rapportant à la même entité du discours (e.g. Paul...il...cet homme) - ont fait l'objet d'une attention particulière, car elles constituent un indice textuel important dans la détection des thèmes (i.e. ce sont des marqueurs d'introduction, de maintien et de changement thématique). Ainsi, à partir d'une étude des chaînes de référence menée dans un corpus issu de genres textuels variés (analyses politiques, rapports publics, lois européennes, éditoriaux, roman), nous avons développé un module d'identification automatique des chaînes de référence RefGen qui a été évalué suivant les métriques actuelles de la coréférence. |
Databáze: | Networked Digital Library of Theses & Dissertations |
Externí odkaz: |