Word sense disambiguation in multilingual contexts

Andrés Duque Fernández · 2017

espanolLa desambiguacion del sentido de las palabras se define como el proceso de identificacion del sentido que adopta una palabra polisemica, es decir, con varios significados posibles, en el contexto concreto de una oracion. Debido a la necesidad de definir sin ambiguedad posible el significado de todas las palabras de un texto para que un sistema automatico pueda entenderlo y trabajar con el, la desambiguacion semantica representa un aspecto crucial y transversal a cualquier tarea dentro del Procesamiento del Lenguaje Natural. La investigacion realizada en esta tesis doctoral se centra en la desambiguacion semantica en escenarios en los que existe la posibilidad de utilizar textos escritos en diversos idiomas. Dentro de estos escenarios, dividimos la tesis en dos grandes campos, en funcion de las tareas especificas de desambiguacion a las que nos enfrentamos: desambiguacion bilingue del sentido de las palabras, y desambiguacion multilingue en el dominio biomedico. En la primera tarea, el objetivo es, dada una palabra con multiples significados, escrita en un idioma inicial (generalmente ingles), encontrar su traduccion mas adecuada en un idioma final. La tarea de desambiguacion en el dominio biomedico se basa en encontrar el sentido correcto de un termino medico que puede apuntar a distintos conceptos concretos. Para hacer frente a las tareas propuestas, se utiliza una tecnica novedosa basada en grafos de co-ocurrencia: a traves de dicha tecnica se transforma la informacion no estructurada disponible en diversos corpus, en una base de conocimiento estructurada que se puede utilizar despues para realizar tareas de desambiguacion. La base de conocimiento es un grafo en el que los nodos representan conceptos del corpus, y los enlaces entre ellos contienen informacion relacionada con la significancia estadistica de su co-ocurrencia, es decir, de su aparicion conjunta en un mismo documento del corpus. En la primera tarea, la informacion multilingue es inherente al propio planteamiento del problema, ya que se busca obtener las traducciones mas adecuadas de palabras entre varios idiomas. En ella, nuestro sistema utiliza los grafos de co-ocurrencia para representar el conocimiento en el idioma objetivo. Los contextos de las palabras ambiguas, escritos en el idioma original y traducidos gracias a un diccionario bilingue creado automaticamente, se utilizan como fuente de informacion para que el grafo de co-ocurrencia realice la desambiguacion. En esta linea se presenta tambien un estudio sobre los diccionarios bilingues necesarios en este tipo de tareas. En lo que se refiere a la desambiguacion en el dominio biomedico, el multilinguismo se utiliza como evidencia adicional para comprobar si es posible mejorar la eficacia de sistemas monolingues en la tarea. Para ello, inicialmente se plantea una adaptacion de nuestro sistema para hacer frente a la tarea desde una perspectiva monolingue (en la que el grafo de coocurrencia se construye a partir de un corpus escrito en un unico idioma). A continuacion, se enriquece el grafo con informacion procedente de idiomas adicionales, para observar si este enriquecimiento desemboca en una mejora de los resultados obtenidos por el sistema. Se trata de una propuesta pionera en su campo, ya que no se han encontrado otros trabajos que utilicen informacion multilingue para la desambiguacion en el dominio biomedico. A lo largo del desarrollo de la tesis, se exploran multiples corpus monolingues y multilingues, tanto de proposito general como relacionados con un dominio especifico (en concreto el dominio biomedico). Tambien se han estudiado y comparado diversos algoritmos que utilizan el grafo de co-ocurrencia como base estructurada de conocimiento para realizar la desambiguacion final. La hipotesis matematica en la que se basa la construccion de nuestro grafo de co-ocurrencia ha sido comparada con otras tecnicas similares, ofreciendo mejores resultados. Asimismo, para cada una de las tareas consideradas (desambiguacion bilingue y desambiguacion en el dominio biomedico), nuestro sistema se ha comparado con otras tecnicas del estado del arte, presentando resultados muy competitivos. EnglishWord Sense Disambiguation (WSD) can be defined as the process of identifying the sense adopted by a polysemic word, that is, a word with different possible meanings, in a particular context within a sentence. This process represents a key aspect of any Natural Language Processing task, given the need of determining without ambiguity the correct meaning of all the words within a text, for an automatic system to be able to understand it and work with it. In this thesis, we present a research focused on Word Sense Disambiguation in scenarios in which it is possible to make use of information written in different languages. Considering those scenarios, we divide the thesis into two lines of study, depending on the specific WSD tasks that are tackled: Cross-Lingual Word Sense Disambiguation, and multilingual Word Sense Disambiguation in the biomedical domain. In the first task, the main aim is to find the most suitable translation for an ambiguous target term written in a source language (typically English) into a target one. The biomedical WSD task is based on finding the most suitable sense of a term that can refer to many different biomedical concepts. In order to address the proposed tasks, we use a novel technique based on co-occurrence graphs: through that technique, we are able to transform the unstructured information available in different corpora, into a structured base of knowledge that will be subsequently used for performing the disambiguation itself. This knowledge base is a graph in which nodes represent concepts from a given corpus, and the links between those nodes contain information related to the statistical significance of their co-occurrence, that is, of the appearance of both concepts in the same document of the corpus. Regarding the first task, multilingual information is inherent to the problem itself, since the objective is to find the most suitable translations of words between different languages. For addressing it, our system makes use of the co-occurrence graphs for representing the knowledge in the target language. Then, the contexts of the ambiguous terms, written in the source language and translated through an automatically created bilingual dictionary, are used as source of information for the co-occurrence graph to perform the disambiguation step. In this line of research we also present a study on the possible bilingual dictionaries needed in this kind of tasks. Considering the biomedical WSD task, in our research multilinguality is used as an additional evidence for testing whether it is possible to improve the performance of monolingual systems addressing the task. For that purpose, we initially adapt our system for tackling the task under a monolingual perspective (in which the co-occurrence graph is built from a corpus written in a single language). After that, we enhance the graph with information from additional languages, in order to study whether this enhancement leads to an improvement of the results obtained by the system. It is a pioneering research in this field, since no similar studies have been found in the literature that make use of multilingual information for performing WSD in the biomedical domain. We have explored many different monolingual and multilingual corpora along the development of this thesis, both written with general purposes and related to a specific domain (in particular, the biomedical domain). We have also studied and compared different algorithms that make use of the co-occurrence graph as a structured knowledge base for performing the final disambiguation. The mathematical hypothesis in which the construction of our co-occurrence graph is based, has been compared to similar techniques, offering better results. Similarly, for each of the considered tasks (Cross-Lingual WSD and biomedical WSD), our system has been compared with other state-of-the-art techniques, obtaining very competitive results.

Read the paper · More papers on PaperTik