Intrinsic Semantic Spaces for the representation of documents and semantic annotated data
Juan J. Lastra-Díaz, Juan José · Espacio Tiempo y Forma Serie I Prehistoria y Arqueología · 2014
Esta tésis presenta dos nuevos espacios de representación semántica para doc- umentos de texto y datos anotados semánticamente, los cuales se basan en un en- foque de geometría intrínseca, así como otros resultados, entre los cuales tenemos: una nueva distancia semántica sobre ontologías denominada distancia ponderada de Jiang-Conrath, una distribución normal generalizada sobre variades diferenciables que denominamos distribución normal geodésica, la cual nos conduce a la de nición de la distancia geodésica de Mahalanobis. Por último, probamos que cualquier clasi- cador de Bayes sobre una variedad induce un diagrama de Voronoi dual sobre su dominio. El modelo de recuperación de la información (RI) basado en ontologías parece prometedor, a pesar de aún no haber sido evaluado experimentalmente. Por otro lado, el clasi cador de texto ha arrojado un primer resultado desesperanzador debido a ciertas di cultades en el entrenamiento del modelo. El hilo conductor de nuestra investigación es el uso de nociones de geometría diferencial e invarianza geométrica como medio para cubrir algunas oprtunidades de mejora y problemas encontrados en los modelos actuales encontrados en la bib- liografía. Tanto el modelo RI basado en ontologías, como el clasi cador de texto propuestos en esta tésis, son inspirados por un enfoque geométrico, cuya principal idea es la integración de las estructuras geométricas del problema en los espacios de representación semántica de la información. En suma, nuestro enfoque intenta construir mejores modelos de espacios semánticos mediante la incorporación de las propiedades y restricciones de los objetos matemáticos involucrados en su de nición. La primera parte de la tésis presenta un nuevo modelo RI basado en ontologías que de ne una inmersión de una ontología poblada en un espacio métrico, la cual es denominada Espacios Intrínsecos Ontológicos y tiene como principal propiedad la preservación de las estructuras codi cadas en las ontologías. En la segunda parte, presentamos un nuevo clasi cador de documentos de texto, denominado Clasi cador Intrínseco de Bayes-Voronoi, el cual se basa en la representación de los vectores de documento mediante un modelo generativo expresado sobre una variedad diferen- ciable, cuya función de distribución es de nida sobre la hiperesfera unitaria, en vez de sobre el espacio euclídeo ambiente. Los Espacios Intrínsecos Ontológicos introducen un nuevo modelo téorico de recuperación de la información que parece prometedor, si bien, como ya hemos señalado, éste aún no ha sido evaluado experimentalmente. El modelo propuesto es descrito en profundidad y validado con respecto a nuestros axiomas de diseño. La motivación detrás de nuestro modelo es el descubrimiento de un conjunto de inconsistencias geométricas en algunos modelos RI basados en ontologías, las cuales se derivan de ciertas propiedades pasadas por alto en sus adaptaciones del modelo de espacio vectorial (VSM). En esencia, nuestro modelo refuta el uso irre exivo del modelo VSM en toda clase de tareas semánticas en el ámbito del procesamiento natural del lenguaje. A pesar de que el enfoque teórico es intersante por sí mismo, nuestra principal hipótesis es que el enfoque invariante que proponemos en el modelo, debería con- ducirnos a mejorar la calidad de clasi cación, así como las medidas de precisión y cobertura en los sistemas de recuperación de información de tipo semántico. Los Espacios Intrínsecos Ontológicos son, hasta donde alcanza nuestro conoci- miento, el primer modelo de recuperación de la información basado en ontologías donde cada componente del sistema ha sido diseñado basado en la ontología base para preservar todas las estructuras intrínsecas presentes. La geometría intrínseca de una ontología es de nida por tres estructuras algebraicas: (1) la relación de orden de la taxonomía, (2) la relación de inclusión de conjuntos, y (3) su métrica semántica intrínseca. De esta forma, los métodos para la representación de las consultas, unid- ades de información, funciones de pesado, clasi cación por relevancia y recuperación, han sido diseñados a partir de axiomas fundamentados en principios geométricos, con el objetivo de capturar todo el conocimiento codi cado en la ontología base. Empleando el lenguaje de la teoría de categorías, nuestro modelo construye una equivalencia natural, o mor smo, entre la ontología poblada de entrada y el espacio de representación para las unidades de información indexadas. Finally, ell clasi cador de Bayes-Voronoi, introducido en la segunda parte de la tésis, emplea un modelo generativo para representar documentos de texto, el cual es de nido por una distribución normal vectorial sobre la hiperesfera unitaria, la cual denominamos distribución normal geodésica. Dicha distribución es de nida sobre la hiperesfera unitaria, vista como una variedad diferenciable, en vez de sobre el espacio euclídeo ambiente. La idea clave es la observación de que los vectores normalizados están contenidos en la hiperesfera unitaria, en de vez de sobre el espacio euclídeo am- biente, y el modelo propuesto integra de forma explícita dicha propiedad. El modelo reduce una unidad la dimensión de los vectores normalizados, la cual corresponde a la proyección de los vectores de datos sobre la hiperesfera unitaria (normalización). Asimismo, la distribución normal geodésica nos conduce a la de nición de la dis- tancia de Mahalanobis sobre una variedad diferenciable, distancia que denominamos distancia geodésica de Mahalanobis. Por último, probamos que cualquier clasi cador de Bayes sobre una variedad induce un diagrama de Voronoi dual sobre su dominio.