Semantic Keyword-based Search on Heterogeneous Information Systems

Carlos Bobed · 2013

En los ultimos anos, con la difusion y el uso de Internet, el volumen de informacion disponible para los usuarios ha crecido exponencialmente. Ademas, la posibilidad de acceder a dicha informacion se ha visto impulsada por los niveles de conectividad de los que disfrutamos actualmente gracias al uso de los moviles de nueva generacion y las redes inalambricas (e.g., 3G, Wi-Fi). Sin embargo, con los metodos de acceso actuales, este exceso de informacion es tan perjudicial como la falta de la misma, ya que el usuario no tiene tiempo de procesarla en su totalidad. Por otro lado, esta informacion esta detras de sistemas de informacion de naturaleza muy heterogenea (e.g., buscadores Web, fuentes de Linked Data, etc.), y el usuario tiene que conocerlos para poder explotar al maximo sus capacidades. Esta diversidad se hace mas patente si consideramos cualquier servicio de informacion como potencial fuente de informacion para el usuario (e.g., servicios basados en la localizacion, bases de datos exportadas mediante Servicios Web, etc.). Dado este nivel de heterogeneidad, la integracion de estos sistemas se debe hacer externamente, ocultando su complejidad al usuario y dotandole de mecanismos para que pueda expresar sus consultas de forma sencilla. En este sentido, el uso de interfaces basados en palabras clave se ha popularizado gracias a su sencillez y a su adopcion por parte de los buscadores Web mas usados. Sin embargo, esa sencillez que es su mayor virtud tambien es su mayor defecto, ya que genera problemas de ambiguedad en las consultas. Las consultas expresadas como conjuntos de palabras clave son inherentemente ambiguas al ser una proyeccion de la verdadera pregunta que el usuario quiere hacer. En la presente tesis, abordamos el problema de integrar sistemas de informacion heterogeneos bajo una busqueda guiada por la semantica de las palabras clave; y presentamos QueryGen, un prototipo de nuestra solucion. En esta busqueda semantica abogamos por establecer la consulta que el usuario tenia en mente cuando escribio sus palabras clave, en un lenguaje de consulta formal para evitar posibles ambiguedades. La integracion de los sistemas subyacentes se realiza a traves de la definicion de sus lenguajes de consulta y de sus modelos de ejecucion. En particular, nuestro sistema: - Descubre el significado de las palabras clave consultando un conjunto dinamico de ontologias, y desambigua dichas palabras teniendo en cuenta su contexto (el resto de palabras clave), ya que cada una de las palabras tiene influencia sobre el significado del resto de la entrada. Durante este proceso, los significados que son suficientemente similares son fusionados y el sistema propone aquellos mas probables dada la entrada del usuario. La informacion semantica obtenida en el proceso es integrada y utilizada en fases posteriores para obtener la correcta interpretacion del conjunto de palabras clave. - Un mismo conjunto de palabras pueden representar diversas consultas aun cuando se conoce su significado individual. Por ello, una vez establecidos los significados de cada palabra y para obtener la consulta exacta del usuario, nuestro sistema encuentra todas las preguntas posibles utilizando las palabras clave. Esta traduccion de palabras clave a preguntas se realiza empleando lenguajes de consulta formales para evitar las posibles ambiguedades y expresar la consulta de manera precisa. Nuestro sistema evita la generacion de preguntas semanticamente incorrectas o duplicadas con la ayuda de un razonador basado en Logicas DescriptivasEn este proceso, nuestro sistema es capaz de reaccionar ante entradas insuficientes (e.g., palabras omitidas) mediante la adicion de terminos virtuales, que representan internamente palabras que el usuario tenia en mente pero omitio cuando escribio su consulta. - Por ultimo, tras la validacion por parte del usuario de su consulta, nuestro sistema accede a los sistemas de informacion registrados que pueden responderla y recupera la respuesta de acuerdo a la semantica de la consulta. Para ello, nuestro sistema implementa una arquitectura modular permite anadir nuevos sistemas al vuelo siempre que se proporcione su especificacion (lenguajes de consulta soportados, modelos y formatos de datos, etc.). Por otro lado, el trabajar con sistemas de informacion heterogeneos, en particular sistemas relacionados con la Computacion Movil, ha permitido que las contribuciones de esta tesis no se limiten al campo de la busqueda semantica. A este respecto, se ha estudiado el ambito de la semantica de las consultas basadas en la localizacion, y especialmente, la influencia de la semantica de las localizaciones en el procesado e interpretacion de las mismas. En particular, se proponen dos modelos ontologicos para modelar y capturar la relaciones semanticas de las localizaciones y ampliar la expresividad de las consultas basadas en la localizacion. Durante el desarrollo de esta tesis, situada entre el ambito de la Web Semantica y el de la Computacion Movil, se ha abierto una nueva linea de investigacion acerca del modelado de conocimiento volatil, y se ha estudiado la posibilidad de utilizar razonadores basados en Logicas Descriptivas en dispositivos basados en Android. Por ultimo, nuestro trabajo en el ambito de las busquedas semanticas a partir de palabras clave ha sido extendido al ambito de los agentes conversacionales, haciendoles capaces de explotar distintas fuentes de datos semanticos actualmente disponibles bajo los principios del Linked Data.

Read the paper · More papers on PaperTik