Information Retrieval for Multivariate Research Data Repositories

Maximilian Scherer · Publikationsdatenbank der Fraunhofer-Gesellschaft (Fraunhofer-Gesellschaft) · 2013

Diese Dissertation beschäftigt sich mit der Herausforderung der inhaltsbasierten Suche in Sammlungen multivariater Forschungsdaten. Multivariate Forschungsdaten werden in immer größerem Maße in vielen Wissenschaftsdisziplinen, wie den Human- und Naturwissenschaften oder den Sozial- und Wirtschaftswissenschaften, erhoben. Das Archivieren und Wiederverwerten dieser Daten spielt eine immer wichtigere Rolle in der Informationsversorgung. Hierzu wurden spezialisierte Repositorien geschaffen, die diese Daten archivieren und zur Nachnutzung bereitstellen. Ein multivariater Datensatz beinhaltet dabei m Messgrößen (zum Beispiel Temperatur, Druck, Feuchtigkeit, etc. in der Klimaforschung) und n Beobachtungen. Um solche Datensätze in den Repositorien auffindbar zu machen, werden diese nach einem gewissen Metadatenstandard textuell annotiert und können anhand dieser Annotation gesucht werden. Diese annotierten Metadaten beinhalten beispielsweise Ort, Datum, Messgrößen, Autor, Titel, etc. des zugrundeliegenden Datensatzes. Insbesondere bei multivariaten Daten werden insbesondere die einzelnen Spalten annotiert, um eindeutig festzuhalten, welche Messgröße und Einheit die einzelnen Spalten wiedergeben. Nach diesem Stand können Wissenschaftler ihren Informationsbedarf derzeit decken, indem sie für sie relevante Datensätze anhand der Metadaten finden. Beispielsweise können alle Datensätze gefunden werden, die in einem gewissen Zeitraum oder innerhalb gewisser geographischer Grenzen erfasst wurden. Ebenso können jene Datensätze gefunden werden, die Messungen zu einer bestimmten Messgröße (z.B.Wasserdruck) enthalten oder von einem bestimmten Wissenschaftler aufgenommen wurden. Fragestellungen, die nicht oder nur unzulänglich mit Hilfe textueller Annotationen beantwortet werden können, beinhalten beispielsweise die Suche nach einem speziellen Muster in den multivariaten Daten, wie etwa ein linearer Zusammenhang von Wasserdruck und Wassertiefe. Eine andere solche Fragestellung ist die Suche nach multivariaten Daten, die einem Beispieldatensatz möglichst ähnlich sind, das heißt, solche Datensätze die ähnliche Muster wie der Beispieldatensatz aufweisen. In dieser Dissertation beschäftige ich mich mit diesen Herausforderungen und entwickle neue Verfahren, um den etablierten Zugang zu multivariaten Forschungsdaten auf Annotationsbasis, durch inhaltbasierte Ansätze zum Beschreiben der Muster innerhalb der Daten zu erweitern. Damit erhöhe ich das Maß an Zugänglichkeit zu diesen Daten, durch die Unterstützung verschiedener Such- und Explorationsmodalitäten, die für die Auffindbarkeit und damit die Nachnutzung der Datensätze entscheidend sind. Durch Analyse und Merkmalsbeschreibung der multivariaten Daten selbst werden Suchanfragen ermöglicht, die anhand der Metadaten allein nicht durchführbar gewesen wären. Dies erlaubt die Suche nach jenen Datensätzen, deren Messungen ein bestimmtes Muster (beispielsweise den bereits oben erwähnten linearen Zusammenhang von Wasserdruck und Wassertiefe) vorweisen. Ebenso entwickle ich visuell-interaktive Verfahren, um den Nutzer bei der Formulierung solch komplexer Suchanfragen zu unterstützen. So kann beispielsweise eine Übersicht interessanter Muster präsentiert werden, die sich in Echtzeit an die (Teil-)Suchanfrage des Nutzers anpasst. Weiterhin habe ich über die Merkmalsbeschreibungen einzelner Datensätze ein Maß zur Bestimmung der Ähnlichkeiten zwischen multivariaten Datensätzen entwickelt. Dies erlaubt Wissenschaftlern mittels Beispieldatensätzen andere Datensätze gemäß ihrer Ähnlichkeit aufzufinden. So kann beispielsweise schnell festgestellt werden, ob andere Wissenschaftler zu ähnlichen (oder auch widersprüchlichen) Ergebnissen gekommen sind.

Read the paper · More papers on PaperTik