TimeML markup language for Russian. Future outlook

Natal’ya Lando · Program systems theory and applications · 2016

Н. С. Ландо TimeML для разметки русскоязычных текстов. Оценка перспективАннотация.Статья посвящена анализу возможности применения языка TimeML для разметки временных выражений и их связей с упоминаниями событий в русскоязычных текстах.Выявлен ряд специфических для русского языка конструкций, требующих внесения корректив в инструкцию для аннотаторов, предложены варианты изменений отдельных пунктов инструкции.В заключении делается вывод о целесообразности практического приложения доработанной версии языка TimeML к русскоязычным текстам как в качестве языка разметки, так и в качестве формата представления извлекаемой автоматически темпоральной информации.Ключевые слова и фразы: автоматическая обработка текста, извлечение информации, разметка корпусов текстов, темпоральные выражения. ВведениеВсе большую актуальность в современном динамичном мире приобретают задачи автоматизации тех или иных процессов.В том числе речь идет и об автоматическом извлечении информации из текстов на естественном языке, что позволяет значительно ускорить обработку и систематизацию больших объемов данных.Извлечение информации из текста (information extraction) -это представление того, о чем в нем говорится, в некотором структурированном виде.Одним из компонентов такой информации является локализация тех или иных событий (см.ниже) во времени.Чтобы оценить, насколько эффективна разрабатываемая система автоматического извлечения информации, как правило, про водится сравнение результатов ее работы на некоторой базе текстов с подготовленной заранее «идеальной» разметкой тех же текстов.Для того, Работа выполнена в рамках НИР «Моделирование модально-временного аспекта описания ситуаций в задаче извлечения информации из текстов», номер гос.

Read the paper · More papers on PaperTik