Workshop Lexical Data Masterclass 2018

Boris Lehečka · CU Digital Repository · 2019

WORKSHOP LEXICAL DATA MASTERCLASS 2018Ve dnech 3.-7.12. 2018 proběhl v Berlíně druhý ročník workshopu Lexical Data Masterclass (https://lexmc18.sciencesconf.org),který podpořilo francouzské Ministerstvo vysokého školství, výzkumu a inovací, infrastruktury DARIAH-EU, CLARIN, ELEXIS -European Lexicographic Infrastructure, BCDH (Belgrade Center for Digital Humanities), Berlínsko-braniborská akademie věd (Berlin-Brandenburgische Akademie der Wissenschaften) a společnost SyncRO Soft.Díky posledně jmenované firmě získali účastníci bezplatnou půlroční licenci softwaru oXygen XML Editor (https://www.oxygenxml.com/xml_editor.html),který umožňuje pohodlnou práci s dokumenty ve formátu XML a se souvisejícími technologiemi.Dalším benefitem byla úhrada nákladů na dopravu a ubytování na základě žádosti o proplacení účetních dokladů u DARIAH-EU.Hlavními organizátory workshopu byli zejména Laurent Romary a Toma Tasovac, kteří stojí za přípravou nového standardu pro značkování digitálních slovníků, jež nese označení TEI-Lex0 (https://github.com/LingSIG/Dictionaries).Významnou měrou se na akci podílel také Mohamed Khemaken, který vyvíjí aplikaci GROBID--Dictionaries (viz níže).Pětidenní akce je rámovaná prezentací účastníků.První den představují své projekty, na nichž budou v rámci workshopu pracovat.Tato část má pevná pravidla: do tříminutové prezentace (12 snímků po 15 sekundách) je potřeba vtěsnat gros lexikografického problému.Závěrečná vystoupení, která už nebyla tak striktně limitovaná časem, slouží ke shrnutí pokroku v práci a k prezentaci dosažených výsledků.V roce 2018 bylo pro účast na workshopu vybráno 16 projektů.Od úterý se program rozdělil do tří skupin.Jedna se zaměřila na práci s aplikací GROBID-Dictionaries (https://github.com/MedKhem/grobid-dictionaries),která pomocí strojového učení dokáže v naskenovaném materiálu rozpoznat a označit jednotlivé části slovníkové heslové stati (ve formátu XML TEI P5); na tuto sekci bylo potřeba se přihlásit pomocí samostatného formuláře.Ve zbývajících dvou sekcích se na začátku dne probírala dílčí témata a poté následovala asistovaná práce nad konkrétním materiálem jednotlivých účastníků.Asistovali nejen organizátoři, ale i samotní účastníci, pokud se v probíraných technologiích dostatečně vyznali.Mezi prezentovaná témata patřil úvod do kódování slovníků pomocí doporučení TEI (Introduction to encoding dictionaries with the TEI guidelines), pokročilé techniky s programem oXygen XML Editor (Advanced Oxygen techniques), využití XPath pro hledání ve slovnících (Advanced Path for searching dictionary content), transformace pomocí XSLT do jiných formátů (XSLT), představení projektu Standardization Survival Kit (Data management; http://ssk.parthenos-pro-ject.eu), který nabízí doporučené postupy v různých oblastech digitálních humanitních věd a výzkumu kulturního dědictví.Obecně lze říci, že jsou tyto prezentace určeny zejména pro začátečníky, ale pokročilejší a specializovaná témata mohou účastníci probrat se školiteli během zbytku dne, kdy se věnují svým vlastním projektům.V plenární přednášce The VICAV Dictionaries: Working on a Virtual Research Environment představil Karlheinz Moerth z Rakouského centra pro digitální hu-

Read the paper · More papers on PaperTik