ML-powered tagging engine for journalism
Andine Luick, Vebjørn Hansen Øvsthus · NORA - Norwegian Open Research Archives · 2020
Denne oppgaven har som mål å finne ut av potensialet for bruk av maskinlæring til å automatisere tagging av artikler for journalister. Prosjektet består av en kombinasjon av forskning, utvikling av to maskinlæringsmodeller og utrulling. Det ble bestemt at det skal lages en klassifiseringsmodell som bruker spaCy for å foreslå emnekategorier på artiklene, og en LDA modell for å foreslå nøkkelord for artiklene, samt foreslå artikler som omhandler samme tema. Prosessen ble delt opp i flere deler; utvikling av modellene, deployment, utvikling av en web app og dokumentasjon, der utvikling av modellene har hatt høyest prioritet. For å minimere effekten av manglende kompetanse og lange utviklingstider ble det benyttet teknologier som spaCy og LDA, som ble gitt i oppgavebeskrivelsen. Resultatene til modellene indikerte at maskinlæring kan være et veldig godt verktøy for både å bestemme emnekategori og foreslå nøkkelord. I de områdene resultatene ikke var helt tilstrekkelige, antas det at årsaken var at datasettet ikke var godt nok balansert. Videre ble det observert at LDA er en god metode for å finne artikler som ligner, men ikke nødvendigvis så like at de tilhører samme emnekategori. Konklusjonen er at maskinlæring kan være et godt verktøy for automatisering av tagging av artikler, og at det i framtiden kan være til stor hjelp for journalister. Det anbefales å samle større og mer balanserte data før en eventuelt fortsettelse av dette prosjektet.