Ranking Streaming Data With Continuous Queries
Sandra Marie Skarshaug · NORA - Norwegian Open Research Archives · 2019
En økende mengde data genereres som en del av digitaliseringen av samfunnet vårt. Forskning fra 2013 viser at 90% av all dataen generert i verden frem til det tidspunktet, ble generert i løpet av de to foregående årene. Sosiale medier har blitt en del av hverdagen til folk, og måten mennesker bruke disse sosiale mediene kan generere store datastrømmer, slik som for eksempel strømmen av meldinger fra mikrobloggen Twitter, som genererer millioner av “tweets” daglig. Denne dataen kan analyseres i sanntid for få innblikk i mange temaer, for eksempel hvilke naturkatastrofer eller andre kriser som rammer verden i et gitt øyeblikk. Men, det er ikke mulig for en bruker med et spesifikt informasjonsbehov å navigere den store mengden av data for å finne akkurat den dataen som er mest relevant for henne. Dette har skapt et økende behov for automatiske sanntidssystemer for å håndtere slike problemstillinger. Sanntidsanalyse av denne typen strømdata er ikke en ny idé, men mange av de tidligere tilnærmingene til løsninger har vært avhengige av å “lime” sammen flere uavhengige systemer. I lys av de overnevnte utfordringene utforskerer denne oppgaven hvordan elementer i en datastrøm generert av et sosial medium kan rangeres ved å benytte eksisterende systemer som håndterer Big Data. Målet med å utføre rangering er å til enhver tid kunne identifisere og hente ut den mest relevante informasjonen fra datastrømmen for et gitt informasjonsbehov. Dette adresserer problemet med informasjonsoverflod som brukere kan oppleve på nett. Det første steget i det foreslåttet systemet er å filtrere datastrømmen basert på en stående brukerspørring, og dermed redusere mengden data som må prosesseres. Videre blir en grupperingsalgoritme tatt i bruk på de resterende elementene i datastrømmen for å redusere antallet enheter som må rangeres. Deretter blir relevansen mellom grupperingene av Twitter-meldinger og brukerspørringen kalkulert, og det blir produsert en liste over de k mest relevante grupperingene. Til slutt vil bare tweets som er lagret i den høyest rangerte grupperingen bli persistent lagret, og lagringsmediumet blir oppdatert kun når det er endringer i rangeringen av grupperinger. Et sanntidseksperiment viste at filtrering og rangering blir påført med hell på datastrømmen, og at systemet oppdaterer resultateat basert på den nåværende rangeringen med lav kostnad. Denne oppgaven viser at strømdata kan håndteres internt i AsterixDB, og fjerner behovet for flere systemer til å løse et slikt problem.