Learning visual perception for autonomous systems

Gustav Häger · Linköping studies in science and technology. Dissertations · 2021

POPULÄRVETENSKAPLIG SAMMANFATTNINGDe senaste årens allt snabbare utveckling av beräkningshårdvara, sensorer och mjukvarutekniker har gjort det möjligt att skapa allt mer autonoma system.Sådana kan variera i autonomigrad från ett antisladdsystem för en i övrigt manuellt kontrollerad bil, till system för kollisionsundvikning i en manuellt kontrollerad drönare, till en helt autonom bil eller annan farkost.Med en ökande förmåga att arbeta självständigt utan mänsklig övervakning ökar också bredden på möjliga situationer som systemen förväntas hantera.Gemensamt för många, om inte alla, autonoma system är att de behöver en korrekt och updaterad bild av sin omgivning för att kunna agera på ett intelligent sätt.En lång rad av sensorer som gör detta möjligt finns tillgängliga, där kameror är en av de mest mångsidiga.Jämfört med andra typer av sensorer har kameror en rad fördelar, som att de är relativt billiga, passiva, och kan användas utan krav på extern infrastruktur.Det visuella data som kameror genererar kan användas för att följa externa objekt, bestämma positionen för kameran själv, eller beräkna avstånd.Att framgångsrikt utnyttja möjligheterna i denna information kräver dock att en lång rad tekniska problem hanteras.Många av dessa problem är grundar sig i att kunna känna igen att två bildregioner från olika tidpunkter eller betraktningsvinklar avbildar samma sak.Ett typexempel på ett sådant problem är det visuella följningsproblemet.I det visuella följningsproblemet är målet att bestämma ett objekts position och storlek för alla bilder i en sekvens av bilder.I allmänhet är objektets utseende inte känt av algoritmen, utan en utseendemodell måste skapas succesivt med hjälp av maskininlärning.Problem som liknar detta förekommer inom många andra områden av datorseende, speciellt inom geometri.Inom många geometriska problem krävs det till exempel att man finner korresponderande punkter i ett flertal bilder.Den första samlingen av bidrag i denna avhandling behandlar det visuella följningsproblemet.De föreslagna metoderna är baserade på en adaptiv utseendemodell kallad diskriminativa korrelationsfilter.I det första bidraget till sådana metoder utökas ramverket till att skatta ett objekts storlek såväl som position.Ett andra bidrag undersöker hur korrelationsfilterbaserade metoder kan utökas till att även utnyttja visuella särdrag som har framställt med hjälp av maskininlärning.En andra samling med bidrag behandlar utvärdering av metoder för visuell följning.Dels inom den årligt förekommande tävlingen visual object tracking challenge.Ett andra bidrag till utvärderingsmetodig inom visuell följning syftar till att unvdika fallgropar som lätt uppkommer då metoder anpassas allt för väl för måtten som används för att utvärdera dem.En tredje samling med bidrag relaterar till olika sätt att hantera situationer då inlärningsprocessen i de tidigare beskrivna följningsmetoderna introducerar felaktiga data i modellen.Detta görs i ett första bidrag i ett robotiksystem för följning av människor i en ostrukturerad miljö.Ett andra bidrag är baserat på dynamisk omviktning av tidigare samlad data för att dynamiskt vikta ned datapunkter som inte representerar det följda objektet väl.I ett sista bidrag undersöks hur en prediktions osäkerhet kan skattas samtidigt som prediktionen själv.

Read the paper · More papers on PaperTik