Learning Representations for Segmentation and Registration
Felix Järemo Lawin · Linköping studies in science and technology. Dissertations · 2021
SAMMANFATTNINGInom datorseende är målsättningen att automatiskt kunna extrahera och modellera högnivårepresentationer från visuella sensormätningar som bilder, videosekvenser och 3D-punkter.Visuella data är ofta högdimensionella, brusiga och oregelbundna, vilket leder till många utmaningar vid modellering.I den här avhandlingen presenteras forskningsarbeten som adresserar sådana utmaningar inom ett flertal olika datorseendeproblem.Först undersöks fasuppackningproblemet för multifrekvensbaserad amplitudmodulerad timeof-flight (ToF).ToF är en teknik som används i djupkameror, vilka har många applikationer inom 3D rekonstruktion och gestigenkänning.Amplitudmodulerad time-of-flight kan generera noggranna mätningar, men samtidigt introducera tvetydigheter i djupskattningarna.I avhandlingen presenteras en metod för att lösa problemet med tvetydigheterna genom att skatta sannolikheterna för multipla hypoteser för djupet.Detta uppnås genom att utföra en kärntäthetsskattning över alla hypoteser i en omgivning runt alla pixlar i djupbilden.Hypotesen med den högsta skattade sannolikheten väljs därefter ut som djupskattning.Den här metoden leder till en förbättrad kvalitet på djupbilderna, samt ökar den effektiva räckvidden för djupkameror i både inomhus och utomhusmiljöer.Därefter adresseras punktmolnsregistrering, som är problemet att hitta den korrekta transformationen mellan olika överlappande punktmoln.Robust registrering är fundamentalt för flertal olika problem, som till exempel 3D-rekonstruktion och estimering av objektposition.Ett första bidrag i avhandlingen är en metod för att hantera täthetsvariationer i punktmolnen.Metoden använder sig av en probabilistisk modell av en latent sannolikhetsfördelning som representerar den underliggande strukturen i den observerade scenen.Både modellen och registreringsparametrarna optimeras med väntevärdes-maximiserings-algoritmen.Vidare introducerar avhandlingen en metod för att integrera djupa särdrag i registreringsramverket.Det visar sig att de djupa särdragen förbättrar registreringsmetoden, både i termer av noggrannhet och robusthet.Ytterligare förbättringar uppnås genom att lära sig särdragsrepresentationer genom att minimera registreringsfel.I avhandlingen presenteras även en metod för 3D-punktmolnssegmentering. Eftersom scenmodeller ofta representeras av 3D-punktmätningar, är segmentering av dessa viktigt för generell scenförståelse.Inlärning av modeller för segmentering kräver stora mängder etiketterad data, vilket är dyrt och tidskrävande att skapa.Metoden som presenteras i avhandlingen undviker detta problem genom att projicera punkterna i virtuela cameror och rendera 2D bilder.Metoden kan därmed utnyttja högpresterande tekniker baserade på djupa faltningsnätverk för bildsegmentering och minskar därför även behovet av 3D data med sanningsetiketter.Slutligen adresseras video objektsegmentering (VOS), där målet är att följa och segmentera specifika objekt i en videosekvens.För att uppnå hög prestanda, behövs en robust objektmodell som kan anpassas till olika scenarier och förändringar i utseende.Den stora utmaningen består i att detta måste uppnås med hjälp av enbart en bild med given segmentering i videosekvensen.För att hantera utmaningarna inom VOS, presenterar den här avhandlingen en parametrisk målobjektetsmodell, optimerad för att prediktera en maskfunktion av målobjektet.Modellen integreras i ett djupt neuralt nätverk, där den vägleder ett segmenterings nätverk att prediktera målobjektssegment.Det djupa nätverket tränas för att maximera segmenteringsnoggrannheten på ett videosegmenteringsdataset med givna segmenteringar.Det visas även att samtidig träning av hela nätverket medför att metoden kan lära sig att ta fram en maskfunktion till modellen som maximerar den slutgiltiga segmenteringsnoggrannheten.