LEARNING QUALITY, AESTHETICS, AND FACIAL ATTRIBUTES FOR IMAGE ANNOTATION
Luigi Celona · BOA (University of Milano-Bicocca) · 2018
Ogni giorno vengono prodotte dagli utenti di social network, utilizzatori di smartphone, professionisti della fotografia ecc, un numero elevato di immagini digitali. Questo ha causato un problema di gestione, organizzazione, indicizzazione e recupero di immagini digitali. Al fine di semplificare questo problema sono stati introdotti svariati metodi per catalogare le immagini in maniera automatica. Questi metodi sono progettati per associare alle immagini una o piu' keyword appartenenti a un dizionario predefinito o anche attributi visuali quali ad esempio, qualitˆ, estetica, sentimento, memorabilita' ecc. Questa tesi indaga l'uso delle convolutional neural network per la stima automatica della qualità dell'immagine e dell'estetica dell'immagine. Negli ultimi anni sono stati proposti diversi metodi per la valutazione automatica della qualità dell'immagine. Molti di essi sono stati progettati per trattare immagini distorte sinteticamente, che per definizione non modellano veramente le distorsioni che affliggono le immagini del mondo reale. In questa tesi viene investigato un metodo per la valutazione automatica della qualità delle immagini realmente distorte. Mostra prestazioni migliori rispetto ai metodi più avanzati sia su dataset di immagini distorte sinteticamente che autenticamente. A differenza della qualità dell'immagine, che caratterizza la qualità percepita del segnale dell'immagine, l'estetica rappresenta la bellezza percepita. Come primo passo, è stato studiato il problema della valutazione della qualità estetica delle immagini con contenuto generale. La soluzione proposta ha ottenuto risultati migliori nello stato dell'arte sul più grande dataset di immagini disponibile. Dato che uno dei contenuti visivi più popolari è il volto (ad esempio sui social network per la condivisione di foto), la valutazione estetica è, stata ulteriormente approfondita per il caso specifico delle immagini di ritratti. A tal fine, in questa tesi viene proposto un algoritmo che coinvolge la combinazione dei precedenti attributi visivi investigati (vale a dire la qualità e l'estetica delle immagini di contenuto generale) e le caratteristiche del volto (cioè sorridente, acconciatura, trucco). La descrizione degli attributi facciali è ottenuta grazie a due metodi proposti. Il primo algoritmo è un rilevatore di sorrisi robusto (rappresenta un'importante funzione visiva per l'estetica del ritratto), il secondo è un modello a più attività progettato per stimare simultaneamente biometriche e attributi morbidi come i colori e gli stili dei capelli, i tipi di barba. Mentre il primo algoritmo supera i metodi più avanzati (anche rispetto alle immagini altamente distorte), il modello multi-task ottiene prestazioni comparabili. I risultati sperimentali per la valutazione estetica delle immagini di volti grazie all'uso dell'algoritmo proposto mostrano prestazioni promettenti su tre set di dati standard.