Efficient approaches to deal with oversmoothing in deep graph neural networks
Δημήτριος Κελέσης · 2025
Τα Νευρωνικά Δίκτυα Γράφων (Graph Neural Networks - GNNs) έχουν επιδείξει εντυπωσιακή επιτυχία σε ένα ευρύ φάσμα εργασιών που αφορούν σχεσιακά δεδομένα. Ωστόσο, η απόδοσή τους επιδεινώνεται όσο αυξάνεται το βάθος τους, λόγω του φαινομένου της υπερ-εξομάλυνσης (oversmoothing), κατά το οποίο οι αναπαραστάσεις των κόμβων καθίστανται σχεδόν πανομοιότυπες μεταξύ των επιπέδων. Η παρούσα διατριβή παρουσιάζει μια συστηματική μελέτη του προβλήματος της υπερ-εξομάλυνσης και προτείνει νέες θεωρητικές και εμπειρικές προσεγγίσεις για την αντιμετώπισή του, καθιστώντας δυνατή τη σχεδίαση βαθύτερων και εκφραστικότερων αρχιτεκτονικών GNN. Πρώτον, εισάγουμε μία νέα μετρική σε κάθε επίπεδο (layer-wise) για τη μέτρηση της υπερ-εξομάλυνσης, συνοδευόμενη από θεωρητικά όρια και εργαλεία πρακτικής ανίχνευσης. Δείχνουμε ότι η υπερ-εξομάλυνση επιδεινώνεται όταν ο αριθμός των πινάκων βαρών συσχετίζεται με το βάθος της διάδοσης μηνυμάτων, και προτείνουμε το G-Reg, μια στρατηγική κανονικοποίησης που διατηρεί την ποικιλομορφία των αναπαραστάσεων. Στη συνέχεια, μελετούμε τις residual συνδέσεις και αναλύουμε τους περιορισμούς τους στην υποστήριξη αλληλεπιδράσεων μακρινής εμβέλειας μεταξύ κόμβων. Η ανάλυσή μας δείχνει ότι, παρόλο που τα μοντέλα με residuals (π.χ. APPNP, GCNII) αντιστέκονται στην υπερ-εξομάλυνση σε τυπικά benchmarks, αποτυγχάνουν σε σενάρια που απαιτούν βαθιά και εκφραστική διάδοση πληροφορίας. Για την ανάδειξη αυτού, εισάγουμε ένα συνθετικό σύνολο δεδομένων σχεδιασμένο να αξιολογεί την ικανότητα ενός GNN να αποτυπώνει μακρινές εξαρτήσεις. Έπειτα, εξετάζουμε τη μερική εκπαίδευση (partial training) σε GNNs, όπου εκπαιδεύεται μόνο ένα επίπεδο ενώ τα υπόλοιπα παραμένουν σταθερά. Τα αποτελέσματά μας αποκαλύπτουν ότι η αύξηση του πλάτους του μοντέλου αντισταθμίζει την απουσία πλήρους εκπαίδευσης και μειώνει σημαντικά την υπερ-εξομάλυνση, ακόμη και σε βαθιές αρχιτεκτονικές. Η προσέγγιση αυτή ισοφαρίζει ή ξεπερνά πλήρως εκπαιδευμένα μοντέλα τόσο σε τυπικά όσο και σε "cold start" σενάρια. Επιπρόσθετα, προτείνουμε τη μέθοδο G-Init, μια στρατηγική αρχικοποίησης βαρών ενημερωμένη από τη δομή του γράφου, εμπνευσμένη από κλασικές τεχνικές αρχικοποίησης για βαθιά νευρωνικά δίκτυα. Η G-Init λαμβάνει υπόψη την τοπολογία του γράφου και βελτιώνει τη ροή των gradients σε βαθιά GNNs, μειώνοντας την υπερ-εξομάλυνση και ενισχύοντας την επίδοση τους σε προβλήματα ταξινόμησης. Τέλος, διερευνούμε την επίδραση της συνάρτησης ενεργοποίησης στην υπερ-εξομάλυνση. Τα θεωρητικά και εμπειρικά ευρήματά μας δείχνουν ότι η τροποποίηση της κλίσης της ReLU οδηγεί σε καλύτερη ποικιλομορφία αναπαραστάσεων και βελτιωμένη απόδοση σε βαθιά GNNs, χωρίς να απαιτούνται αλλαγές στην αρχιτεκτονική ή residual συνδέσεις. Συνολικά, οι συνεισφορές αυτές προωθούν την κατανόησή μας σχετικά με τις προκλήσεις που σχετίζονται με το βάθος στα GNNs και προσφέρουν πολλαπλές, επεκτάσιμες και θεωρητικά τεκμηριωμένες λύσεις για την αντιμετώπιση της υπερ-εξομάλυνσης. Τα ευρήματα υποδεικνύουν την ανάγκη επαναπροσδιορισμού των αρχών σχεδίασης των βαθιών GNNs και ανοίγουν τον δρόμο για πιο αξιόπιστες αρχιτεκτονικές κατάλληλες για πραγματικές εφαρμογές.