Template-Based Deployment for Real-Time Deep Learning on Point Clouds

Neu, Marc · Repository KITopen (Karlsruhe Institute of Technology) · 2026

Deep Learning auf Punktwolken eignet sich für irreguläre Detektorgeometrien mit Millionen einzelner Sensoren, jedoch existiert bislang keine Methodik für dessen Einsatz in Echtzeit-Datenakquisitions- und Triggersystemen. Diese Dissertation stellt DeePloy vor, eine generalisierbare Methodik zur Abbildung graphbasierter Punktwolkennetzwerke auf heterogene, kommerziell verfügbare rekonfigurierbare Hardware unter harten Echtzeitanforderungen. Diese Plattformen reichen von Field-Programmable Gate Arrays bis hin zu Systems on Chip, die Field-Programmable Gate Arrays mit Coarse-Grained Reconfigurable Arrays kombinieren. Punktwolkennetzwerke werden in einen Graphen bestehend aus Operatoren zerlegt und auf eine Datenfluss-Architektur abgebildet, wobei topologieabhängige Transformationen zur Verbesserung von Latenz und Durchsatz der Inferenz vorgeschlagen werden. Die Methodik wird anhand von drei Fallstudien im Belle II Experiment validiert. Erstens wird ein Punktwolkennetzwerk für den Hardware-Trigger der Central Drift Chamber auf dem AMD Alveo V80 implementiert und erreicht in Simulationen eine Latenz von 0,425 Mikrosekunden sowie 32 Millionen Detektoraufnahmen pro Sekunde, was einer nahezu zehnfachen Durchsatzsteigerung gegenüber vorherigen Arbeiten entspricht. Zweitens wird ein Punktwolkennetzwerk für den Hardware-Trigger des elektromagnetischen Kalorimeters entwickelt und in das Triggersystem integriert, das seit Anfang 2026 in Belle II in Betrieb ist, eine Ende-zu-Ende-Latenzvorgabe von 1,053 Mikrosekunden einhält und 8 Millionen Detektoraufnahmen pro Sekunde auf dem AMD Ultrascale XCVU190 verarbeitet. Dieser Ansatz stellt die erste Implementierung eines auf Punktwolkennetzwerken basierenden Rekonstruktionsalgorithmus in einem Hardware-Trigger in der Teilchenphysik dar. Drittens wird ein Punktwolkennetzwerk auf dem AMD Versal VCK190 implementiert und erreicht in Hardwaremessungen eine 7,02 mal höhere Durchsatzleistung gegenüber einer Grafikkarte. Zusammenfassend zeigt diese Arbeit, dass graphbasierte Punktwolkennetzwerke die harten Echtzeitanforderungen von Hardware-Triggersystemen erfüllen können und damit Rekonstruktionsalgorithmen in wissenschaftlichen Großexperimenten realisiert werden können.

Read the paper · More papers on PaperTik