Esports trainer
Klavio Tarka · University of Vienna · 2026
Real-Time Strategy (RTS) ist ein Genre von Videospielen, das nicht in Runden ablaeuft; dies impliziert, dass das Spiel standardmaessig in Echtzeit gespielt wird. RTS-Spiele erfordern kontinuierliche, sofortige Entscheidungsfindungen, was sich von Brettspielen wie Schach oder Go unterscheidet, bei denen Spieler Zeit haben, ihren naechsten Zug in einer statischen Umgebung zu berechnen. Die Spieler muessen ihre Wirtschaft verwalten, Ressourcen pluendern, Gebaeude errichten und Einheiten befehligen, waehrend der Gegner genau dasselbe in Echtzeit tut. Dieser Zeit- und Aktionsfluss schafft eine schwierige Umgebung, die durch massive Zustandsraeume, unvollstaendige Informationen (oft durch den Kriegsnebel verborgen, den diese Arbeit nicht behandeln wird) und die Notwendigkeit zur Optimierung von Strategien fuer das kurz- und langfristige Gameplay gekennzeichnet ist. Aufgrund dieser Eigenschaften ist bekannt, dass diese Spiele mit kuenstlicher Intelligenz schwer zu loesen sind. Um diese Umgebungen erfolgreich zu navigieren, kann sich ein Agent nicht einfach auf Brute-Force-Suchalgorithmen verlassen, da der Verzweigungsfaktor moeglicher Aktionen in einem RTS-Spiel ungewoehnlich gross ist. Deshalb erfordern Reinforcement Learning (RL)-Agenten, die gegeneinander antreten, Setups, die optimales Verhalten durch Versuch und Irrtum lehren, waehrend die Suchtiefe pro Spielzustand begrenzt ist. Reinforcement Learning hat eine Geschichte der Eroberung immer komplexerer Spiele, angefangen bei Atari-Titeln bis hin zur Meisterung von Brettspielen wie dem beruehmten GO (Baduk). Der Uebergang von klassischen rundenbasierten Spielen zu kontinuierlichen Multi-Agenten-RTS-Spielen erfordert voellig andere Ansaetze. Die Agenten muessen lernen, ihre unmittelbaren Belohnungen und ihre verzoegerten Belohnungen abzuwaegen, wie zum Beispiel den Gewinn eines kleinen Scharmuetzels, aber den Verlust der Basis, oder die Investition in eine staerkere Wirtschaft, die ein paar Minuten spaeter im Spiel eine staerkere Armee hervorbringen wird. Diese Arbeit befasst sich mit den wichtigsten Herausforderungen bei der Anwendung von RL in diesem Bereich, einschliesslich der dynamischen Ein-/Ausgabe-Repraesentation, der rechnerischen Effizienz sowie der Integration und dem Vergleich von Reinforcement-Learning-Modellen in einem benutzerdefinierten Echtzeit-Strategie-Framework. Die Ziele dieser Arbeit lassen sich wie folgt zusammenfassen: zu dem Aufbau eines zugaenglichen Werkzeugs, das Strategielernen von Reinforcement-Learning-Agenten ermoeglicht, die Bereitstellung eines RTS-Werkzeugs, bei dem das Experimentieren nicht an ein kommerzielles Produkt gebunden ist, und die Praesentation einer kleinen Umfrage darueber, wie dieses Werkzeug menschlichen Spielern helfen kann, neue Strategien speziell in RTS-Spielen zu erlernen. Dies geschieht durch die Implementierung von zwei grundlegend unterschiedlichen Reinforcement-Learning-Algorithmen, respektive Deep Q-Networks (DQN) und Proximal Policy Optimization (PPO). DQN repraesentiert einen wertbasierten, Off-Policy-Ansatz, bei dem der Agent lernt, die zukuenftigen Belohnungen spezifischer Aktionen in spezifischen Zustaenden zu schaetzen. PPO ist ein On-Policy-Actor-Critic-Algorithmus, der die Richtlinie (Policy) selbst direkt optimiert und Aktualisierungen glaettet (durch Begrenzung der Aktualisierungsrate), um ein stabiles Lernen zu gewaehrleisten. Der Vergleich und die Implementierung dieser beiden Algorithmen in dieser Umgebung dienen als zentrale Studie fuer diese Arbeit, analysierend, wie sie gegeneinander abschneiden, spezifisch hinsichtlich ihrer Platzkomplexitaet, ihrem rechnerischen Aufwand und der gesamten strategischen Leistung. Reinforcement Learning wurde bereits in mehreren anderen Arbeiten auf RTS-Spiele angewendet, am namhaftesten in Arbeiten, die sich auf StarCraft II konzentrieren, wie das AlphaStar-Projekt und anschliessende gross angelegte Offline-RL-Studien wie AlphaStar Unplugged. Die meisten dieser hochkaraetigen Arbeiten zeigen jedoch keinen direkten Vergleich von zwei voellig unterschiedlichen algorithmischen Paradigmen. Stattdessen fokussieren sie sich auf die Skalierung eines einzelnen Algorithmus durch das Hinzufuegen zusaetzlicher Tweaks, riesiger Mengen an Rechenleistung und komplexer Liga-Trainingssysteme, die den Forscher dazu verpflichten, Zugriff auf eine massive Datenbank von Trainingsdaten zu haben. Ein weiteres Problem in der aktuellen Landschaft der RTS-KI-Forschung ist der statische Zustand der Umgebungen. In grossen kommerziellen Titeln, die fuer die Forschung genutzt werden, kann man die Zustandsdarstellungen, die Kernmechaniken oder die Aktionen, die im Spiel vollzogen werden, nicht fundamental aendern. Dies fuehrt dazu, dass sowohl die Umgebung als auch der Agent etwas fixiert sind, da diese kommerziellen Spiele nicht Open Source sind und stark durch die bereitgestellten APIs eingeschraenkt werden. Diese Arbeit versucht, solchen Einschraenkungen zu entkommen. Sie versucht nicht nur, ein Werkzeug bereitzustellen, das zum Strategielernen und zur Beantwortung der Leistungsfrage zwischen diesen beiden Reinforcement-Learning-Agenten verwendet werden kann, sondern auch eine Plattform fuer andere Experimente zu bieten, ohne dass Trainingsdaten notwendig sind. Durch die Nutzung einer Umgebung, in der Forscher Testdaten erstellen und die Spielmechaniken grundlegend aendern koennen, kann dieses Framework manipuliert werden, um spezifische Experimentanforderungen zu erfuellen. Ueber den technischen Vergleich der Algorithmen hinaus, wie erwaehnt, ist ein weiteres wichtiges Ziel dieser Arbeit das Beobachten einer Umfrage, die von Teilnehmern ausgefuellt wurde, die fragt, ob das Betrachten dieser Simulation dazu fuehren kann, neue Strategien von der KI, die das Spiel spielt, zu lernen? Menschen, die mit Videospielen interagieren, generieren im Allgemeinen etwas, das man Metas oder optimale Spielweisen nennt, durch Stunden des Sammelns von Wissen und des Machens von Fehlern. Jedoch sind diese Metas im Allgemeinen voreingenommen und nur optimal basierend darauf, was funktioniert hat oder basierend auf der Gewinnrate. In Videospielen wie RTS, in denen die Strategien beinahe unbegrenzt sind, koennen Metas nur basierend auf Strategien definiert werden, die getestet und bewiesen wurden. RL-Agenten versuchen, eine Belohnung zu maximieren, was nur durch Versuch und Irrtum von zuvor getesteten Strategien und die Erforschung neuer Strategien getan werden kann. Sie erforschen den Zustands-Aktions-Raum rein mathematisch, was oft dazu fuehrt, dass sie bizarre, aber optimale Strategien entdecken (dies koennte eine gute oder eine schlechte Sache sein). Wie im Experimente-Abschnitt zu sehen sein wird, waehlen die Agenten waehrend des Tests mit dem Belohnungssystem, nur fuer Gold zu farmen ohne es zu benutzen oder rein anzugreifen, selbst wenn die Einheiten sterben. Zu beobachten, ob menschliche Spieler einen Wert aus diesen Simulationen extrahieren koennen, ist eine interessante Idee. Das Erlernen neuer Strategien durch das Beobachten einer KI-Simulation spart immense Mengen an Zeit, die manuell fuer das Experimentieren oder das Auswendiglernen neuer Strategien aufgewendet wuerden. Zusaetzlich lehrt es Spieler neue Wege, auf ungewoehnliche, Out-of-the-Box-Taktiken zu reagieren, denen sie in echten kompetitiven Spielen gegen andere Spieler begegnen koennten. Wenn ein RL-Agent eine bisher ungesehene Einheitszusammensetzung oder ein unkonventionelles Pathing-Manoever entdeckt, das die aktuelle menschliche Meta bricht, kann dieses Wissen direkt zu den Spielern zurueckuebertragen werden. Um die oben skizzierten Ziele anzugehen, wird diese Arbeit von den folgenden Forschungsfragen geleitet und die erwarteten Ergebnisse als die Hypothesen unten dargelegt: RQ1: Algorithmische Leistung in RTS-Umgebungen. Wie vergleichen sich wertbasierte (DQN) und Policy-Gradient (PPO) Reinforcement-Learning-Algorithmen in Bezug auf Anpassungsfaehigkeit, Trainingsstabilitaet, Leistung und allgemeine Gewinnrate innerhalb einer hochkomplexen, Echtzeit-Strategie-Umgebung? H1: Hypothese eins ist, dass PPO signifikant besser als DQN sowohl in der Gewinnrate als auch in der strategischen Anpassungsfaehigkeit abschneiden wird. PPOs stochastische Politik und das geclippte Surrogat-Ziel sind theoretisch besser ausgeruestet, um die massiven Zustands-Aktions-Raeume, verzoegerten Belohnungen und subtilen Umweltverschiebungen (wie randomisierte Zugfolgen), die RTS-Spielen innewohnen, zu handhaben, wohingegen DQNs deterministische Natur sich als zu sproede erweisen wird. RQ2: RL-Agenten als Esports-Lerner. Kann eine agentengetriebene Strategie-GUI menschlichen Spielern neue, mathematisch optimale Strategien beibringen? H2: Hypothese zwei besagt, dass das Aussetzen der Echtzeit-Wahrscheinlichkeitsverteilungen des Aktionsraums eines RL-Agenten durch eine dedizierte GUI es menschlichen Beobachtern ermoeglichen wird, effektiv Strategien leicht zu identifizieren, zu verstehen und in ihrem eigenen Gameplay zu implementieren.