Digitalisierung & KI Industrie & Produktion
Veröffentlichungsdatum: 17.09.2026 | 0 Kommentare

Wenn Roboter im digitalen Zwilling laufen lernen

Reinforcement Learning für vier- und zweibeinige Roboter am Aalener Steinbeis-Transferzentrum NectOne

Humanoide und vierbeinige Roboter lernen das Laufen heute nicht mehr auf dem realen Prüfstand, sondern in der Simulation. Klassische Regelungstechnik beschreibt das Laufen über handentworfene Modelle – für einen zweibeinigen Roboter, der auf Treppen und Schotter balancieren soll, ist das kaum beherrschbar. Reinforcement Learning verfolgt eine andere Idee: Der Roboter probiert Bewegungen aus, wird für erwünschtes Verhalten belohnt und für Stürze bestraft. Über Millionen Versuche entsteht eine Regelungsstrategie (Policy), die robuster auf unvorhergesehene Situationen reagiert als jeder handentworfene Regler. Das Steinbeis-Transferzentrum Mechatronik und Robotik (NectOne) nutzt im Rahmen der Kooperation mit der Hochschule Aalen dafür einen leistungsstarken KI-Rechner, auf dem Bewegungsstrategien mittels Reinforcement Learning trainiert und anschließend auf reale Hardware übertragen werden.

Der Isaac-Sim-Kompatibilitäts-Check bestätigt die Freigabe der Aalener Workstation.
Der humanoide Unitree G1 in Isaac Sim. Über den Action Graph (unten) und „ROS2 Subscribe Joint State“ werden Gelenk­zustände mit ROS 2 ausgetauscht – die Brücke zwischen Simulation und Realität.
Training des vierbeinigen Unitree Go1 in NVIDIA Isaac SIM - Hunderte Roboter üben gleichzeitig auf ebenem und unebenem Terrain, Stufen, Treppen und Steigungen.
Im Labor der Hochschule Aalen wird erprobt, wie die in NVIDIA Isaac trainierten Bewegungsstrategien auf einen realen humanoiden Roboter übertragen werden.

Auf einer einzigen Graphics Processing Unit (GPU) laufen in paralleler Simulation Tausende Roboter gleichzeitig, sodass sich Monate an Erfahrung auf Minuten bis Stunden verdichten. Damit das Erlernte auch auf der echten Maschine funktioniert, variiert die Domänenrandomisierung gezielt die physikalischen Parameter und schließt so den Sim-to-Real-Gap, also den Leistungsunterschied eines Modells zwischen Simulation und echter Welt. Dieses Zusammenspiel aus Simulation, Lernen und Transfer fasst der Begriff Physical AI zusammen.

„Für die Industrie ist dieser Ansatz doppelt attraktiv: Er erschließt mit der verkörperten künstlichen Intelligenz, der Embodied AI, ein hochaktuelles Forschungsfeld und lässt sich zugleich unmittelbar in die Lehre und in Transferprojekte mit Unternehmen überführen“, betont Steinbeis-Unternehmer Professor Dr.-Ing. Sebastian Feldmann. Vier- und zweibeinige Roboter stehen dabei stellvertretend für eine ganze Klasse von Systemen, die sich künftig eigenständig in unstrukturierten Umgebungen bewegen sollen – von der Inspektion technischer Anlagen über die innerbetriebliche Logistik bis hin zu Assistenzaufgaben.

Der KI-Rechner als Fundament

Grundlage der Arbeiten ist eine eigens konfigurierte KI-Workstation. Da der Trainingsdurchsatz unmittelbar mit dem Grafikspeicher skaliert, bildet eine Profi-Grafikkarte mit sehr großem Speicher das Herzstück. Auf ihr laufen Physiksimulation, Rendering und das Training des neuronalen Netzes gemeinsam ab. Auch die weiteren Komponenten des Rechners sind auf das Roboterlernen abgestimmt: Die 24 Kerne des Threadripper-Prozessors organisieren den Aufbau der Tausend Simulationsumgebungen und bereiten die Trainingsdaten auf, während 128 GB Arbeitsspeicher und die schnelle PCIe-5.0-SSD den Umgang mit umfangreichen USD-Szenen und langen Trainingsprotokollen ermöglichen.

Die Isaac-Plattform: drei Werkzeuge, drei Aufgaben

Die Programme der Isaac-Familie wurden gezielt für die Entwicklung, Simulation und das Training von Robotern gebaut. Isaac Sim ist der Simulator: Hier entsteht der digitale Zwilling aus Roboter, Umgebung und Sensorik. Isaac Lab ist ein schlankes, quelloffenes Framework, das darauf aufsetzt und das speziell dem Roboterlernen dient. Kurz: Isaac Sim liefert Physik und Bild, Isaac Lab die Lernlogik. Ein Vorteil des offenen USD-Formats ist die Interoperabilität – Roboter-, Umgebungs- und Sensormodelle lassen sich ähnlich wie Ebenen in einem Grafikprogramm schichtweise aufbauen, versionieren und projektübergreifend wiederverwenden. Davon grundlegend zu unterscheiden ist Isaac ROS – kein Simulator, sondern GPU-beschleunigte Pakete für das Robot Operating System (ROS 2). Sie laufen auf dem realen Roboter und übernehmen dort Wahrnehmung, Lokalisierung und Navigation in Echtzeit. Isaac Sim (mit Isaac Lab) ist also die Trainingsumgebung auf der Workstation, Isaac ROS die Laufzeitsoftware auf der Maschine. Gemeinsamer Nenner ist ROS 2, über das simulierte und reale Welt dieselbe Sprache sprechen.

Robotertraining in fünf Schritten

Ein Trainingslauf hat einen wiederkehrenden Ablauf in fünf Schritten:

  1. Robotermodell aufbereiten
    Das Modell wird in OpenUSD überführt; Massen, Trägheiten, Gelenkgrenzen und Antriebe werden hinterlegt. Für die Plattformen an der Hochschule Aalen – den vier­beinigen Unitree Go1 und Humanoide wie den Unitree G1 – stehen validierte Beschreibungen bereit.
     
  2. Aufgabe und Belohnung definieren
    Der Roboter erhält einen Geschwindigkeitsbefehl (zum Beispiel „1,0 m/s vorwärts“) und muss alle Gelenke so koordinieren, dass er ihm folgt und das Gleichgewicht hält. Die Belohnung honoriert Zielgeschwindigkeit und ruhigen Gang, bestraft Stürze und Kollisionen – ihre Qualität entscheidet maßgeblich über den Erfolg. Als Beobachtung erhält die Policy den aktuellen Zustand des Roboters – etwa Gelenkwinkel, Geschwindigkeiten und die Lage im Raum – gemeinsam mit dem Befehl. Als Aktion gibt sie neue Zielwinkel für die Gelenke aus.
     
  3. Parallele Umgebungen wählen 
    Die Zahl der parallel simulierten Umgebungen ist der wichtigste Durchsatzhebel und wird durch den Grafikspeicher begrenzt.
     
  4. Policy trainieren
    Das Training übernimmt meist die Bibliothek RSL-RL (ETH Zürich) mit dem Algorithmus Proximal Policy Optimization (PPO). Nach dem Prinzip des Curriculum Learning üben die Roboter auf zunehmend schwierigerem Untergrund – von ebenem über unebenes und stufiges Terrain bis zu Treppen und Steigungen –, während die Domänenrandomisierung Reibung, Massen, Schwerpunkte und Störkräfte variiert. PPO verbessert die Strategie über viele Iterationen behutsam, sodass das Training stabil bleibt. Je nach Aufgabe sind einige tausend Iterationen nötig. Eine Laufstrategie ist oft schon nach Minuten bis wenigen Stunden einsatzbereit.
     
  5. Fortschritt überwachen 
    Verfolgt werden die mittlere Belohnung und das im Curriculum erreichte Schwierigkeitsniveau. Erst wenn die Policy zuverlässig und robust agiert, folgt der Schritt in die reale Welt.

Vom digitalen Zwilling auf den realen Roboter

Die austrainierte Policy wird als kompaktes neuronales Netz exportiert und auf dem Bordrechner des Roboters ausgeführt. Dank Domänenrandomisierung gelingt der Transfer im Idealfall ohne Nachtraining. Dort übernimmt Isaac ROS die Wahrnehmung, während die Policy Zielwinkel für die Gelenke berechnet, die ein unterlagerter Regler präzise umsetzt. Über ROS 2 sind Simulation und reales System durchgängig verbunden.

Die größte Hürde bei diesem Schritt ist der Sim-to-Real-Gap: Reale Aktoren, Sensoren und Reibungsverhältnisse weichen stets ein Stück weit von der Simulation ab. Genau hier zahlt sich die zuvor eingesetzte Domänenrandomisierung aus – eine Policy, die im Training bereits Tausende leicht unterschiedliche Varianten gemeistert hat, betrachtet die reale Welt lediglich als eine weitere dieser Varianten und bleibt dadurch robust.

Beim Übergang zum zweibeinigen Roboter, dem Humanoiden, kommt ein Schritt hinzu. Zweibeinige Systeme sind ohnehin anspruchsvoller als vierbeinige, da sie über eine kleinere Unterstützungsfläche verfügen und permanent aktiv balancieren müssen. Zudem sollen Humanoide oft menschenähnliche Bewegungen ausführen. Referenzbewegungen – etwa aus Motion-Capture-Aufnahmen – dienen als Vorbild, müssen wegen abweichender Proportionen und Gelenke aber zunächst auf die Roboterkinematik übertragen werden. Anschließend lernt eine Motion-Tracking-Policy im Training, diesen Vorgaben zu folgen und dabei selbst das Gleichgewicht zu wahren – eine Aufgabe der Ganzkörperregelung. Als Absicherung wird die Policy vor dem Hardware-Einsatz zusätzlich in einer zweiten, unabhängigen Physiksimulation geprüft.

„Unsere neue KI-Workstation und die NVIDIA-Isaac-Plattform erlauben es zusammen mit den Industriepartnern, modernes Roboterlernen praxisnah zu erforschen und zu lehren – vom massiv parallelen Training im digitalen Zwilling bis zum Transfer auf reale vier- und zweibeinige Roboter“, fasst Sebastian Feldmann zusammen. Für den Technologietransfer entsteht daraus ein konkretes Feld: Unternehmen können erprobte Bewegungsstrategien für Inspektions-, Logistik- oder Assistenzaufgaben entwickeln lassen, ohne kostspielige Versuchsreihen an realer Hardware. Zukünftige Arbeiten am Steinbeis-Transferzentrum werden das Retargeting menschlicher Bewegungen verfeinern und wahrnehmungsbasierte Strategien erproben, bei denen der Roboter das Gelände über Kamerasensoren selbst erfasst und einbezieht.

Kontakt

Prof. Dr.-Ing. Sebastian Feldmann (Autor)

Steinbeis-Unternehmer
Steinbeis-Transferzentrum Mechatronik und Robotik (NectOne) (Aalen)
www.nectone.com

234219-14
Zuletzt geändert am 17.09.2026

Schreibe einen Kommentar

Durch Anklicken des Buttons „Anfrage senden" stimme ich der Nutzung meiner Daten gemäß den Steinbeis-Datenschutzbestimmungen zu.
Bitte füllen Sie die mit * markierten Felder vollständig aus.