Begriffe · Glossar
Reinforcement Learning.Was der Begriff bedeutet.
Reinforcement Learning (bestärkendes Lernen) ist ein Verfahren des maschinellen Lernens, bei dem ein Agent durch Versuch und Irrtum lernt, welche Handlungen in einer Umgebung die höchste Belohnung über die Zeit bringen. In der Robotik lernen damit vor allem Laufroboter und Humanoide das Gehen und Balancieren.
Kurz beantwortet · Stand Oktober 2026
01 Definition
Reinforcement Learning: die Erklärung.
Das Standardlehrbuch von Sutton und Barto beschreibt Reinforcement Learning als Lernen, was zu tun ist, um ein Belohnungssignal zu maximieren. Der Agent bekommt nicht gesagt, welche Handlung richtig ist. Er probiert Handlungen aus und erhält Rückmeldung über eine Belohnung. Zwei Merkmale prägen das Verfahren: Suche durch Versuch und Irrtum und verzögerte Belohnung, weil eine Handlung oft erst später Folgen zeigt.
In der Robotik findet das Training meist in der Simulation statt, weil echte Roboter dafür zu langsam, zu teuer und zu gefährdet wären. Die Arbeit von Hwangbo und Kollegen (Science Robotics, 2019) trainierte eine Laufsteuerung für einen vierbeinigen Roboter in der Simulation und übertrug sie auf die echte Maschine. Der Roboter lief damit schneller als mit früheren Methoden und richtete sich nach Stürzen wieder auf. Weil viele Simulationen parallel laufen, sammelt ein Roboter dort in kurzer Zeit sehr viel Erfahrung.
Für humanoide Roboter zeigten Radosavovic und Kollegen (arXiv:2303.03381) eine vollständig gelernte Laufsteuerung. Sie trainierten ein Transformer-Modell mit Reinforcement Learning in vielen zufällig variierten Simulationen und setzten es ohne weiteres Training auf dem echten Roboter ein. Der Roboter lief über verschiedene Untergründe im Freien und fing äußere Stöße ab. Die Steuerung wurde dabei nicht für jede Umgebung neu programmiert.
Die Schwierigkeit liegt in der Belohnungsfunktion. Ist sie ungenau formuliert, findet der Agent Lösungen, die die Belohnung erfüllen, aber nicht das Gewollte. Deshalb wird Reinforcement Learning in der Praxis oft mit Imitation Learning kombiniert. Ein Beispiel: Belohnt man nur die Geschwindigkeit beim Gehen, kann der Roboter einen unnatürlichen, für die Mechanik belastenden Gang lernen. Gute Belohnungsfunktionen berücksichtigen deshalb auch Energie, Gelenkbelastung und Stabilität.
02 Industrie
Was das für ein großes Werk heißt.
Für ein Werk steckt Reinforcement Learning meist unsichtbar in der Lauf- und Balancesteuerung eines Humanoiden oder Vierbeiners. Der Betreiber trainiert selbst in der Regel nicht. Wichtig ist die Frage an den Hersteller, wie die gelernte Steuerung getestet wurde und wie sie mit der Sicherheitssteuerung zusammenspielt.
Pilot-Lastenheft erstellen · kostenfrei
Lieber direkt über Ihren Pilot sprechen?
Aufgabe, Takt, Umgebung, Freigaben, Herstellerunterlagen: in zehn Minuten ein Lastenheft-Entwurf für Ihren Pilot.
03 Abgrenzung
Abgrenzung zu verwandten Begriffen.
| Begriff | Unterschied |
|---|---|
| Imitation Learning | Imitation Learning lernt aus Vorführungen, Reinforcement Learning aus eigener Erfahrung mit Belohnung. |
| Überwachtes Lernen | Überwachtes Lernen braucht für jedes Beispiel die richtige Antwort, Reinforcement Learning nur ein Belohnungssignal. |
| Sim-to-Real | Sim-to-Real ist die Übertragung einer in der Simulation gelernten Steuerung auf den echten Roboter, oft nach Reinforcement Learning. |
04 Weiter
Verwandte Begriffe und Fachseiten.
Sim-to-Real
Sim-to-Real bezeichnet die Übertragung einer in der Computersimulation trainierten Roboter
Imitation Learning
Imitation Learning (Lernen aus Vorführungen) ist ein Verfahren des maschinellen Lernens, b
Dynamische Stabilität
Dynamische Stabilität bezeichnet bei Robotern die Fähigkeit, das Gleichgewicht nur durch f
KI-Verordnung und Roboter
KI-Verordnung (EU) 2024/1689 und Roboter: Fristen nach dem Digital-Omnibus 2026.
Ausfallrisiken bei Humanoiden
Stürze, Akku, Ersatzteile, Wartung: welche Ausfälle drohen und was dann hilft.
05 Fragen
Häufige Fragen kurz beantwortet.
Was ist Reinforcement Learning einfach erklärt?
Reinforcement Learning ist Lernen durch Ausprobieren mit Belohnung. Ein Programm, der Agent, führt Handlungen aus und bekommt eine Rückmeldung, ob das Ergebnis gut oder schlecht war. Über sehr viele Versuche lernt es, welche Handlungen langfristig die meiste Belohnung bringen. Roboter lernen so zum Beispiel das Gehen in einer Simulation.
Lernen humanoide Roboter das Laufen mit Reinforcement Learning?
Viele aktuelle humanoide Roboter lernen das Laufen mit Reinforcement Learning in der Simulation. Eine Forschungsarbeit von 2023 zeigte eine vollständig gelernte Laufsteuerung, die ohne Nachtraining auf dem echten Humanoiden funktionierte. Welche Verfahren ein bestimmtes Modell nutzt, gibt nur der Hersteller an.
Lernt ein Roboter im Werk ständig weiter?
Ein Roboter im Werk lernt in der Regel nicht selbstständig im laufenden Betrieb weiter. Üblich ist, dass Modelle beim Hersteller trainiert, getestet und als Software-Update ausgeliefert werden. Ein Weiterlernen im Betrieb würde die Validierung erschweren. Klären Sie mit dem Hersteller, wann und wie Modelle verändert werden.
Quellen · Stand Oktober 2026
- Sutton, Barto: Reinforcement Learning, An Introduction, 2. Auflage, MIT Press 2018
- Hwangbo et al. (2019): Learning agile and dynamic motor skills for legged robots, Science Robotics 4(26)
- Radosavovic et al. (2023): Real-World Humanoid Locomotion with Reinforcement Learning, arXiv:2303.03381
Allgemeine Information, keine Rechts-, Steuer- oder Zollberatung. Maßgeblich sind die jeweiligen Rechtstexte und Bescheide.
Ihre Aufgabe, unser Kontakt.Der passende Roboter aus Shanghai.
Beschreiben Sie, was der Roboter tun soll. Wir suchen über unseren direkten Kontakt zu Herstellern in Shanghai das passende Modell und klären die Unterlagen, die Ihr Werk für die Freigabe braucht.
Deutsche Anforderungen. Chinesisches Tempo. Unverbindlich, per E-Mail an vertrieb@phoenixone.ai.