automatisierungs-konzepte.dePhoenixOne · Humanoide Roboter für die IndustrieRoboter anfragen →

Begriffe · Glossar

VLA-Modell (Vision-Language-Action).Was der Begriff bedeutet.

Ein VLA-Modell (Vision-Language-Action-Modell) ist ein KI-Modell, das Kamerabilder und eine Anweisung in natürlicher Sprache aufnimmt und daraus direkt Steuerbefehle für einen Roboter erzeugt. Der Begriff wurde 2023 in der Arbeit zu RT-2 eingeführt (arXiv:2307.15818).

Kurz beantwortet · Stand Oktober 2026
Glasfigur eines humanoiden Roboters auf einem Silbersockel, davor geschichtete Glasplatten wie Normblätter, kupferne Kante
Vor dem Pilot: Konformität, Risikobeurteilung, Arbeitsschutz.

01  Definition

VLA-Modell (Vision-Language-Action): die Erklärung.

Ein VLA-Modell verbindet drei Dinge in einem Netz: Sehen (Vision), Sprache (Language) und Handeln (Action). Die Forschungsgruppe hinter RT-2 beschrieb 2023 den Ansatz, große Bild-Sprach-Modelle gemeinsam mit Roboterdaten weiterzutrainieren. Roboteraktionen werden dabei als Text-Token dargestellt, genau wie Wörter. Diese Modellklasse nannten die Autoren Vision-Language-Action-Modelle, kurz VLA. Ein VLA-Modell nimmt also nicht nur Bilder auf, sondern versteht auch eine Aufgabe in Worten, etwa „lege das rote Teil in den Behälter“.

Der Vorteil liegt im Vorwissen aus dem Internet. Weil das Modell auf großen Bild- und Textmengen vortrainiert ist, kann es laut RT-2-Arbeit Anweisungen umsetzen, die in den Roboterdaten nicht vorkamen, etwa einen Gegenstand auf eine bestimmte Zahl zu legen. Die Autoren werteten dafür rund 6.000 Versuche aus. Später folgten offene Modelle. OpenVLA (arXiv:2406.09246) hat 7 Milliarden Parameter und wurde mit rund 970.000 Roboter-Vorführungen trainiert. Laut OpenVLA-Arbeit lässt sich ein solches Modell mit vergleichsweise wenig eigenen Daten für neue Umgebungen feinjustieren.

Es gibt verschiedene Bauweisen. RT-2 und OpenVLA erzeugen Aktionen als diskrete Token. Das Modell π0 (arXiv:2410.24164) setzt auf ein vortrainiertes Bild-Sprach-Modell eine eigene Komponente, die kontinuierliche Bewegungen per Flow Matching erzeugt. Es wurde mit Daten mehrerer Robotertypen trainiert, darunter Einarm-, Zweiarm- und mobile Roboter. Welche Bauweise im Werk besser funktioniert, ist eine offene Forschungsfrage.

Grenzen sind wichtig. Die veröffentlichten Erfolgsquoten stammen aus Laborversuchen mit festgelegten Aufgaben. Für ein Werk sagen sie wenig über Taktzeit, Fehlerrate und Verhalten bei unbekannten Teilen. Ein VLA-Modell ist außerdem keine Sicherheitsfunktion. Schutz von Personen gehört in eine geprüfte Sicherheitssteuerung nach ISO 13849-1. Hinzu kommen Rechenbedarf und Antwortzeit. Große Modelle brauchen leistungsfähige Rechner. Ob das Modell im Roboter oder auf einem Server läuft, beeinflusst Verzögerung, Netzabhängigkeit und Datenfluss.

02  Industrie

Was das für ein großes Werk heißt.

Für ein Werk kann ein VLA-Modell bedeuten, dass ein Roboter neue Teile oder Behälter nach wenigen Vorführungen und einer Anweisung handhabt. Im Pilot sollten Sie die Erfolgsquote an Ihren echten Teilen, die Rechenhardware im Roboter und die Datenflüsse in eine Cloud prüfen. Die Sicherheitsfunktionen bleiben davon getrennt zu bewerten.

Pilot-Lastenheft erstellen · kostenfrei

Lieber direkt über Ihren Pilot sprechen?

Aufgabe, Takt, Umgebung, Freigaben, Herstellerunterlagen: in zehn Minuten ein Lastenheft-Entwurf für Ihren Pilot.

Jetzt prüfen →

03  Abgrenzung

Abgrenzung zu verwandten Begriffen.

BegriffUnterschied
Foundation ModelFoundation Model ist der Oberbegriff für große vortrainierte Modelle, ein VLA-Modell ist eine Form davon, die direkt Roboteraktionen ausgibt.
Sprachmodell (LLM)Ein Sprachmodell gibt Text aus, ein VLA-Modell gibt Bewegungsbefehle aus.
Imitation LearningImitation Learning ist ein Lernverfahren aus Vorführungen, mit dem auch VLA-Modelle für eine konkrete Aufgabe feinjustiert werden.

05  Fragen

Häufige Fragen kurz beantwortet.

Was ist ein VLA-Modell in der Robotik?

Ein VLA-Modell ist ein KI-Modell, das Kamerabild und Sprachanweisung verarbeitet und direkt Steuerbefehle für einen Roboter ausgibt. VLA steht für Vision, Language, Action. Den Begriff führte 2023 die Arbeit zu RT-2 ein. Bekannte offene Beispiele sind OpenVLA mit 7 Milliarden Parametern und π0.

Können VLA-Modelle schon in der Produktion eingesetzt werden?

Veröffentlichte Ergebnisse zu VLA-Modellen stammen Stand Oktober 2026 überwiegend aus Labor- und Pilotversuchen. Für die Produktion müssen Erfolgsquote, Taktzeit und Fehlerverhalten an echten Teilen gemessen werden. Sicherheitsfunktionen gehören nicht in das VLA-Modell, sondern in eine geprüfte Sicherheitssteuerung. Pilotversuche mit eigenen Teilen sind deshalb der übliche Weg.

Wie viele Daten braucht ein VLA-Modell?

Ein VLA-Modell braucht für das Vortraining sehr viele Daten. OpenVLA wurde laut Veröffentlichung mit rund 970.000 Roboter-Vorführungen aus dem Open-X-Embodiment-Datensatz trainiert, dazu kommt das Vorwissen des Bild-Sprach-Modells. Für eine neue Aufgabe im Werk reicht danach oft eine Feinjustierung mit deutlich weniger eigenen Vorführungen.

Ihre Aufgabe, unser Kontakt.Der passende Roboter aus Shanghai.

Beschreiben Sie, was der Roboter tun soll. Wir suchen über unseren direkten Kontakt zu Herstellern in Shanghai das passende Modell und klären die Unterlagen, die Ihr Werk für die Freigabe braucht.

Roboter anfragen →Pilot-Lastenheft erstellenTermin vereinbaren

Deutsche Anforderungen. Chinesisches Tempo. Unverbindlich, per E-Mail an vertrieb@phoenixone.ai.