Begriffe · Glossar
VLA-Modell (Vision-Language-Action).Was der Begriff bedeutet.
Ein VLA-Modell (Vision-Language-Action-Modell) ist ein KI-Modell, das Kamerabilder und eine Anweisung in natürlicher Sprache aufnimmt und daraus direkt Steuerbefehle für einen Roboter erzeugt. Der Begriff wurde 2023 in der Arbeit zu RT-2 eingeführt (arXiv:2307.15818).
Kurz beantwortet · Stand Oktober 2026
01 Definition
VLA-Modell (Vision-Language-Action): die Erklärung.
Ein VLA-Modell verbindet drei Dinge in einem Netz: Sehen (Vision), Sprache (Language) und Handeln (Action). Die Forschungsgruppe hinter RT-2 beschrieb 2023 den Ansatz, große Bild-Sprach-Modelle gemeinsam mit Roboterdaten weiterzutrainieren. Roboteraktionen werden dabei als Text-Token dargestellt, genau wie Wörter. Diese Modellklasse nannten die Autoren Vision-Language-Action-Modelle, kurz VLA. Ein VLA-Modell nimmt also nicht nur Bilder auf, sondern versteht auch eine Aufgabe in Worten, etwa „lege das rote Teil in den Behälter“.
Der Vorteil liegt im Vorwissen aus dem Internet. Weil das Modell auf großen Bild- und Textmengen vortrainiert ist, kann es laut RT-2-Arbeit Anweisungen umsetzen, die in den Roboterdaten nicht vorkamen, etwa einen Gegenstand auf eine bestimmte Zahl zu legen. Die Autoren werteten dafür rund 6.000 Versuche aus. Später folgten offene Modelle. OpenVLA (arXiv:2406.09246) hat 7 Milliarden Parameter und wurde mit rund 970.000 Roboter-Vorführungen trainiert. Laut OpenVLA-Arbeit lässt sich ein solches Modell mit vergleichsweise wenig eigenen Daten für neue Umgebungen feinjustieren.
Es gibt verschiedene Bauweisen. RT-2 und OpenVLA erzeugen Aktionen als diskrete Token. Das Modell π0 (arXiv:2410.24164) setzt auf ein vortrainiertes Bild-Sprach-Modell eine eigene Komponente, die kontinuierliche Bewegungen per Flow Matching erzeugt. Es wurde mit Daten mehrerer Robotertypen trainiert, darunter Einarm-, Zweiarm- und mobile Roboter. Welche Bauweise im Werk besser funktioniert, ist eine offene Forschungsfrage.
Grenzen sind wichtig. Die veröffentlichten Erfolgsquoten stammen aus Laborversuchen mit festgelegten Aufgaben. Für ein Werk sagen sie wenig über Taktzeit, Fehlerrate und Verhalten bei unbekannten Teilen. Ein VLA-Modell ist außerdem keine Sicherheitsfunktion. Schutz von Personen gehört in eine geprüfte Sicherheitssteuerung nach ISO 13849-1. Hinzu kommen Rechenbedarf und Antwortzeit. Große Modelle brauchen leistungsfähige Rechner. Ob das Modell im Roboter oder auf einem Server läuft, beeinflusst Verzögerung, Netzabhängigkeit und Datenfluss.
02 Industrie
Was das für ein großes Werk heißt.
Für ein Werk kann ein VLA-Modell bedeuten, dass ein Roboter neue Teile oder Behälter nach wenigen Vorführungen und einer Anweisung handhabt. Im Pilot sollten Sie die Erfolgsquote an Ihren echten Teilen, die Rechenhardware im Roboter und die Datenflüsse in eine Cloud prüfen. Die Sicherheitsfunktionen bleiben davon getrennt zu bewerten.
Pilot-Lastenheft erstellen · kostenfrei
Lieber direkt über Ihren Pilot sprechen?
Aufgabe, Takt, Umgebung, Freigaben, Herstellerunterlagen: in zehn Minuten ein Lastenheft-Entwurf für Ihren Pilot.
03 Abgrenzung
Abgrenzung zu verwandten Begriffen.
| Begriff | Unterschied |
|---|---|
| Foundation Model | Foundation Model ist der Oberbegriff für große vortrainierte Modelle, ein VLA-Modell ist eine Form davon, die direkt Roboteraktionen ausgibt. |
| Sprachmodell (LLM) | Ein Sprachmodell gibt Text aus, ein VLA-Modell gibt Bewegungsbefehle aus. |
| Imitation Learning | Imitation Learning ist ein Lernverfahren aus Vorführungen, mit dem auch VLA-Modelle für eine konkrete Aufgabe feinjustiert werden. |
04 Weiter
Verwandte Begriffe und Fachseiten.
Foundation Model (Robotik)
Ein Foundation Model in der Robotik ist ein großes, auf breiten Daten vortrainiertes KI-Mo
Imitation Learning
Imitation Learning (Lernen aus Vorführungen) ist ein Verfahren des maschinellen Lernens, b
Embodied AI
Embodied AI (verkörperte künstliche Intelligenz) bezeichnet KI-Systeme, die in einem physi
Teleoperation und Imitation Learning
Wie Humanoide per Teleoperation lernen und was Datenschutz und Betriebsrat sagen.
KI-Verordnung und Roboter
KI-Verordnung (EU) 2024/1689 und Roboter: Fristen nach dem Digital-Omnibus 2026.
05 Fragen
Häufige Fragen kurz beantwortet.
Was ist ein VLA-Modell in der Robotik?
Ein VLA-Modell ist ein KI-Modell, das Kamerabild und Sprachanweisung verarbeitet und direkt Steuerbefehle für einen Roboter ausgibt. VLA steht für Vision, Language, Action. Den Begriff führte 2023 die Arbeit zu RT-2 ein. Bekannte offene Beispiele sind OpenVLA mit 7 Milliarden Parametern und π0.
Können VLA-Modelle schon in der Produktion eingesetzt werden?
Veröffentlichte Ergebnisse zu VLA-Modellen stammen Stand Oktober 2026 überwiegend aus Labor- und Pilotversuchen. Für die Produktion müssen Erfolgsquote, Taktzeit und Fehlerverhalten an echten Teilen gemessen werden. Sicherheitsfunktionen gehören nicht in das VLA-Modell, sondern in eine geprüfte Sicherheitssteuerung. Pilotversuche mit eigenen Teilen sind deshalb der übliche Weg.
Wie viele Daten braucht ein VLA-Modell?
Ein VLA-Modell braucht für das Vortraining sehr viele Daten. OpenVLA wurde laut Veröffentlichung mit rund 970.000 Roboter-Vorführungen aus dem Open-X-Embodiment-Datensatz trainiert, dazu kommt das Vorwissen des Bild-Sprach-Modells. Für eine neue Aufgabe im Werk reicht danach oft eine Feinjustierung mit deutlich weniger eigenen Vorführungen.
Quellen · Stand Oktober 2026
- Brohan et al. (2023): RT-2, Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, arXiv:2307.15818
- Kim et al. (2024): OpenVLA, An Open-Source Vision-Language-Action Model, arXiv:2406.09246
- Black et al. (2024): π0, A Vision-Language-Action Flow Model for General Robot Control, arXiv:2410.24164
- Open X-Embodiment Collaboration (2023): Robotic Learning Datasets and RT-X Models, arXiv:2310.08864
- ISO 13849-1:2023 Safety of machinery, Safety-related parts of control systems, Part 1
Allgemeine Information, keine Rechts-, Steuer- oder Zollberatung. Maßgeblich sind die jeweiligen Rechtstexte und Bescheide.
Ihre Aufgabe, unser Kontakt.Der passende Roboter aus Shanghai.
Beschreiben Sie, was der Roboter tun soll. Wir suchen über unseren direkten Kontakt zu Herstellern in Shanghai das passende Modell und klären die Unterlagen, die Ihr Werk für die Freigabe braucht.
Deutsche Anforderungen. Chinesisches Tempo. Unverbindlich, per E-Mail an vertrieb@phoenixone.ai.