Die Mercedes-Benz Group AG ist eines der erfolgreichsten Automobilunternehmen der Welt. Mit der Mercedes-Benz AG gehört der Fahrzeughersteller zu den größten Anbietern von Premium- und Luxus-Pkw und Vans.
In unserem crossfunktionalen Team AI Research – Physical AI erforschen wir neueste Technologien für KI-gestützte Robotikarchitekturen und moderne AI-Stacks. Ein zentrales Forschungsfeld ist das Lernen komplexer Manipulationsfähigkeiten aus menschlichen Demonstrationen. In dieser Masterarbeit untersuchst du, wie Teleoperation, Demonstrationsdaten und Vision-Language-Action-Modelle zur Entwicklung leistungsfähiger Robot-Learning-Systeme eingesetzt werden können.
Dextere Roboterhände ermöglichen die Ausführung komplexer Manipulationsaufgaben und gelten als wichtiges Anwendungsfeld moderner Robot-Learning-Verfahren. Aktuelle Learning-from-Demonstration- und Vision-Language-Action-Ansätze versprechen eine effiziente Übertragung menschlicher Fähigkeiten auf Robotersysteme. Offen ist jedoch, welche Faktoren die Lernleistung und Generalisierungsfähigkeit dieser Verfahren maßgeblich beeinflussen.
Ziel der Arbeit ist die wissenschaftliche Untersuchung des Zusammenhangs zwischen Demonstrationsdaten, Teleoperationsverfahren und der Leistungsfähigkeit moderner Robot-Learning-Ansätze. Hierzu werden Demonstrationsdaten mit einer dexteren Roboterhand erhoben, verschiedene Lernverfahren trainiert und deren Generalisierungsfähigkeit unter unterschiedlichen Versuchsbedingungen systematisch evaluiert.
Mögliche Forschungsfragen sind:
-
Welchen Einfluss hat die Qualität des Hand-Retargetings auf die Leistungsfähigkeit gelernter Manipulationsstrategien?
-
Wie wirken sich Größe und Diversität des Demonstrationsdatensatzes auf Erfolgsrate und Generalisierungsfähigkeit aus?
-
Welchen Einfluss haben unterschiedliche Kamerakonfigurationen und Sensorsysteme auf die Lernleistung?
-
In welchem Umfang profitieren Vision-Language-Action-Modelle von aufgabenspezifischem Fine-Tuning im Vergleich zu klassischen Imitation-Learning-Verfahren?
-
Welche Faktoren limitieren die Übertragbarkeit teleoperierter Demonstrationen auf unbekannte Objekte und Manipulationsszenarien?
Die Arbeit soll neue wissenschaftliche Erkenntnisse über den Zusammenhang zwischen Teleoperation, Demonstrationsdatenqualität und der Leistungsfähigkeit moderner Robot-Learning-Verfahren liefern.
Die Ergebnisse sollen zu einem besseren Verständnis beitragen, wie sich dextere Manipulationsfähigkeiten mithilfe von Learning-from-Demonstration-Ansätzen und Vision-Language-Action-Modellen effizient von Menschen auf Robotersysteme übertragen lassen. Darüber hinaus sollen konkrete Empfehlungen hinsichtlich Datenerfassung, Demonstrationsqualität, Sensorik und Modelltraining für zukünftige robotische Lernsysteme abgeleitet werden.
Diese Herausforderungen kommen auf Dich zu:
-
Literaturrecherche zu dexterer Teleoperation, Hand-Retargeting, Imitation Learning sowie modernen Vision-Language-Action-Modellen (z. B. ACT, Diffusion Policy, OpenVLA oder π0)
-
Aufbau bzw. Erweiterung einer Teleoperationsplattform zur Steuerung einer fünffingrigen Roboterhand
-
Entwicklung einer Hand-Retargeting-Pipeline zur Übertragung menschlicher Handbewegungen auf die Kinematik einer dexteren Roboterhand unter Erhalt der Manipulationsabsicht
-
Definition repräsentativer Manipulationsaufgaben sowie Aufbau einer synchronisierten Datenerfassungs-Pipeline zur Integration von Mehrkamera-Bilddaten, propriozeptiven Signalen und Roboteraktionen
-
Erhebung, Aufbereitung und Analyse eines Demonstrationsdatensatzes für Learning-from-Demonstration-Ansätze
-
Training und Benchmarking von Imitation-Learning-Baselines sowie Fine-Tuning moderner Vision-Language-Action-Modelle auf den erhobenen Daten
-
Planung und Durchführung kontrollierter Experimente zur Untersuchung des Einflusses von Demonstrationsqualität, Datenmenge, Datensatzdiversität und Sensorik auf die Modellleistung
-
Wissenschaftliche Evaluation der resultierenden Strategien auf einer realen Roboterplattform hinsichtlich Erfolgsrate, Robustheit und Generalisierung auf unbekannte Objekte, Objektlagen und Manipulationssituationen
-
Analyse der Ergebnisse sowie Ableitung wissenschaftlich fundierter Empfehlungen für effiziente Learning-from-Demonstration-Systeme
Die Tätigkeit kann ab Oktober 2026 beginnen.