Das Department of Computer Science & Artificial Intelligence bietet über sein Fundamental AI Lab (FunAI Lab) eine Möglichkeit zur Promotion (3 Jahre, 100 %, TV-L 13) im Bereich visuell ausgerichteter Vision-Language-Action-Modelle (VLA) an.
Wir suchen eine hochmotivierte Forscherin bzw. einen hochmotivierten Forscher, die bzw. der Embodied-AI-Systeme entwickeln möchte, deren Handlungen auf einem fundierten visuellen, zeitlichen und geometrischen Verständnis beruhen. Das Promotionsprojekt untersucht, wie Videoverständnis und explizite 3D-Geometrie VLA-Modelle verbessern können. Eine zentrale Forschungsrichtung besteht darin, VLA-Architekturen mit geometrischen Foundation Models für Multi-View- und videobasiertes Szenenverständnis (z. B. Modellen im Stil von VGGT) zu verbinden. Ziel ist es, Agenten zu befähigen, räumlich konsistente Szenenrepräsentationen aufzubauen, über Kamera- und Objektbewegungen zu schlussfolgern, ein persistentes Szenengedächtnis zu bewahren und Handlungen auszuwählen, die in der physischen Welt verankert sind. Mögliche Forschungsrichtungen umfassen selbstüberwachtes Lernen aus Videos, zeitliches und geometrisches Repräsentationslernen, multimodale Fusion, aktionskonditionierte Vorhersage sowie die Evaluation in Simulationen und/oder auf robotischen Plattformen. Das FunAI Lab bietet ein internationales Forschungsumfeld, enge Betreuung, Zugang zu moderner Recheninfrastruktur, finanzielle Unterstützung für Konferenzbesuche und Möglichkeiten zur Zusammenarbeit innerhalb der UTN.
Die Bewerberin bzw. der Bewerber wird am Fundamental AI Lab (FunAI Lab) arbeiten, das grundlegende Methoden für selbstüberwachtes Lernen, Videoverständnis, Vision-Language- und multimodales Lernen sowie Schlussfolgern und Planen entwickelt. Das Projekt wird in enger Zusammenarbeit mit Forschenden des Projektpartners Helsing, einem europäischen Verteidigungsunternehmen, durchgeführt. Ein Kernelement der Stelle ist die Überführung von Forschung in die Praxis: Die Doktorandin bzw. der Doktorand wird regelmäßig direkt mit den Teams von Helsing zusammenarbeiten, Systeme gemeinsam konzipieren und Methoden an realen Anwendungsproblemen validieren. Die Zusammenarbeit umfasst eine Ko-Betreuung durch Thomas Unterthiner (Mitautor der ViT-Veröffentlichung) sowie die Möglichkeit eines Praktikums und zeitweiliger gemeinsamer Arbeitsaufenthalte vor Ort.
Ihre Aufgaben:
- Durchführung eigenständiger Forschung an visuell ausgerichteten VLA-Modellen, die Sprache und Handlungen mit videobasiertem und 3D-geometrischem Szenenverständnis verbinden
- Entwicklung von Architekturen, die VLA-Policies mit geometrischen Foundation Models (z. B. Modellen im Stil von VGGT) verbinden und Signale wie Tiefe, Punktkarten, Kameraposen, Tracks, Objektbewegungen und ein persistentes Szenengedächtnis nutzen
- Entwicklung skalierbarer Trainings- und Evaluationsmethoden mit egozentrischen Videos, Multi-View-Daten, Roboterdemonstrationen und/oder Simulationen sowie Vergleich geometriebewusster Ansätze mit starken 2D- und reinen Video-Baselines
- Enge und regelmäßige Zusammenarbeit mit den Forschungs- und Entwicklungsteams von Helsing, um Systeme gemeinsam zu konzipieren und Forschungsprototypen in validierte Anwendungslösungen zu überführen
- Veröffentlichung und Präsentation der Forschung auf führenden internationalen Konferenzen, gegebenenfalls Beitrag zu wiederverwendbarem Code und Benchmarks, Unterstützung der Lehre sowie aktive Teilnahme am akademischen Leben des Departments und der Forschungsgruppe
Die erfolgreiche Bewerberin bzw. der erfolgreiche Bewerber bringt Expertise in Computer Vision, Geometrie, Video oder Embodied Learning in die Aktivitäten des Fundamental AI Lab ein und profitiert von den vielfältigen Perspektiven des Teams auf selbstüberwachtes, multimodales und Foundation-Model-Lernen. Ein besonderer gemeinsamer Schwerpunkt ist die Entwicklung von Modellen, die Wahrnehmung, Schlussfolgern und Handeln durch zeitlich und geometrisch fundierte Repräsentationen verbinden.
Ihr Profil:
Bewerberinnen und Bewerber sollten über einen sehr guten Masterabschluss in Informatik, Künstlicher Intelligenz, Robotik, Elektrotechnik, Mathematik oder einem eng verwandten Fachgebiet verfügen. Erforderlich sind fundierte Kenntnisse in Machine Learning, Deep Learning und Computer Vision sowie praktische Erfahrung mit Python und einem Framework wie PyTorch.
Erfahrung in mindestens einem der Bereiche Videoverständnis, Multi-View-Geometrie, 3D Computer Vision, SLAM, Vision-Language-Modelle, Robot Learning oder VLA-Modelle ist sehr erwünscht; Erfahrung mit großskaligem Training, Simulation oder robotischen Systemen ist von Vorteil. Bewerberinnen und Bewerber sollten in der Lage sein, eigenständig zu forschen und in einem internationalen Team effektiv zusammenzuarbeiten. Sehr gute schriftliche und mündliche Englischkenntnisse sind erforderlich; Deutschkenntnisse werden nicht vorausgesetzt.
Interessiert?
Wenn Ihr Profil den Anforderungen entspricht, laden Sie bitte folgende Dokumente mit ihrer Bewerbung hoch:
- Ein Persönliches Motivationsschreiben, in dem Sie die Gründe für Ihren Promotionswunsch an der UTN darlegen und weshalb Sie sich für dieses Forschungsfeld und das Department interessieren.
- Ein vollständiger chronologischer, tabellarischer Lebenslauf in englischer Sprache.
- Nachweise über Ihre Studienabschlüsse (M.Sc. sowie B.Sc.) oder gleichwertige Qualifikationen.
- Transcript of Records, Diploma Supplements oder Kursübersichten ihrer Studienabschlüsse (M.Sc. sowie B.Sc. oder gleichwertige Abschlüsse).
- Eine kurze Beschreibung (maximal eine Seite) einer Forschungsidee an der Schnittstelle von VLA-Modellen, Videoverständnis und 3D-Geometrie; sofern vorhanden, Links zu Publikationen, Code oder relevanten Projekten
Bitte beachten: Falls Sie Ihre Abschlüsse (M.Sc. sowie B.Sc. oder gleichwertige Abschlüsse) im Ausland erhalten haben, müssen Sie stets die Originalversion zusammen mit einer Übersetzung ins Englische oder Deutsche einreichen. Die Übersetzung muss von einem staatlich geprüften Übersetzer/einer staatlich geprüften Übersetzerin angefertigt worden sein und über ein offizielles Siegel verfügen.
Dokumente, deren Originalsprache Englisch ist, müssen nicht übersetzt werden.
Sollten Sie in die engere Auswahl kommen, erhalten Sie eine Einladung zu einem Interview, bei dem Sie Ihre Forschungsarbeit vorstellen können.
Bitte beachten Sie: Vorstellungsgespräche werden auf laufender Basis in wöchentlichen Intervallen stattfinden.
Weitere Informationen zum Bewerbungsverfahren und zu den Zulassungsvoraussetzungen finden Sie unter https://www.utn.de/en/research/doctoral-degree/.
Weitere Informationen zur Entgeltgruppe TV-L E13 finden Sie unter https://oeffentlicher-dienst.info/tv-l/allg/.
Bitte beachten: Reisekosten und sonstige im Rahmen der Bewerbung anfallende Aufwände können nicht von uns erstattet werden.
Sie haben Fragen?
Bitte richten Sie alle inhaltlichen Anfragen an Prof. Yuki Asano (yuki.asano@utn.de).
Bei allgemeinen Fragen wenden Sie sich bitte an stars@utn.de.