Expert Recruiting
Stellenangebote Berufsfelder Arbeitgeber Standorte für Arbeitgeber Impressum
Impressum
Technische Universität Nürnberg

Technische Universität Nürnberg
Vollzeit, Teilzeit
Nürnberg
Jetzt bewerben
  • for english version, see below -

Die Technische Universität Nürnberg (UTN) bietet eine inspirierende und interdisziplinäre Forschungsumgebung mit Zugang zu modernsten Ressourcen. Sie ist der ideale Ort, um zukunftsträchtige Entdeckungen zu machen und einen bedeutenden Beitrag zu spannenden Forschungsfeldern zu leisten.

Promotionsstelle an der UTN im Bereich Vision-Language-Action-Modelle mit Video und 3D-Geometrie (m/w/d) (CSAI-FunAI-2026-01)

Das Department of Computer Science & Artificial Intelligence bietet über sein Fundamental AI Lab (FunAI Lab) eine Möglichkeit zur Promotion (3 Jahre, 100 %, TV-L 13) im Bereich visuell ausgerichteter Vision-Language-Action-Modelle (VLA) an.

Wir suchen eine hochmotivierte Forscherin bzw. einen hochmotivierten Forscher, die bzw. der Embodied-AI-Systeme entwickeln möchte, deren Handlungen auf einem fundierten visuellen, zeitlichen und geometrischen Verständnis beruhen. Das Promotionsprojekt untersucht, wie Videoverständnis und explizite 3D-Geometrie VLA-Modelle verbessern können. Eine zentrale Forschungsrichtung besteht darin, VLA-Architekturen mit geometrischen Foundation Models für Multi-View- und videobasiertes Szenenverständnis (z. B. Modellen im Stil von VGGT) zu verbinden. Ziel ist es, Agenten zu befähigen, räumlich konsistente Szenenrepräsentationen aufzubauen, über Kamera- und Objektbewegungen zu schlussfolgern, ein persistentes Szenengedächtnis zu bewahren und Handlungen auszuwählen, die in der physischen Welt verankert sind. Mögliche Forschungsrichtungen umfassen selbstüberwachtes Lernen aus Videos, zeitliches und geometrisches Repräsentationslernen, multimodale Fusion, aktionskonditionierte Vorhersage sowie die Evaluation in Simulationen und/oder auf robotischen Plattformen. Das FunAI Lab bietet ein internationales Forschungsumfeld, enge Betreuung, Zugang zu moderner Recheninfrastruktur, finanzielle Unterstützung für Konferenzbesuche und Möglichkeiten zur Zusammenarbeit innerhalb der UTN.

Die Bewerberin bzw. der Bewerber wird am Fundamental AI Lab (FunAI Lab) arbeiten, das grundlegende Methoden für selbstüberwachtes Lernen, Videoverständnis, Vision-Language- und multimodales Lernen sowie Schlussfolgern und Planen entwickelt. Das Projekt wird in enger Zusammenarbeit mit Forschenden des Projektpartners Helsing, einem europäischen Verteidigungsunternehmen, durchgeführt. Ein Kernelement der Stelle ist die Überführung von Forschung in die Praxis: Die Doktorandin bzw. der Doktorand wird regelmäßig direkt mit den Teams von Helsing zusammenarbeiten, Systeme gemeinsam konzipieren und Methoden an realen Anwendungsproblemen validieren. Die Zusammenarbeit umfasst eine Ko-Betreuung durch Thomas Unterthiner (Mitautor der ViT-Veröffentlichung) sowie die Möglichkeit eines Praktikums und zeitweiliger gemeinsamer Arbeitsaufenthalte vor Ort.


Ihre Aufgaben:

  • Durchführung eigenständiger Forschung an visuell ausgerichteten VLA-Modellen, die Sprache und Handlungen mit videobasiertem und 3D-geometrischem Szenenverständnis verbinden
  • Entwicklung von Architekturen, die VLA-Policies mit geometrischen Foundation Models (z. B. Modellen im Stil von VGGT) verbinden und Signale wie Tiefe, Punktkarten, Kameraposen, Tracks, Objektbewegungen und ein persistentes Szenengedächtnis nutzen
  • Entwicklung skalierbarer Trainings- und Evaluationsmethoden mit egozentrischen Videos, Multi-View-Daten, Roboterdemonstrationen und/oder Simulationen sowie Vergleich geometriebewusster Ansätze mit starken 2D- und reinen Video-Baselines
  • Enge und regelmäßige Zusammenarbeit mit den Forschungs- und Entwicklungsteams von Helsing, um Systeme gemeinsam zu konzipieren und Forschungsprototypen in validierte Anwendungslösungen zu überführen
  • Veröffentlichung und Präsentation der Forschung auf führenden internationalen Konferenzen, gegebenenfalls Beitrag zu wiederverwendbarem Code und Benchmarks, Unterstützung der Lehre sowie aktive Teilnahme am akademischen Leben des Departments und der Forschungsgruppe

Die erfolgreiche Bewerberin bzw. der erfolgreiche Bewerber bringt Expertise in Computer Vision, Geometrie, Video oder Embodied Learning in die Aktivitäten des Fundamental AI Lab ein und profitiert von den vielfältigen Perspektiven des Teams auf selbstüberwachtes, multimodales und Foundation-Model-Lernen. Ein besonderer gemeinsamer Schwerpunkt ist die Entwicklung von Modellen, die Wahrnehmung, Schlussfolgern und Handeln durch zeitlich und geometrisch fundierte Repräsentationen verbinden.


Ihr Profil:

Bewerberinnen und Bewerber sollten über einen sehr guten Masterabschluss in Informatik, Künstlicher Intelligenz, Robotik, Elektrotechnik, Mathematik oder einem eng verwandten Fachgebiet verfügen. Erforderlich sind fundierte Kenntnisse in Machine Learning, Deep Learning und Computer Vision sowie praktische Erfahrung mit Python und einem Framework wie PyTorch.

Erfahrung in mindestens einem der Bereiche Videoverständnis, Multi-View-Geometrie, 3D Computer Vision, SLAM, Vision-Language-Modelle, Robot Learning oder VLA-Modelle ist sehr erwünscht; Erfahrung mit großskaligem Training, Simulation oder robotischen Systemen ist von Vorteil. Bewerberinnen und Bewerber sollten in der Lage sein, eigenständig zu forschen und in einem internationalen Team effektiv zusammenzuarbeiten. Sehr gute schriftliche und mündliche Englischkenntnisse sind erforderlich; Deutschkenntnisse werden nicht vorausgesetzt.



Interessiert?

Wenn Ihr Profil den Anforderungen entspricht, laden Sie bitte folgende Dokumente mit ihrer Bewerbung hoch:

  • Ein Persönliches Motivationsschreiben, in dem Sie die Gründe für Ihren Promotionswunsch an der UTN darlegen und weshalb Sie sich für dieses Forschungsfeld und das Department interessieren.
  • Ein vollständiger chronologischer, tabellarischer Lebenslauf in englischer Sprache.
  • Nachweise über Ihre Studienabschlüsse (M.Sc. sowie B.Sc.) oder gleichwertige Qualifikationen.
  • Transcript of Records, Diploma Supplements oder Kursübersichten ihrer Studienabschlüsse (M.Sc. sowie B.Sc. oder gleichwertige Abschlüsse).
  • Eine kurze Beschreibung (maximal eine Seite) einer Forschungsidee an der Schnittstelle von VLA-Modellen, Videoverständnis und 3D-Geometrie; sofern vorhanden, Links zu Publikationen, Code oder relevanten Projekten

Bitte beachten: Falls Sie Ihre Abschlüsse (M.Sc. sowie B.Sc. oder gleichwertige Abschlüsse) im Ausland erhalten haben, müssen Sie stets die Originalversion zusammen mit einer Übersetzung ins Englische oder Deutsche einreichen. Die Übersetzung muss von einem staatlich geprüften Übersetzer/einer staatlich geprüften Übersetzerin angefertigt worden sein und über ein offizielles Siegel verfügen.
Dokumente, deren Originalsprache Englisch ist, müssen nicht übersetzt werden.

Sollten Sie in die engere Auswahl kommen, erhalten Sie eine Einladung zu einem Interview, bei dem Sie Ihre Forschungsarbeit vorstellen können.

Weitere Informationen zum Bewerbungsverfahren und zu den Zulassungsvoraussetzungen finden Sie unter .
Weitere Informationen zur Entgeltgruppe TV-L E13 finden Sie unter .

Bitte beachten: Reisekosten und sonstige im Rahmen der Bewerbung anfallende Aufwände können nicht von uns erstattet werden.


Sie haben Fragen?

Bitte richten Sie alle inhaltlichen Anfragen an Prof. Yuki Asano ().

Bei allgemeinen Fragen wenden Sie sich bitte an .

The University of Technology Nuremberg (UTN) offers a stimulating and interdisciplinary research environment with access to cutting-edge resources. It is the ideal place to make groundbreaking discoveries and contribute to exciting fields of research.

Doctoral researcher (Ph.D.) at UTN in Vision-Language-Action Models with Video and 3D Geometry (m/f/d) (CSAI-FunAI-2026-01)

The Department of Computer Science & Artificial Intelligence, through its Fundamental AI Lab (FunAI Lab), is currently offering one opening for a doctoral researcher (3 years, 100%, TV-L 13) in vision-focused vision-language-action (VLA) models. We are seeking a highly motivated researcher who wants to develop embodied AI systems whose actions are grounded in strong visual, temporal, and geometric understanding. The doctoral project will investigate how video understanding and explicit 3D geometry can improve VLA models. A central direction is to combine VLA architectures with geometric foundation models for multi-view and video-based scene understanding (e.g., VGGT-style models). The goal is to enable agents to build spatially consistent scene representations, reason about camera and object motion, retain persistent scene memory, and select actions that are grounded in the physical world. Research directions may include self-supervised learning from video, temporal and geometric representation learning, multimodal fusion, action-conditioned prediction, and evaluation in simulation and/or on robotic platforms. The FunAI Lab offers an international research environment, close supervision, access to modern compute infrastructure, financial support for conference attendance, and opportunities for collaboration across UTN.

The applicant will work at the Fundamental AI Lab (FunAI Lab) which develops fundamental methods for self-supervised learning, video understanding, vision-language and multimodal learning, and reasoning and planning. The project will be a close collaboration with researchers from the project partner, Helsing, a European defence company. A core element of the position is the translation of research into practice: the doctoral researcher will work directly with Helsing's teams on a regular basis, co-designing systems and validating methods on real-world applied problems. The collaboration will involve co-supervision from Thomas Unterthiner (a co-author of the ViT paper) and potential for an internship and co-locations.


Your tasks:

  • Conduct independent research on vision-focused VLA models that integrate language and action with video-based and 3D-geometric scene understanding
  • Develop architectures that connect VLA policies with geometric foundation models (e.g., VGGT-style models), using signals such as depth, point maps, camera pose, tracks, object motion, and persistent scene memory
  • Develop scalable training and evaluation methods using egocentric video, multi-view data, robot demonstrations, and/or simulation; compare geometry-aware approaches with strong 2D and video-only baselines
  • Collaborate closely and regularly with Helsing's research and engineering teams to co-design systems and translate research prototypes into validated, applied solutions
  • Publish and present research at leading international venues, contribute reusable code and benchmarks where appropriate, support teaching activities, and participate actively in the academic life of the department and research group

The successful candidate will contribute expertise in computer vision, geometry, video, or embodied learning to the activities of the Fundamental AI Lab and benefit from the team’s diverse perspectives on self-supervised, multimodal, and foundation-model research. A particular joint focus is the development of models that connect perception, reasoning, and action through temporally and geometrically grounded representations.


Your profile:

Applicants should have an excellent Master’s degree in computer science, artificial intelligence, robotics, electrical engineering, mathematics, or a closely related discipline. Strong foundations in machine learning, deep learning, and computer vision, together with hands-on experience in Python and a framework such as PyTorch, are required. Experience in at least one of video understanding, multi-view geometry, 3D vision, SLAM, vision-language models, robot learning, or VLA models is highly desirable; experience with large-scale training, simulation, or robotic systems is an advantage. Candidates should be able to conduct research independently and collaborate effectively in an international team. Excellent written and spoken English is required; German is not required.



Interested?

If your profile matches the requirements, please upload the following documents:

  • A personal statement that explains why you want to pursue a doctorate at UTN as well as why this research area and department interests you.
  • A complete, chronological, tabular curriculum vitae (CV) in English.
  • Certificates of your university degrees (e.g., M.Sc. degree and B.Sc. degree) or other equivalent qualification.
  • Transcript of records, diploma supplements, or overview of courses from your university degrees (M.Sc. degree and B.Sc. degree).
  • A short description (maximum one page) of a research idea at the intersection of VLA models, video understanding, and 3D geometry; links to publications, code, or relevant project work, if available

Please note: If your degrees (Master's and Bachelor's degree or equivalent) were obtained abroad, you must always submit the original version along with a translation into English or German by a certified translator, bearing an official seal, as a single combined document. Documents originally issued in English do not require a translation.

If you are shortlisted, you will be invited for an interview.

For more information on the application process and admission requirements see .
For more information on the TV-L E13 payscale see .

Please note: Travel expenses and any other costs related to the application process cannot be reimbursed.


Questions?

For any scientific inquiries, please contact Prof. Yuki Asano ().

For general questions, please reach out to .