
AI Inference Engineer (all genders)
AI first
Moderner Tech-Stack
Als AI Inference Engineer baust du die technische Grundlage für produktive AI-Systeme in regulierten Umgebungen. Du entwickelst und betreibst LLM-Inferenzplattformen, die on-premises oder in privaten Cloud-Umgebungen laufen – sicher, skalierbar, beobachtbar und wirtschaftlich.
Du sorgst dafür, dass moderne Modelle nicht nur in einer Demo überzeugen, sondern unter realen Produktionsbedingungen zuverlässig funktionieren: mit sauberer GPU-Planung, niedriger Latenz, kontrollierten Kosten, belastbarem Monitoring und klar definierten Betriebsmodellen.
Was erwartet dich
- Du konzipierst, entwickelst und betreibst produktive LLM-Inferenzplattformen für Kunden mit hohen Anforderungen an Datensouveränität, Sicherheit und Betriebskontrolle – on-premises, in privaten Cloud-Umgebungen oder souveränen europäischen Cloud-Setups.
- Gemeinsam mit Cloud-, Plattform-, Security- und Data-Engineering-Teams sowie unseren Kunden überführst du AI-Use-Cases in den produktiven Betrieb.
- Dabei integrierst du moderne Inferenz-Engines und Open-Weights-Modelle in Kubernetes-, Container- und Plattformumgebungen.
- Außerdem planst und optimierst du GPU- und Speicherressourcen sowie Inferenz-Workloads: Von Modellgrößen, Quantisierung und Batching bis hin zu KV-Cache-Strategien, Latenz, Durchsatz und Kosten.
- Du verantwortest die Runtime produktiver AI-Systeme, inklusive Modellserving, APIs, Authentifizierung, Secrets, Observability, Logging
- Aus Kundenprojekten entwickelst du wiederverwendbare Referenzarchitekturen, Deployment-Templates und Betriebs-Playbooks und stärkst so unsere Applied-AI-Capability.
Was erwarten wir von dir
- Persönlicher Background: Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps, LLMOps, DevOps, Backend Engineering oder Machine Learning Engineering. Entscheidend ist deine Erfahrung im Aufbau und Betrieb produktiver Systeme und dein Antrieb zu schneller persönlicher Weiterentwicklung
- Inference Engineering: Du verstehst die technischen und wirtschaftlichen Zusammenhänge moderner LLM-Inferenz, von Model-Serving und GPU-Auslastung über Quantisierung, Batching und KV-Cache-Management bis hin zu Latenz, Durchsatz und Kosten.
- Cloud & Plattformen: Docker, Kubernetes, Helm, Terraform, CI/CD, Linux sowie Observability gehören für dich zum Arbeitsalltag.
- AI-Verständnis: Du kannst Transformer-basierte Modelle wie LLMs und Embeddings einordnen und fundierte technische Entscheidungen für produktive AI-Systeme treffen.
- Security & Governance: Themen wie Identitäten, Berechtigungen, Secrets, Logging, Auditierung und Compliance denkst du, insbesondere in regulierten Umgebungen, von Anfang an mit.
- Kommunikation & Arbeitsweise: Du vermittelst komplexe technische Zusammenhänge verständlich, arbeitest pragmatisch und bewegst dich auch in dynamischen Projektumfeldern sicher.
- Pluspunkt: Erfahrung mit vLLM, SGLang oder vergleichbaren Inference-Technologien, GPU-Clustern, souveränen Cloud- oder Private-Cloud-Umgebungen.
- On the road: Du bist reisebereit und flexibel, unsere Kunden bundesweit vor Ort zu beraten.
- Let's talk: Du sprichst fließend Deutsch und Englisch - super, dann findest du dich bei Exxeta bestens zurecht
Warum Exxeta
Bei Exxeta entwickeln wir digitale Lösungen, die wirklich etwas verändern – in Unternehmen, Märkten und Köpfen. Über 1200 Kolleg:innen bringen dafür Technologie, Ideen und unterschiedliche Perspektiven zusammen. Was uns antreibt: Neugier, Teamspirit und der Anspruch, echten Impact zu schaffen. Hightech with a heartbeat eben.
Wir sind ein Zuhause für Menschen, die etwas bewegen wollen. Diversität und unterschiedliche Perspektiven bereichern unser Team. Haltung, Ideen und Lust aufs Machen - das zählt bei uns!
Bewirb dich jetzt!
Unsere Bonus Features
Lifelong Learning
Versicherung inklusive
Immer mobil
An apple a day …
Flexibles Arbeiten
Ob Büro, Remote oder bei Kunden vor Ort? Deine Arbeitsweise gestaltet sich nach Kundenbedarf und Projektanforderung
Einfach mal weg?
Unvergessliche Events
Gut ausgestattet
Bei uns arbeitest du mit moderner Hardware. Extra Hardware leasen? Kein Problem
Komm ins Team!

1. Der Papierkam
Ganz ohne geht es leider nicht – aber gerne digital. Schreib uns, wir melden uns spätestens nach zwei Wochen bei dir.

2. Let's talk
Es geht doch nichts über ein persönliches Gespräch. Je nachdem, wie es dir passt: bei uns im Office oder per Video.

3. Challenge accepted
Wir verstehen uns – super! In einigen Bereichen haben wir noch eine kleine Challenge für dich. Sei gespannt.

4. Butter bei die Fische
Let’s talk, die Zweite. Aber diesmal Business. Konkret: Welche Tasks und Zahlen stehen in deinem Vertrag?

5. Welcome on board!
Bienvenidos, hartelijk welkom – schön, dass du da bist. Direkt ans Onboarding oder erstmal einen Welcome-Drink?

Mit Mercedes-Benz zum Connected Car
Mit den Mercedes me connect Features zur neuen User Experience





FAQ
Was sind die ersten Schritte, um mich zu bewerben?
Bei unseren Stellenangeboten ist ein Job dabei, der dir gefällt? Top! Lade jetzt alle wichtigen Dokumente hoch. Unser Recruiting-Team schaut dann, ob es auch von unserer Seite ein Match werden könnte. Im Anschluss melden wir uns innerhalb von zwei Wochen bei dir. Wenn es passt, vereinbaren wir ein virtuelles oder persönliches Gespräch mit dem Fachbereich, in dem du später arbeiten würdest. Schließlich müsst vor allem ihr auf einer Wellenlänge sein.
Welche Unterlagen benötigt ihr von mir?
Wer ist bei dem persönlichen Gespräch dabei und wie läuft es ab?
Das hängt ein wenig von der Position und dem Standort ab. Normalerweise nimmt jemand aus dem jeweiligen Fachbereich und aus dem Recruiting teil. In einigen Fällen sind auch mehrere Fachbereiche dabei. Keine Sorge, es soll kein knüppelhartes Assessment-Center werden. Bei unserem Gespräch geht es vor allem um ein entspanntes gegenseitiges Kennenlernen. Wir möchten etwas über dich als Mensch erfahren – und dir gleichzeitig die Möglichkeit geben, Exxeta besser kennenzulernen. Wir legen einfach viel Wert auf ein harmonisches und offenes Miteinander, schließlich werden wir viel Zeit miteinander verbringen. Nach unserem Gespräch sind wir uns dann hoffentlich beide sicher, dass es zwischen uns passt.
