MAIA

Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)

Leipzig, Germany full-time Mid Salary not listed
full-time Mid level Technology & IT Curated
Sign in to apply Free account — we bring you straight back to this role.

About the role

MAIA macht das Wissen von Unternehmen im Arbeitsalltag nutzbar. Unsere KI-Plattform verbindet komplexe Dokumente, Unternehmenswissen und agentische Workflows, damit Menschen verlässliche Antworten finden und anspruchsvolle Aufgaben effizienter erledigen können. Ausgehend von unseren Kunden in der Industrie entwickeln wir MAIA für eine breitere Zielgruppe weiter.

Mit dem Produkt wachsen die Anforderungen an unsere Infrastruktur. Neue KI-Funktionen, mehr Kunden und ein größeres Engineering-Team brauchen eine Plattform, auf deren Zuverlässigkeit, Sicherheit und Performance sie sich verlassen können.

Als unser erster dedizierter Senior DevOps / Platform Engineer übernimmst du die technische Verantwortung für Infrastruktur und Betrieb. Du entwickelst eine bestehende Plattform weiter und gestaltest ihre Architektur, Automatisierung und Betriebsstandards.

Das ist eine hands-on Senior-Rolle ohne Personalverantwortung. Du bist zunächst die einzige dedizierte Person im Bereich und arbeitest eng mit Engineering und Geschäftsführung zusammen. Wenn du Infrastruktur bisher in einem kleinen Team mitverantwortet hast und jetzt einen eigenen Bereich gestalten möchtest, ist das ein passender nächster Schritt.

Aufgaben

Du entwickelst unsere Infrastruktur für den nächsten Wachstumsschritt weiter. Du betreibst selbst administrierte Linux-Systeme auf europäischen VMs und dedizierten Servern und integrierst Dienste von AWS, Azure und GCP. Dazu gehören Docker Compose, Netzwerke, Reverse Proxies und API Gateways.

Du machst Änderungen sicher und reproduzierbar. Du entwickelst Infrastructure as Code, CI/CD und Deployment-Workflows weiter. Automatisierte Prüfungen, nachvollziehbare Konfigurationen und erprobte Rollbacks schaffen Vertrauen in jeden Release.

Du verantwortest PostgreSQL im produktiven Betrieb. Du analysierst Performance, optimierst Connection Pooling und Kapazitäten und stellst durch getestete Backup- und Restore-Verfahren sicher, dass wir Daten zuverlässig wiederherstellen können.

Du machst das Verhalten unserer Systeme verständlich. Du entwickelst unseren selbst betriebenen Observability-Stack weiter, verbindest Metriken, Logs und Traces und etablierst Alerting, das konkrete Handlungen ermöglicht.

Du verankerst Sicherheit im Betrieb. Du setzt Least Privilege, Secrets Management, Vulnerability Scanning und Patch Management konsequent um. Für unser laufendes ISO-27001-Vorhaben implementierst du technische Maßnahmen und automatisierst prüfbare Nachweise.

Du gestaltest unsere AI Infrastructure. Du bewertest Inferenzanbieter und Betriebsmodelle anhand von Latenz, Durchsatz, Kosten und Zuverlässigkeit. Perspektivisch erschließt du bei Bedarf eigenes LLM-Serving auf GPU-Infrastruktur. Europäische, souveräne Betriebsoptionen sind dabei ein Teil unserer zukünftigen Strategie.

Du verbesserst den Betrieb für das gesamte Team. Du automatisierst wiederkehrende Aufgaben, dokumentierst Betriebsabläufe und untersuchst Störungen systematisch. Erkenntnisse fließen in dauerhafte Verbesserungen ein.

Deine ersten Schwerpunkte legen wir gemeinsam anhand des bestehenden Systems fest. Entscheidend ist, dass du Risiken fundiert bewertest, Prioritäten setzt und Verbesserungen bis in den laufenden Betrieb bringst.

Qualifikation

Deine technische Grundlage

Du hast mehrere Jahre produktive SaaS-Systeme auf selbst administrierten Linux-Servern betrieben. Erfahrung ausschließlich mit vollständig gemanagten Cloud-Diensten reicht für diese Rolle nicht aus.

Du beherrschst Docker und Docker Compose in Produktion und hast mit Reverse Proxies oder API Gateways wie Traefik oder Kong gearbeitet.

Du bringst praktische PostgreSQL-Betriebserfahrung mit. Backups und Restores hast du selbst eingerichtet und getestet. Performance-Analyse und Connection Pooling sind dir vertraut.

Du hast Infrastruktur mit Terraform oder vergleichbaren Werkzeugen verwaltet und CI/CD-Pipelines mit GitHub Actions oder ähnlichen Systemen entwickelt.

Du hast einen Observability-Stack selbst betrieben, beispielsweise mit Grafana, Loki und Prometheus.

Du kennst die Sicherheitsgrundlagen für produktive Systeme und setzt sie im Alltag um, von Berechtigungen und Secrets bis zu Sicherheitsupdates.

Du verstehst die Grundlagen von RAG-Systemen und typische Fehlerquellen im Betrieb. Bei LLM-Serving kannst du Zielkonflikte zwischen Latenz, Durchsatz, Kosten und Betriebsaufwand einordnen.

Du verfolgst die Entwicklung von KI-Modellen und Anbietern aus eigenem Interesse und kannst ihre Eignung für konkrete Anforderungen kritisch bewerten.

Du kommunizierst sehr sicher auf Englisch, unserer Teamsprache. Deutschkenntnisse sind ein Plus.

Wie du arbeitest

Du verbindest Eigenständigkeit mit sorgfältigem Engineering. Du untersuchst unbekannte Systeme, bis du die relevanten Zusammenhänge verstehst, begründest Architekturentscheidungen und prüfst Änderungen vor dem produktiven Einsatz.

Du hältst Komplexität beherrschbar und legst Wert auf Wartbarkeit, Dokumentation und Automatisierung. Du priorisierst nach Risiko und Wirkung, holst gezielt Input ein und kommunizierst auch bei Störungen ruhig und klar. Technische Zusammenhänge kannst du Menschen ohne technischen Hintergrund verständlich erklären.

KI-Werkzeuge setzt du produktiv und reflektiert ein. Die Verantwortung für technische Entscheidungen und ausgelieferte Änderungen bleibt bei dir.

Zusätzlich hilfreich

Hetzner, NixOS oder self-hosted Supabase.

Technische Maßnahmen und Nachweise für ISO 27001.

SRE-Praktiken wie SLOs, Error Budgets und Incident Reviews.

GPU-Betrieb und LLM-Serving, beispielsweise mit vLLM.

Erfahrung im produktiven GPU- oder Inferenzbetrieb ist keine Voraussetzung. Deine Stärke liegt im Plattformbetrieb. Den AI-Infrastructure-Schwerpunkt kannst du bei uns gezielt ausbauen.

Benefits

Ein eigener technischer Verantwortungsbereich, in dem du Architektur, Betriebsqualität und die Arbeitsfähigkeit unseres Engineering-Teams unmittelbar beeinflusst.

Ein gut finanziertes, wachsendes KI-Startup mit anspruchsvollen Aufgaben und kurzen Entscheidungswegen.

Enge Zusammenarbeit mit Engineering und Geschäftsführung und die Möglichkeit, technische Standards langfristig zu prägen.

Die Gelegenheit, deine Erfahrung mit AI Infrastructure und dem Betrieb von LLM-Workloads zu vertiefen.

75.000 bis 85.000 € Jahresbruttogehalt plus VSOP-Beteiligung.

Eine unbefristete Vollzeitstelle mit flexiblen Arbeitszeiten.

Ein hybrides Arbeitsmodell mit mindestens drei gemeinsamen Bürotagen pro Woche in Leipzig. An den übrigen Tagen kannst du mobil arbeiten.

Zugang zu einer WellPass-Mitgliedschaft.

Unterstützung beim Umzug nach Leipzig, deren Umfang wir individuell mit dir besprechen.

Wir suchen jemanden, der Freude daran hat, Systeme zu verstehen, ihre Qualität zu verbessern und Verantwortung für ihren langfristigen Betrieb zu übernehmen.

Schick uns deinen Lebenslauf und ein paar kurze, selbst geschriebene Sätze: Welches produktive System hast du mitverantwortet, welche technische Verbesserung hast du vorangetrieben und warum möchtest du diesen Bereich bei MAIA gestalten?

Wir erhalten viele KI-generierte Bewerbungen, die wenig über die Person dahinter verraten. Für diesen kurzen Text interessieren uns deine eigenen Gedanken und Erfahrungen. Bitte verzichte dafür auf ein KI-generiertes Anschreiben.

Unser Prozess besteht aus einem Kennenlernen mit 30 Minuten, einem technischen Interview mit 90 Minuten und einem Abschlussgespräch mit der Geschäftsführung. Wir entscheiden zügig und halten dich bei jedem Schritt auf dem Laufenden.

Start ist zum nächstmöglichen Zeitpunkt. Wir freuen uns darauf, dich kennenzulernen.

Find Jobs in Germany on Arbeitnow

Interview prep

Walk in with sharper answers.

Use this as a quick practice sheet before you speak with the employer.

Mid
Technology & IT API integration MySQL Senior Devops Platform Mid level

Likely questions

  1. Tell us about work you have done that is close to the Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d) role.
  2. How would you approach your first 30 days at MAIA?
  3. Which of API integration, MySQL and Senior have you used recently, and what did it help you achieve?
  4. Describe a time you solved a problem without waiting to be told exactly what to do.
  5. How do you handle busy days, changing priorities, or pressure at work?

Prepare before the call

  • A recent example that proves your experience with API integration, MySQL and Senior.
  • One short story with a problem, your action, and the result.
  • Two examples that show the strengths listed on your CV.
  • A clear reason why this role and company interest you.
  • Your availability, preferred work style, and salary expectations.

Ask them

  • What would success look like in the first 90 days?
  • What are the main problems this hire should help solve?
  • How does the team give feedback and measure good work?
  • What does a normal working week look like for this role?
Practice line

I am interested in the Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d) role because I can bring practical experience in API integration, MySQL and Senior, learn the team quickly, and contribute to the outcomes MAIA needs from this hire.

Related jobs.

More roles from this company or category.