AI-Infrastruktur- und Plattform-Operations Engineer (remote in der EU)

🕒 vor 28 Tagen

🇪🇺 Europa – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🏗️ Plattformingenieur

👻 Geisterscore 17%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Mirantis

Mirantis

501 - 1000 Mitarbeiter

💼 Beratung

🏥 Gesundheitswesen

📦 Logistik

Consulting • Healthcare • Logistics

Mirantis ist ein Unternehmen, das sich auf Container-Management und Cloud-Infrastrukturlösungen spezialisiert hat. Das Portfolio umfasst unter anderem Mirantis Kubernetes Engine (MKE), Mirantis OpenStack for Kubernetes (MOSK) und Mirantis Container Cloud (MCC) – Plattformen für Kubernetes und Container-Management auf Enterprise-Niveau. Darüber hinaus entwickelt Mirantis Werkzeuge für sichere Software-Lieferketten, etwa die Mirantis Container Runtime (MCR) und die Mirantis Secure Registry (MSR). Als Verfechter von Open-Source-Technologien unterstützt Mirantis verschiedene Projekte und stellt Ressourcen wie Lens Desktop, eine beliebte Kubernetes-IDE, sowie technischen Support für Unternehmen bereit, die Cloud-native Technologien einführen. Die Lösungen von Mirantis richten sich an Bereiche wie den öffentlichen Sektor, Finanzdienstleistungen sowie SaaS- und Technologiedienstleistungen.

Beschreibung

• Überwachen, betreiben und unterstützen von produktiven AI-Infrastruktur-Plattformen. • Untersuchen und Beheben von Vorfällen im Zusammenhang mit Infrastruktur, Netzwerk, Hardware und Plattform. • Unterstützung der NVIDIA-GPU-Infrastruktur und zugehöriger Plattformdienste. • Überwachen und Fehlerbehebung in Kubernetes-basierten Umgebungen. • Analyse von Leistungs-, Verfügbarkeits- und Zuverlässigkeitsproblemen über Infrastruktur- und Plattformkomponenten hinweg. • Zusammenarbeit mit Engineering-Teams, Hardware-Anbietern, Rechenzentrums-Personal und Service-Delivery-Teams zur Lösung technischer Probleme. • Teilnahme an Incident-Response, Root-Cause-Analysen und Maßnahmen zur Verbesserung des operativen Betriebs. • Mitwirkung an Verbesserungen in Monitoring, Observability, Automatisierung und operationalen Prozessen. • Pflege von Betriebsdokumentation, Runbooks und Knowledge-Artikeln.

🎯 Anforderungen

• Mindestens 3 Jahre Erfahrung in Infrastructure Operations, Platform Operations, Network Operations, Site Reliability Engineering, Cloud Operations, Rechenzentrumsbetrieb oder vergleichbaren technischen Rollen. • Starke Kenntnisse in Linux-Administration und Fehlerbehebung. • Gute Kenntnisse von Netzwerkgrundlagen und Erfahrung in der Diagnose infrastruktureller Probleme. • Erfahrung mit Kubernetes in produktiven Umgebungen. • Erfahrung in der Betreuung produktiver Infrastruktur und Services. • Ausgeprägte analytische und problemlösende Fähigkeiten. • Erfahrung mit strukturierten Betriebs- und Incident-Management-Prozessen. • Hervorragende Kommunikations- und Teamfähigkeiten. • Fähigkeit zur Arbeit in einem schichtbasierten Betriebsumfeld. • Erfahrung in einem oder mehreren der folgenden Bereiche ist sehr wünschenswert: • NVIDIA-GPU-Infrastruktur und beschleunigte Computing-Plattformen. • InfiniBand-Netzwerke und NVIDIA UFM. • Kubernetes-Plattformbetrieb. • AI-Infrastruktur- oder HPC-Umgebungen. • Site Reliability Engineering (SRE) oder Platform Engineering. • Observability-Plattformen wie Grafana, Prometheus, ELK oder OpenTelemetry. • Infrastruktur-Automatisierungstechnologien und Infrastructure-as-Code-Praktiken. • Großskalige verteilte Systeme und produktive Plattformen.

🏖️ Vorteile

• Arbeit an einigen der fortschrittlichsten produktiven AI-Infrastrukturen heute. • Einblicke in NVIDIA-GPU-Technologien, Kubernetes-Plattformen und Hochleistungsnetzwerke. • Mitgestaltung, wie die nächste Generation von AI-Infrastruktur betrieben und unterstützt wird. • Teil eines Teams sein, das die Zukunft von KI-gestütztem Betrieb durch k0rdent AI mitgestaltet. • Beitritt zu einer wachsenden Organisation, die stark in AI-Infrastruktur und Plattform-Services investiert.

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 1 Monat

Sourcegraph

51 - 200

🤖 Künstliche Intelligenz

☁️ SaaS

🏢 Unternehmen

Software Engineer, verantwortlich für die Entwicklung von Inter-Cloud-Konnektivitätslösungen und den Aufbau von API-Infrastruktur für die Sourcegraph Cloud. Zusammenarbeit im Team bei komplexen technischen Problemen und Bereitstellung zuverlässiger Services in einer Remote-Arbeitsumgebung.

🇪🇺 Europa – Remote

💵 $148.000 / Jahr

💰 €150.000.000 Series D im 2021-07

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🏗️ Plattformingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 1 Monat

Spacelift

51 - 200

☁️ SaaS

🏢 Unternehmen

Platform Engineer verantwortlich für Aufbau und Betrieb der Infrastruktur-Orchestrierungsplattform von Spacelift. Umfasst CI/CD, Observability, Incident Response und Verbesserung der Developer Experience.

🇪🇺 Europa – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

🏗️ Plattformingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 3 Monaten

saas.group

51 - 200

💼 Beratung

📣 Marketing

☁️ SaaS

Senior Platform Engineer für ScraperAPI, verantwortlich für das Management und die Konsolidierung der Infrastruktur für leistungsstarke Web-Scraping-Lösungen. Zusammenarbeit mit Engineering-Teams zur Umsetzung wesentlicher Verbesserungen der Plattform.

🇪🇺 Europa – Remote

⏰ Vollzeit

🟠 Senior

🏗️ Plattformingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 5 Monaten

Polar

1 - 10

💳 Fintech

☁️ SaaS

🔌 API

Senior Plattformingenieur, der die Polar-Plattform für hochdynamische Start-ups entwirft und weiterentwickelt. Konzeption von Systemen mit Schwerpunkt auf Zuverlässigkeit und Skalierbarkeit in finanziellen Workflows über verschiedene technische Ebenen hinweg.

🇪🇺 Europa – Remote

⏰ Vollzeit

🟠 Senior

🏗️ Plattformingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 8 Monaten

Alpaca

201 - 500

🔌 API

💳 Fintech

₿ Crypto

Senior Software Engineer zur Entwicklung und Wartung gemeinsamer Services für die Brokerage‑Plattform von Alpaca. Schwerpunkt auf Event-Streaming-Infrastruktur, Authentifizierung und teamübergreifender Zusammenarbeit.

🇪🇺 Europa – Remote

⏰ Vollzeit

🟠 Senior

🏗️ Plattformingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich