Senior Site Reliability Engineer (m/w/d)

🔥 vor 2 Stunden

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Flip

Flip

51 - 200 Mitarbeiter

Gegründet 2018

👥 HR Tech

☁️ SaaS

🤖 Künstliche Intelligenz

HR Tech • SaaS • Artificial Intelligence

Flip ist die KI-Plattform für das Mitarbeitererlebnis von Frontline- und Deskless-Mitarbeitern. Die Plattform vereint interne Kommunikation, HR-Self-Service (Gehaltsabrechnungen, Urlaub, Onboarding), ein KI-natives Intranet, KI-gestützte Workflows und Identitätsmanagement für Frontline-Mitarbeiter in einer einzigen, mobil optimierten App, die auf jedem Gerät funktioniert – auch auf gemeinsam genutzten Telefonen ohne Firmen-E-Mail. Flip enthält eine KI-Schicht (Flip Intelligence / Ask AI), einen App-Builder und Integrationen mit bestehenden Tools (SharePoint, Teams, HR-Systeme) und richtet sich an Branchen mit großen, nicht-schreibtischgebundenen Arbeitskräften. Zu den Kunden zählen Ben & Jerry's, Bosch, KFC und PENNY, was den Einsatz im Einzelhandel, in der Gastronomie, in der Fertigung und in der Logistik demonstriert.

Beschreibung

• Mitverantwortung für die Architektur: Treiben Sie die Architektur und Weiterentwicklung unserer Cloud-Infrastruktur auf Azure und unserer Kubernetes-Cluster voran – ausgelegt für hohen Durchsatz und maximale Verfügbarkeit – zur Unterstützung von Flips schnellem Wachstum weltweit. • Resilienz-Strategie vorantreiben: Definieren Sie unser Vorgehen für globales Scaling, Zero-Downtime-Deployments, Rollback-Mechanismen und Disaster Recovery und stellen Sie sicher, dass die Plattform rund um die Uhr verfügbar bleibt. • Weiterentwicklung unseres Observability-Stacks: Verbessern Sie unseren LGTM-Stack (Loki, Grafana, Tempo, Mimir) zu einer verlässlichen Grundlage, auf die sich unsere Engineers verlassen können. • Unsere IaC-Plattform verbessern: Beseitigen Sie wiederkehrende, mühsame Aufgaben an der Quelle und machen Sie unsere Infrastruktur für Engineering-Teams wirklich self-service. • Führung bei Incidents: Übernehmen Sie die Verantwortung bei größeren plattformbezogenen Incidents, führen Sie blameless Post‑Mortems im Squad durch und leiten Sie Erkenntnisse in systemische Verbesserungen über. • Mentoring im Squad: Coachen Sie Teamkollegen, führen Sie RFCs und Design-Reviews im Team durch und unterstützen Sie Engineers dabei, sich zu stärkeren SREs zu entwickeln. • Roadmap mitgestalten: Arbeiten Sie mit Ihrem Squad zusammen, um die strategische Ausrichtung der Plattform zu definieren.

🎯 Anforderungen

• Mindestens 5 Jahre praktische Erfahrung als Site Reliability Engineer (SRE), Platform Engineer, DevOps Engineer, Infrastructure Engineer, Cloud Engineer oder Backend Engineer mit starkem Infrastruktur-Fokus. • Nachgewiesene Erfolge beim Aufbau und Betrieb produktiver Systeme mit hohem Durchsatz und hoher Verfügbarkeit. • Tiefgehende, produktive Erfahrung mit Kubernetes auf einem beliebigen Hyperscaler. • Umfangreiche Erfahrung mit modernen Observability-Stacks (z. B. Prometheus, Mimir, VictoriaMetrics, Dash0, Loki, ELK) und eine klare Haltung zu SLIs, SLOs und Error Budgets. • Solide Software-Entwicklungskenntnisse in Go (stark bevorzugt, da unsere IaC mit Pulumi in Go umgesetzt ist) oder Python. • Praktische Erfahrung mit Infrastructure as Code (Pulumi, OpenTofu, Terraform) sowie GitOps (z. B. ArgoCD) und im Design von CI/CD-Pipelines. • Nachgewiesene Fähigkeit, komplexe Infrastruktur-Initiativen vom Design bis zur Produktion zu führen – einschließlich dem Verfassen von RFCs und dem Treffen von Architekturentscheidungen im Team. • Erfahrung im Mentoring von Engineers und darin, die technische Messlatte innerhalb eines Teams anzuheben. • Routiniert darin, größere Incidents von Anfang bis Ende zu verantworten und Erkenntnisse in nachhaltige, systemische Veränderungen zu überführen. • Ausgeprägte Kommunikationsfähigkeiten und geschäftssicheres Englisch. • Bereitschaft zur Teilnahme an On‑Call-Rotationen, um die Zuverlässigkeit unserer Plattform sicherzustellen.

🏖️ Vorteile

• Arbeitsmodus: Wir sind remote-first und bieten Ihnen die Flexibilität, von zu Hause zu arbeiten. Gleichzeitig schätzen wir die Kraft persönlicher Zusammenarbeit sehr. Je nach Rolle nehmen Sie an gelegentlichen Team-Events, Workshops oder Meetings in unseren Büros in Berlin oder Stuttgart teil – stets mit ausreichender Vorankündigung. Das genaue Gleichgewicht wird im Vorstellungsgespräch besprochen. • Work-Life-Balance: Wir möchten nicht, dass Sie an Ihren Bürostuhl verwurzeln. Deshalb übernehmen wir die Kosten für Ihre E‑Gym‑Wellpass-Mitgliedschaft und bieten Dienstradleasing an. • Erfolge feiern: Erwarten Sie hochmotivierte und engagierte Kolleginnen und Kollegen in einer entspannten Arbeitsatmosphäre. • Teil von etwas Größerem sein: Sie gestalten Flip in Ihrer Rolle aktiv mit. Dabei sind Sie ein Enabler des schnellen Wachstumsprozesses eines jungen Tech-Unternehmens und entwickeln sich zielgerichtet weiter – Spaß inklusive. • Happy to be a Flipster: Freuen Sie sich auf regelmäßige Team-Events und Culture Days, die uns als Flipsters zusammenbringen. • Arbeiten im Ausland: Bei Flip können Sie auch innerhalb der Europäischen Union im Ausland arbeiten. Sprechen Sie im Interview mit uns über Remote‑Arbeit.

Jetzt Bewerben

Ähnliche Jobs

🔥 vor 5 Stunden

Qdrant

51 - 200

🤖 Künstliche Intelligenz

☁️ SaaS

Senior Software Engineer, der cloud-native Infrastruktur bei Qdrant entwickelt und betreibt. Entwurf, Aufbau und Optimierung von Lösungen für KI-getriebene Anwendungen in globalen Teams.

🗣️🇺🇸🇬🇧 Englisch erforderlich

🔥 vor 16 Stunden

Codesphere

51 - 200

☁️ SaaS

🏢 Unternehmen

🏛️ Regierung

Site Reliability Engineer bei Codesphere, verantwortlich für die Zuverlässigkeit und Effizienz der Cloud‑Infrastruktur. Enge Zusammenarbeit mit Entwicklungsteams und Betreuung produktiver Systeme zur Sicherstellung kontinuierlicher Auslieferung.

🇩🇪 Deutschland – Remote

💰 €30.900.000 Series A - Codesphere im 2024-05

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich

🔥 vor 19 Stunden

SimScale

51 - 200

☁️ SaaS

🤝 B2B

🤖 Künstliche Intelligenz

Senior SRE / Platform Engineer bei SimScale, verantwortlich für die Verwaltung und Verbesserung der Cloud-Infrastruktur. Schwerpunkt auf AWS, EKS, Observability, Disaster Recovery und Sicherheitskontrollen.

🇩🇪 Deutschland – Remote

💰 €29.205.915 Series C - SimScale im 2021-10

⏰ Vollzeit

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich

🔥 vor 20 Stunden

mittwald

51 - 200

🤝 B2B

☁️ SaaS

Senior DevOps Engineer zur Entwicklung und Verwaltung einer Kubernetes-basierten Hosting-Plattform bei Mittwald. Sicherstellung von Systemstabilität, Performance und Skalierbarkeit sowie fundierte technologische Entscheidungsfindung.

🔥 vor 20 Stunden

mobilistics GmbH

11 - 50

🤝 B2B

☁️ SaaS

🤖 Künstliche Intelligenz

DevOps Engineer mit Spezialisierung auf Design und Betrieb von Kubernetes-Clustern. Remote-Arbeit in einem dynamischen Team in cloud-nativen Technologieumgebungen.

🇩🇪 Deutschland – Remote

💵 €55.000 - €75.000 / Jahr

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)