Senior Site Reliability Engineer (SRE)

🕒 vor 1 Monat

🏢🏡 Berlin – Hybrid

⏰ Vollzeit

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

👻 Geisterscore 22%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of 1GLOBAL

1GLOBAL

WebsiteLinkedIn

501 - 1000 Mitarbeiter

💼 Beratung

📦 Logistik

📣 Marketing

Consulting • Logistics • Marketing

WIR HABEN ES UNS ZUR AUFGABE GEMACHT, DIE WELT NAHTLOS ZU VERBINDEN. Deshalb haben wir uns zum Ziel gesetzt, mehr Verbindungen als jeder andere zu ermöglichen, und deshalb sind wir von Anfang an Vorreiter der eSIM-Revolution gewesen. Von internationalen Unternehmen und Verbrauchern über IoT-Gerätehersteller bis hin zu Telekommunikationsanbietern - unsere globalen Netzwerke und Konnektivitätslösungen ermöglichen es Menschen, Geräten und Netzwerken, sich überall und sofort zu verbinden, mit einer Plattform, die Milliarden verbindet. Mit Hauptsitz in Großbritannien und Büros auf vier Kontinenten haben wir über 550 Millionen Pfund investiert, um unser einzigartiges Angebot aufzubauen und zu einem der weltweit führenden Innovatoren im Bereich eSIM, Cloud und digitale Lösungen zu werden. Dadurch sind wir zu einem führenden Technologieunternehmen und eSIM-Pionier geworden, dem Tausende internationaler Unternehmen in Hunderten von Ländern vertrauen, darunter globale Marken, führende Netzwerkanbieter sowie Banken und Finanzinstitute. Ein wirklich globales Netzwerk. Ein globaler Anbieter. Eine vollständige Lösung, die die Welt der Konnektivität revolutioniert und Menschen, Geräte und Netzwerke nahtlos auf der ganzen Welt verbindet. Denn wir glauben, dass, je besser die Welt kommuniziert, desto besser ist die Welt.

Beschreibung

• Als leitender technischer Beitragender im SRE‑Team fungieren, Kolleg:innen mentorieren und die technische Messlatte für Reliability Engineering setzen. • SLIs und SLOs für Kerninfrastruktur und kundenorientierte Dienste definieren, messen und pflegen. • Redundanz‑ und Resilienztests über Service‑, Infrastruktur‑ und Netzwerkschichten planen und durchführen — Failover, Hochverfügbarkeitskonfigurationen (HA) und Disaster‑Recovery‑Bereitschaft validieren. • Automatisierte Wiederherstellungsmechanismen, Self‑Healing‑Workflows und intelligente Alerting‑Systeme entwerfen und implementieren. • Incident‑Response, Root‑Cause‑Analysen und "blameless" Post‑Mortems steuern sowie die Umsetzung und Nachverfolgung der daraus abgeleiteten Korrektur‑ und Präventivmaßnahmen sicherstellen, um eine kontinuierliche Verbesserung zu erreichen. • Observability (Metriken, Logs, Traces) mit Prometheus, Grafana, Loki und OpenTelemetry entwickeln und ausbauen. • Mit Infrastruktur‑ und DevOps‑Teams zusammenarbeiten, um Deployment‑Sicherheit, Rollback‑Richtlinien und Konfigurationskonsistenz zu gewährleisten. • Schwachstellen proaktiv durch Fault‑Injection, Lasttests und Chaos‑Testing identifizieren. • Operativen Aufwand (Toil) kontinuierlich durch Automatisierung und Reliability‑Tools reduzieren. • Zur On‑Call‑Praxis beitragen: Alert‑Qualität, Runbooks, Eskalationsverfahren und Incident‑Management‑Prozesse verbessern. • Kapazitätsplanung, Performance‑Benchmarks und Resilienz‑Audits über Systeme hinweg durchführen. • Sicherstellen der Einhaltung von Sicherheits‑, Zuverlässigkeits‑ und Verfügbarkeitsstandards. • Interne Dokumentation, Playbooks und Betriebsrichtlinien für Kolleg:innen und Nutzer:innen erstellen und pflegen. • Zu Initiativen zur Cloud‑Kostenoptimierung beitragen, einschließlich Planung reservierter Kapazitäten, Auslegung von Autoscaling, Storage‑Tiering, Right‑Sizing von Workloads und kontinuierlicher Anomalieerkennung.

🎯 Anforderungen

• Mindestens 5 Jahre Erfahrung im Site Reliability-, System‑ oder Infrastruktur‑Engineering (davon mindestens 2 Jahre in einer dedizierten SRE‑Rolle). • Fundierte Kenntnisse im Linux‑Systemengineering, in verteilten Systemen und in Netzwerktechnologien. • Nachgewiesene Erfahrung im Aufbau und Betrieb hochverfügbarer, geschäftskritischer Produktionssysteme. • Praktische Erfahrung mit Redundanz‑ und Failover‑Tests, Disaster Recovery und Validierung von Hochverfügbarkeitsarchitekturen. • Tiefes Verständnis von Monitoring‑, Observability‑ und Incident‑Management‑Prinzipien. • Erfahrung mit Prometheus, Grafana, Loki, Thanos und OpenTelemetry oder ähnlichen Tools. • Sehr gute Kenntnisse in Python, Go und Bash für Automatisierung und Entwicklung von Reliability‑Tools. • Gute Kenntnisse in Kubernetes, Container‑Orchestrierung und Service‑Mesh‑Architekturen. • Erfahrung mit AWS (EKS, EC2, VPC) und der Integration von On‑Premises‑Infrastruktur. • Sicherer Umgang mit Infrastructure‑as‑Code‑Tools wie Terraform. • Verständnis der Netzwerkgrundlagen (Routing, Load Balancing, BGP, DNS, VXLAN etc.). • Ausgeprägte analytische Fähigkeiten und Problemlösungskompetenz; belastbar auch unter Druck. • Starke Kommunikations‑ und Kooperationsfähigkeiten in verteilten, bereichsübergreifenden Teams.

🏖️ Vorteile

• Entwicklungsmöglichkeiten: Gestalten Sie Ihre Karriere in einem der am schnellsten wachsenden Telekommunikationsunternehmen, das jährlich um über 100 % wächst und von erfolgreichen Tech‑Entrepreneuren geführt wird. • Direkter Einfluss bei bedeutenden Transaktionen: Seien Sie aktiv beteiligt an Geschäften, die die Zukunft der Telco‑Branche prägen werden. • Arbeit in einem talentierten Team: Sie arbeiten täglich mit Vorstand, Gründern und dem Senior Management sowie mit renommierten externen Berater:innen zusammen und sind ständig von talentierten, engagierten Menschen umgeben. • Dynamisches Arbeitsumfeld: Entfalten Sie sich in einem kollaborativen, schnelllebigen Umfeld, in dem Innovation gefördert wird und jeder Beitrag zählt. • Professionelle Weiterentwicklung: Arbeiten Sie mit Branchenexpert:innen zusammen, um Ihre Fähigkeiten in einem zukunftsweisenden Bereich zu erweitern. • Internationale Erfahrung: Möglichkeiten, im Zuge Ihres Wachstums im Unternehmen in verschiedenen 1GLOBAL‑Standorten weltweit zu arbeiten. • Offene Kommunikationskultur: Werden Sie Teil eines Teams, in dem Ihre Ideen gehört werden und offener Dialog gefördert wird, was ein unterstützendes und transparentes Arbeitsumfeld schafft. • Hands‑on‑Mentalität: Arbeiten Sie in einem ergebnisorientierten Team, das Effizienz, Kreativität und den Willen, greifbare Auswirkungen in der Branche zu erzielen, schätzt.

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Monaten

PROMOS consult

201 - 500

💼 Beratung

📦 Logistik

🏥 Gesundheitswesen

WebsiteLinkedIn

DevOps Engineer, verantwortlich für das Schaffen optimaler Voraussetzungen für moderne Softwareentwicklung. Automatisierung von Build-, Test- und Deployment-Prozessen sowie enge Zusammenarbeit mit Entwicklungs- und Infrastrukturteams.

🏢🏡 Berlin – Hybrid

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

Kittl

11 - 50

📣 Marketing

💼 Beratung

📦 Logistik

WebsiteLinkedIn

Senior DevOps Engineer im Platform-Team von Kittl, verantwortlich für die Verwaltung der Kubernetes-Infrastruktur und die Verbesserung von CI/CD-Pipelines. Zusammenarbeit mit verschiedenen Teams zur Steigerung der betrieblichen Exzellenz in einem KI-getriebenen Umfeld.

🏢🏡 Berlin – Hybrid

💰 Series A im 2023-01

⏰ Vollzeit

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 5 Monaten

Alexander Thamm [at]

201 - 500

🤖 Künstliche Intelligenz

💼 Beratung

WebsiteLinkedIn

(Senior) DevOps Engineer, spezialisiert auf Implementierung und Management von ML‑Lösungen in Deutschland. Fokus auf CI/CD‑Pipelines, Automatisierung und Cloud‑Services.

🕒 vor 5 Monaten

Stackmeister

11 - 50

💼 Beratung

📣 Marketing

☁️ SaaS

WebsiteLinkedIn

DevOps Engineer verantwortlich für die Implementierung von Software-Integrations- und Cloud-Architekturen. Umfasst Continuous-Delivery- und Deployment-Prozesse mit Technologien wie AWS, Azure und Kubernetes.

🏢🏡 Berlin – Hybrid

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 7 Monaten

M2. technology & project consulting GmbH

11 - 50

💼 Beratung

📦 Logistik

🏢 Unternehmen

WebsiteLinkedIn

DevOps Engineer mit Fokus auf Kundenanforderungen und Cloud-Architekturen. Beteiligt an Migrationen und Beratung zu komplexen Dateninfrastrukturen.

🏢🏡 Berlin – Hybrid

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)