Senior Site Reliability Engineer

🔥 vor 51 Minuten

🇪🇺 Europa – Remote

⏰ Vollzeit

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

👻 Geisterscore 12%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Parasail

Parasail

11 - 50 Mitarbeiter

Gegründet 2023

☁️ SaaS

💰 €10.000.000 Seed im 2025-05

SaaS

Parasail ist eine Cloud-Plattform, die Inference-Infrastruktur für AI-native Start-ups bereitstellt. Der Fokus liegt auf dem produktiven Betrieb von Open-Source- und spezialisierten Modellen. Parasail bietet ein globales Netzwerk von Rechenzentren mit aktueller Hardware, optimierte Endpoints und eine einheitliche API für die Bereitstellung beliebiger Modelle – einschließlich Fine-Tunes und Hugging-Face-Modellen. Zu den Vorteilen zählen hohe Zuverlässigkeit und Performance, flexible Skalierbarkeit, Kosteneffizienz (bis zu 30× günstiger als ältere Cloud-Plattformen), Zugriff auf Frontier-Modelle ab Tag 0, verlustfreie Standardeinstellungen, individuell anpassbare Kompromisse zwischen Geschwindigkeit und Qualität, flexible Abrechnung nach tatsächlicher Nutzung sowie dedizierter Engineering-Support mit kurzen Reaktionszeiten. Kund:innen nutzen Parasail für High-Throughput-Inference, Batch Processing und die produktive Bereitstellung von LLMs und multimodalen Modellen – etwa für Vision, Voice, OCR, Reranking und Retrieval.

Beschreibung

• Aufbau und Weiterentwicklung der Kubernetes-Infrastruktur für Bereitstellung, Networking, Storage und Service-Deployment über verschiedene Provider und Regionen hinweg • Entwicklung von Isolations-, Failover- und Wiederherstellungsmechanismen, um die Auswirkungen von Hardware- und Infrastrukturausfällen zu reduzieren • Automatisierung von Kapazitätserweiterungen, Deployments und Wartungsarbeiten • Entwicklung von Observability- und Diagnosefunktionen, um Engpässe sichtbar zu machen und Ausfälle frühzeitig zu erkennen • Reaktion auf Incidents, Ermittlung der Ursachen und Verbesserung der Systeme auf Grundlage der gewonnenen Erkenntnisse • Verbesserung von Plattformleistung, Auslastung, Sicherheit und Zuverlässigkeit bei wachsendem Bedarf an Inferenz • Direkte Zusammenarbeit mit Infrastructure-, Platform- und Inference Engineers in einer Organisation mit flachen Hierarchien

🎯 Anforderungen

• Erfahrung im Aufbau und Betrieb von Produktionsinfrastrukturen oder verteilten Systemen mit echter Verantwortung für deren Zuverlässigkeit • Sehr gute Linux-Grundlagen • Praktische Kenntnisse in den Bereichen Networking, Storage und Container • Praktische Erfahrung im Betrieb von Kubernetes in Produktionsumgebungen • Fähigkeit, wartbare Software und Automatisierungslösungen zur Behebung von Infrastrukturproblemen zu entwickeln • Systematisches Vorgehen bei der Fehlersuche über die Grenzen von Anwendung, Cluster, Netzwerk und Hardware hinweg • Gutes Urteilsvermögen hinsichtlich der Frage, wann schnelles Handeln, Vereinfachung und die Priorisierung von Zuverlässigkeit angebracht sind • Eigeninitiative, um Probleme von der Untersuchung bis zur Implementierung zu bearbeiten, sowie Freude an der Zusammenarbeit im Team • Von Vorteil: Erfahrung mit Multi-Region-, Multi-Provider- oder Bare-Metal-Infrastrukturen • Von Vorteil: Kenntnisse in den Bereichen GPUs, Model Serving, vLLM oder SGLang • Von Vorteil: Erfahrung mit Infrastructure as Code, CI/CD, Observability oder automatisierter Wiederherstellung • Von Vorteil: Erfahrung im Aufbau hochverfügbarer Services, mandantenfähiger Plattformen oder verteilter Datensysteme

🏖️ Vorteile

• Verantwortung und Gestaltungsspielraum, um die Skalierung der globalen Inference Cloud von Parasail mitzugestalten • Maßgeblicher Einfluss auf Architekturentscheidungen und direkte Wirkung in der Produktionsumgebung • Enge Zusammenarbeit mit Hardware, tiefgehende Arbeit an verteilten Systemen und Austausch mit Inference Engineers • Möglichkeit, die Grundlage für die nächste Entwicklungsstufe der AI-Infrastruktur mit aufzubauen

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 15 Tagen

MEDvidi

201 - 500

🏥 Gesundheitswesen

⚕️ Krankenversicherung

Senior-/Staff-DevOps-Engineer mit Verantwortung für AWS, Kubernetes, Sicherheit und Zuverlässigkeit der KI-gestützten Plattform für psychische Gesundheit MEDvidi. Entwicklung der Infrastrukturstrategie sowie Verantwortung für Observability, CI/CD und Developer Experience in einem vollständig remote arbeitenden, europaweit verteilten Team.

🇪🇺 Europa – Remote

💰 €2.800.000 Seed Round im 2022-09

⏰ Vollzeit

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇷🇺 Russisch erforderlich

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 19 Tagen

Bet On Talent

1 - 10

💼 Beratung

📣 Marketing

🎯 Rekrutierung

Senior DevOps Engineer zur Skalierung der AWS- und Cloudflare-Infrastruktur für eine B2B-Plattform in Echtzeit mit Echtgeldbezug. Verantwortung für Terraform, CI/CD, Observability, Security und Cloud-Architektur.

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

Lisk

11 - 50

₿ Crypto

🌐 Web 3

💳 Fintech

DevOps Engineer, verantwortlich für die AWS-Infrastruktur der FinTech-Plattform von Lisk. Weiterentwicklung der Cloud-Infrastruktur sowie Gewährleistung von Sicherheit und Zuverlässigkeit in einer Remote-first-Umgebung.

🇪🇺 Europa – Remote

💰 Seed im 2024-02

⏰ Vollzeit

🟠 Senior

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

Bet On Talent

1 - 10

💼 Beratung

📣 Marketing

🎯 Rekrutierung

Senior DevSecOps Engineer, verantwortlich für die Implementierung und Unterstützung technologischer Lösungen. Aufbau von CI/CD-Pipelines und Monitoring-Systemen in einem vollständig remote arbeitenden Umfeld, überwiegend aus Europa.

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

JobLeads

51 - 200

🎯 Rekrutierung

👥 HR Tech

Senior DevOps Engineer, der Infrastruktur optimiert und eine weltweite Nutzerbasis unterstützt. Zusammenarbeit mit einem internationalen Remote-Team zur Verbesserung von Deployment-Prozessen und Performance in einer technologieintensiven Umgebung.

🗣️🇺🇸🇬🇧 Englisch erforderlich