Staff Site Reliability Engineer

🔥 vor 2 Stunden

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of Wand AI

Wand AI

51 - 200 Mitarbeiter

Gegründet 2022

🤖 Künstliche Intelligenz

🏢 Unternehmen

☁️ SaaS

Artificial Intelligence • Enterprise • SaaS

Wand AI ist ein Unternehmen für Unternehmenssoftware (Wand Synthesis AI Inc. ), das die "Agentic Labor Infrastructure" entwickelt, um Regierungen und großen Unternehmen zu ermöglichen, hybride Arbeitskräfte zu schaffen, zu verwalten und zu skalieren, die aus Menschen und autonomen KI-Agenten bestehen. Ihre Plattform (markiert als Wand OS / Agentic Workforce Technology) bietet Management, Überwachung, Interoperabilität zwischen Systemen, Sicherheitsoptionen (SOC2-bereit, lokal/Private Cloud/gehostet), Dashboards, Entscheidungstracking und Werkzeuge zur Bereitstellung und Steuerung agentischer Arbeitsabläufe in großem Maßstab. Wand positioniert sich als B2B-/Unternehmensanbieter, der KI in operatives Arbeitsleben für regulierte und groß angelegte Organisationen verwandelt.

Beschreibung

• Architektur, Bereitstellung und Betrieb skalierbarer, sicherer Produktionsumgebungen (bevorzugt AWS). • Führung von Zuverlässigkeitsverbesserungen über mehrere Engineering-Streams hinweg. • Design und Weiterentwicklung Kubernetes-basierter Infrastruktur, einschließlich Migrations- und Optimierungsinitiativen. • Aufbau und Durchsetzung robuster Infrastructure-as-Code-Standards. • Definition und Operationalisierung von SLIs, SLOs und Error Budgets. • Ausbau der Observability für Anwendungen, Infrastruktur, Datenpipelines und ML-Systeme. • Enge Zusammenarbeit mit Produkt- und Datenteams, um Modellanalysen und Produkttelemetrie in Zuverlässigkeits-Insights zu integrieren. • Optimierung der gesamten CI/CD-Pipeline, vom Build über Deploy bis zum Rollback. • Verbesserung der Release-Sicherheit, Erhöhung der Deployment-Frequenz und Steigerung der Vorhersehbarkeit von SLAs. • Leitung der Incident Response bei komplexen, systemübergreifenden Ausfällen und Durchführung von Postmortems. • Reduzierung operativer Routinearbeiten durch Automatisierung und Plattformengineering-Verbesserungen. • Entwicklung von Prozessen und Tools zur Aufnahme, Standardisierung und Fehlerbehebung in Kundenumgebungen. • Unterstützung und Produktionsreife von ML-Workloads (MLOps-Praktiken einschließlich Model Deployment, Monitoring und Retraining-Workflows). • Sicherstellung, dass die Infrastruktur den unternehmensweiten Sicherheits- und regulatorischen Anforderungen entspricht. • Mentoring von Ingenieur:innen und Anhebung des allgemeinen Zuverlässigkeitsniveaus in den Teams.

🎯 Anforderungen

• Umfangreiche praktische Erfahrung in SRE- oder Production-Engineering-Rollen. • Nachweisbare Erfahrung beim Aufbau oder der Skalierung von SRE-Praktiken in wachstumsstarken oder komplexen Umgebungen. • Tiefgehende Expertise in cloudbasierter Infrastruktur auf AWS oder Azure. • Fundierte Erfahrung mit Kubernetes (einschließlich Migration, Skalierung und Production-Hardening). • Fortgeschrittene Kenntnisse in Infrastructure-as-Code (z. B. Terraform oder vergleichbar). • Erfahrung im Design und in der Optimierung von End-to-End CI/CD-Pipelines. • Umfangreiche Erfahrung mit Observability-Tools für verteilte Systeme. • Erfahrung in der Fehlerbehebung komplexer Multi-Tenant- oder kundengehosteter Umgebungen. • Erfahrung in der Unterstützung produktiver Datenplattformen und ML-Systeme. • MLOps-Erfahrung, einschließlich Model Deployment und Monitoring. • Gutes Verständnis verteilter Systeme, Skalierbarkeit und Fehlertoleranz. • Systemisches Denkvermögen und Verständnis der Wechselwirkungen zwischen Infrastruktur, Produkt, Daten und ML. • Hervorragende Kommunikationsfähigkeiten und die Fähigkeit, funktionsübergreifend zu arbeiten.

🏖️ Vorteile

• Krankenversicherung • Bezahlter Urlaub • Möglichkeiten zur beruflichen Weiterbildung

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Monaten

Replit

51 - 200

🤖 Künstliche Intelligenz

🤝 B2B

Werden Sie Teil von Replit als leitender Site Reliability Engineer und verbessern Sie die Performance und Zuverlässigkeit unserer Infrastruktur. Arbeiten Sie bereichsübergreifend an skalierbaren Lösungen und betreuen Sie Ingenieurinnen und Ingenieure.

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 5 Monaten

Thrill

11 - 50

🎮 Gaming

🥽 AR/VR

Infrastructure/DevOps Engineer, verantwortlich für die Verwaltung von AWS und Kubernetes bei Thrill Labs. Arbeit an hochskalierbaren Projekten und der Verbesserung von Sicherheitsmaßnahmen in einem schnell wachsenden Tech-Startup.

🇪🇺 Europa – Remote

⏰ Vollzeit

🟠 Senior

🔴 Experte

⛑ DevOps- und Site Reliability Engineer (SRE)

🗣️🇺🇸🇬🇧 Englisch erforderlich