Site Reliability Engineer

🕒 Novembro 11, 2025

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $115.000 - $135.000 / ano

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Aalyria

Aalyria

51 - 200 funcionários

📡 Telecomunicações

🏢 Corporativo

☁️ SaaS

Telecommunications • Enterprise • SaaS

A Aalyria é uma empresa de tecnologia espacial e de comunicações que cria, organiza e gerencia redes em escala planetária, combinando comunicações a laser em espaço livre atmosférico coerente (Tightbeam) com uma plataforma de orquestração de rede impulsionada por IA (Spacetime). A empresa possibilita conectividade multidomínio e multi-órbita através de terra, mar, ar e espaço — apoiando constelações de satélites, arquiteturas 5G/NTN e redes híbridas — e trabalha com parceiros comerciais e governamentais para implantar hardware e software para comunicações resilientes e de alta capacidade.

Descrição

• Help design and build Aalyria's centralized observability platform, integrating and scaling tools for metrics (e.g. Prometheus), logging (e.g. Loki), and distributed tracing (e.g. Tempo/OpenTelemetry). • Define, implement, and manage a robust framework of Service Level Objectives (SLOs), Service Level Indicators (SLIs), and error budgets for our core products, ensuring we are launch-ready. • Partner with SWEs to implement observability best practices, develop standard templates and documentation, and configure tooling (e.g., OpenTelemetry libraries). • Automate the deployment, scaling, and management of the entire observability stack using Infrastructure as Code (e.g. Terraform) and GitOps principles (e.g. ArgoCD). • Partner closely with the core infrastructure team to ensure deep visibility into our Kubernetes clusters and underlying GCP and AWS environments. • Develop and lead the company's monitoring, alerting, and incident response strategy, driving a culture of proactive reliability and blameless post-mortems.

🎯 Requisitos

• 4+ years of experience in an SRE or platform engineering role, with a focus on observability for large-scale, distributed compute or network systems. • Deep, hands-on expertise building, scaling, and managing observability platforms (e.g., Prometheus, Grafana, Loki/ELK, OpenTelemetry, Tempo/Jaeger, Honeycomb, etc.). • Proven experience using these tools to support performance analysis and debugging of complex distributed systems. • Strong production-level experience with Google Cloud Platform (GCP) and Kubernetes. • Experience using Infrastructure as Code (IaC) and GitOps principles (e.g., ArgoCD). • Proficiency in a systems programming language, with a strong preference for Go and Python for debugging and writing tooling. • Demonstrable experience defining, implementing, and managing SLOs, SLIs, and error budgets for production services for high availability distributed systems.

🏖️ Benefícios

• Innovative Environment: Work at a cutting-edge company shaping the future of aerospace communications. • Impactful Work: Directly contribute to critical national security programs and initiatives. • Growth Opportunities: Expand your career with opportunities for professional development and advancement. • Inclusive Culture: Be part of a collaborative, supportive, and inclusive workplace where your contributions matter. • Flexibility: Flexible working arrangements including hybrid remote/in-office schedules. • Competitive salary, comprehensive benefits (401(k), dental, vision, health, life insurance), paid time off, and equity options.

Candidatar-se

Vagas Similares

🕒 Novembro 9, 2025

AGENTIC

11 - 50

💼 Consultoria

🏥 Saúde

🏭 Manufatura

Senior DevOps Engineer / Cloud Architect designing multi-account architectures for Apex program. Mastering AWS and full-stack development with a focus on cloud-native solutions.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Novembro 6, 2025

Stormlight Capital

1 - 10

💸 Finanças

💳 Fintech

DevOps Engineer at Stormlight Capital optimizing infrastructure for derivatives trading operations. Ensuring systems process market data and execute trades at high performance.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $225.000 - $325.000 / ano

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Novembro 5, 2025

CloudScouts

11 - 50

💼 Consultoria

📣 Marketing

💸 Finanças

AWS DevOps Engineer designing cloud-native applications for SAP S/4HANA processes. Optimizing AWS cost/performance in fully remote work environment.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

🔴 Especialista

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Outubro 29, 2025

Hydra Host

11 - 50

🔧 Hardware

🏢 Corporativo

🤖 Inteligência Artificial

Site Reliability Engineer ensuring high uptime and performance for cloud systems at Hydra Host. Collaborating with teams to integrate monitoring and QA tools for reliability and observability.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $140.000 - $200.000 / ano

💰 $10.000.000 Seed Round em 2022-04

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Outubro 24, 2025

AbacusNext

201 - 500

⚖️ Jurídico

💼 Consultoria

☁️ SaaS

DevOps Engineer designing and implementing automation processes at CARET, enhancing efficiency for legal and accounting firms. Collaborates with different teams leveraging cloud technologies for optimal service delivery.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $90.000 - $110.000 / ano

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório