Site Reliability Engineer – US Central/Eastern Time

Vaga não está no LinkedIn

🕒 4 dias atrás

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of PostHog

PostHog

11 - 50 funcionários

Fundada em 2020

💼 Consultoria

📣 Marketing

📦 Logística

Consulting • Marketing • Logistics

PostHog é uma plataforma completa que capacita desenvolvedores a construir produtos bem-sucedidos, fornecendo ferramentas para análises de produto, análises web, replay de sessões, feature flags, experimentos e pesquisas. Ela se integra perfeitamente aos fluxos de trabalho existentes, oferecendo soluções de pipelines de dados e armazenamento que sincronizam com plataformas populares como Stripe, Hubspot, Zendesk, e mais. Com o PostHog, as equipes podem lançar novas funcionalidades com segurança, realizar experimentos com significância estatística e obter insights aprofundados com produtos de IA e LLM. A plataforma é construída com acesso total à API, permitindo controle completo sobre os dados dos clientes. O PostHog escala com empresas desde startups até fases de crescimento, tornando-se uma ferramenta versátil para equipes de engenharia que buscam otimizar suas operações de dados enquanto focam no desenvolvimento de produtos.

Descrição

• Turn a fast-growing, stateful system into a predictable, well-automated platform through provisioning, scaling, rebalancing, and recovery • Operate EKS clusters across several environments using Karpenter autoscaling, Cilium networking, and ArgoCD-driven GitOps deployments • Manage and evolve a multi-AWS-account organization, including provisioning, networking, access control, and cross-account connectivity • Maintain the Terraform/Terragrunt infrastructure-as-code platform, including modules, plan-on-PR/apply-on-merge pipelines, and safe shared-infrastructure patterns • Improve operational tooling for deployments, schema changes, backups, restores, and incident response • Identify recurring operational pain points and eliminate them through code and self-healing automation • Optimize cloud spend • Participate in on-call and incident response while reducing incident frequency over time • Design and automate the platform layer supporting the organization’s services

🎯 Requisitos

• Deep hands-on experience with Kubernetes in production; EKS preferred • Experience debugging node pressure, networking issues, and deployment failures at scale, including thousands of nodes • Strong experience operating production infrastructure on AWS across multiple accounts • Understanding of AWS organizational boundaries, IAM, and inter-account networking • Experience automating infrastructure with Terraform or Terragrunt at scale, including module design and state management • Solid understanding of Linux systems, including disk, memory, networking, and failure modes • Experience supporting stateful systems such as databases, queues, and storage systems • Ability to debug and reason about production performance and reliability issues • Comfortable owning systems end-to-end, including on-call responsibilities • US Central or Eastern timezone

🏖️ Benefícios

• Remote work arrangement • Meeting-free days on Tuesdays and Thursdays • Heads-down building time prioritized over perfect coordination • Async communication by default • Fair and accessible interview process with accommodations or adjustments available

Candidatar-se

Vagas Similares

🕒 5 dias atrás

ArangoDB

51 - 200

🏥 Saúde

📦 Logística

💼 Consultoria

Site Reliability Engineer scaling Arango’s cloud-native contextual AI data platform. Automating Kubernetes, AWS, and Google Cloud infrastructure with Golang, observability, and resilient production operations.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 5 dias atrás

CampMinder

51 - 200

💼 Consultoria

🏥 Saúde

🏨 Hospitalidade

Senior DevSecOps Engineer securing Campminder’s software for summer camps. Hardening cloud infrastructure, embedding security in CI/CD, and leading compliance and threat-remediation work.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $180.000 - $200.000 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 5 dias atrás

MeridianLink

501 - 1000

💳 Fintech

🏦 Bancário

☁️ SaaS

Senior SRE owning reliability, observability, and scalability for MeridianLink’s financial SaaS applications. Designing resilient AWS/Azure infrastructure, automation, incident response, and security practices.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $104.148 - $177.600 / ano

💰 $485.000.000 Post-IPO Debt em 2021-11

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🦅 Patrocina Visto H1B

info

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 5 dias atrás

eFinancial

201 - 500

🏥 Saúde

💼 Consultoria

🛡️ Seguros

DevOps Team Lead building AWS infrastructure, CI/CD pipelines, and shared engineering platforms for a life insurance provider. Coaching engineers and improving deployment reliability and automation.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 5 dias atrás

NEC Software Solutions

5001 - 10000

🏥 Saúde

💼 Consultoria

📦 Logística

Senior DevOps Engineer managing AWS cloud infrastructure, Kubernetes, Terraform, and CI/CD for NEC SWS public-sector systems. Hybrid role requiring 50% office attendance and SC eligibility.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório