Senior Site Reliability Engineer – SRE

🕒 Agosto 4

🇪🇸 Espanha – Remoto

💵 €70.000 - €115.000 / ano

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 2%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of QAD

QAD

1001 - 5000 funcionários

Fundada em 1979

🏭 Manufatura

📦 Logística

🍽️ Alimentos e Bebidas

Manufacturing • Logistics • Food & Beverage

A QAD é uma empresa especializada em soluções de planejamento de recursos empresariais e transformação industrial. Sua plataforma Adaptive Enterprise ajuda as empresas a otimizar processos, alinhar pessoas com tecnologia e gerenciar desafios empresariais críticos. As ofertas da QAD incluem software para manufatura, gestão de inventário, planejamento de cadeia de suprimentos, gestão da qualidade e conformidade com o comércio global. Suas soluções atendem uma variedade de indústrias, incluindo automotiva, produtos de consumo, alimentos e bebidas, manufatura industrial e mais. A empresa foca em se tornar uma empresa adaptável integrando agendamentos avançados e insights baseados em dados.

Descrição

• Design, implement, and maintain highly available, scalable, and resilient systems • Serve as a subject matter expert for observability, including monitoring, alerting, logging, tracing, dashboards, and synthetic testing • Develop maintainable software and self-service tooling to automate operational tasks and improve reliability • Identify and eliminate operational toil through automation, process improvements, and systematic problem solving • Lead incident response, participate in on-call rotations, and drive blameless post-mortems • Define, implement, and track SLIs, SLOs, and error budgets • Leverage infrastructure as code, GitOps practices, and CI/CD automation using Terraform, Flux, and GitHub Actions • Provide reliability expertise during system design reviews and influence architectural decisions • Document processes, build runbooks, and mentor engineers across the organisation • Use AI responsibly to accelerate investigations, improve documentation, reduce toil, and build intelligent operational workflows • Collaborate across infrastructure, applications, networking, identity, and observability domains • Drive meaningful follow-up actions and continuous reliability improvements

🎯 Requisitos

• Demonstrated experience operating and improving production systems at scale in an SRE, Production Engineering, or Platform Engineering role • Ability to build accurate mental models of complex distributed systems across infrastructure, applications, networking, identity, and observability • Strong troubleshooting skills and evidence-driven incident response and root cause analysis • Experience defining and using SLIs, SLOs, and error budgets • Excellent written and verbal communication skills • Experience with Kubernetes, including Amazon EKS, and service mesh technologies such as Istio • Experience with AWS cloud infrastructure and services • Experience with identity and access management systems, including Auth0 and AWS IAM • Knowledge of DNS, load balancing, routing, TLS, and connectivity troubleshooting • Experience with GitOps workflows and infrastructure automation using Flux and Terraform • Experience with observability platforms and practices, including metrics, logs, traces, alerting, dashboards, and synthetic monitoring • Experience with CI/CD systems and engineering workflows • Experience with application logging and distributed system debugging • Strong scripting and automation skills • Ability to build and maintain automation, tooling, and self-service capabilities using Python, Go, or Bash • Ability to remain calm and effective during high-severity incidents • Ability to manage complex situations involving multiple teams and competing priorities • Ability to lead blameless post-mortems and drive follow-up actions • Effective use and validation of AI assistants for troubleshooting, root cause analysis, and operational decision-making

🏖️ Benefícios

• Fully remote work • Opportunities for growth • Equal opportunity and inclusive work environment • Diversity, equity, and inclusion program • Human oversight, security, and governance when using AI

Candidatar-se

Vagas Similares

🕒 Julho 31

Exoscale

51 - 200

☁️ SaaS

🤖 Inteligência Artificial

Site Reliability Engineer at Exoscale focusing on maintaining and designing operating systems and hypervisor internals. Join a dynamic multicultural team to enhance product services across Europe.

🇪🇸 Espanha – Remoto

💰 Venture Round em 2015-02

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 30

Merlin Digital Partner

11 - 50

☁️ SaaS

⚡ Produtividade

🤝 B2B

Site Reliability Engineer ensuring maximum system availability and performance for a SaaS solutions provider in Spain. Collaborating to automate and monitor systems while ensuring best practices in reliability and security.

🇪🇸 Espanha – Remoto

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🗣️🇪🇸 Espanhol obrigatório

🕒 Julho 30

Exoscale

51 - 200

☁️ SaaS

🤖 Inteligência Artificial

Site Reliability Engineer responsible for designing, developing, and maintaining Exoscale’s core platform and security components. Working in a cutting-edge distributed team within the cloud technology industry.

🇪🇸 Espanha – Remoto

💰 Venture Round em 2015-02

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 28

Sysdig

201 - 500

🔒 Cibersegurança

🏢 Corporativo

Senior Customer Reliability Engineer at Sysdig providing technical support and expertise for cloud security. Collaborating with engineering teams to resolve customer issues and enhance security solutions.

🇪🇸 Espanha – Remoto

💰 $350.000.000 Series G em 2021-12

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🗣️🇫🇷 Francês obrigatório

🕒 Julho 28

Group-IB

501 - 1000

🔒 Cibersegurança

💼 Consultoria

☁️ SaaS

Senior DevOps Engineer optimizing infrastructure for Group-IB's cybersecurity technologies. Maintaining and developing high-availability systems and collaborating with global teams to enhance the service reliability.

🇪🇸 Espanha – Remoto

💰 Grant - Group-IB em 2020-07

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório