Senior Site Reliability Engineer

🕒 Agosto 27

🇪🇸 Espanha – Remoto

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 12%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Lodgify

Lodgify

51 - 200 funcionários

💼 Consultoria

📣 Marketing

📦 Logística

💰 $30.000.000 Series B em 2022-11

Consulting • Marketing • Logistics

A Lodgify é uma empresa de software abrangente de gestão de aluguel por temporada que ajuda proprietários e administradores de imóveis a otimizar suas operações. Oferece recursos como sistema de reservas, caixa de entrada unificada, gestão de hóspedes, gestão de tarefas, automações, relatórios e analytics, e demonstrativos para proprietários. A Lodgify oferece integrações com as principais plataformas de reserva, como Airbnb, Booking. com, Vrbo e Expedia, disponibilizando um channel manager para sincronizar calendários, tarifas e reservas. Também permite criar sites personalizados com um booking widget, com suporte a plataformas como WordPress, Squarespace, Wix e outras. Com ferramentas adicionais como dynamic pricing, um mobile app e automações com AI, a Lodgify busca aumentar a produtividade e aprimorar a experiência dos hóspedes para negócios de aluguel de curta duração. A empresa oferece onboarding gratuito, suporte personalizado e uma variedade de recursos para garantir uma transição tranquila para a plataforma, atendendo anfitriões individuais, administradores de imóveis e diversos tipos de acomodações.

Descrição

• Define meaningful SLIs, SLOs, and reliability targets for the platform. • Collaborate with software engineering teams on observability, SLIs, SLOs, and reliability best practices. • Improve production readiness through service ownership, observability, alerting, runbooks, scaling assumptions, rollback paths, and failure-mode preparedness. • Improve reliability, scalability, and performance of cloud, Kubernetes, and shared infrastructure. • Build actionable observability using metrics, logs, traces, and golden signals with Datadog, Prometheus, and Grafana. • Implement operational and security best practices through guidelines, policies, and automation. • Reduce alert noise and improve signal quality. • Automate repetitive operational work using Python or other languages. • Implement self-service Internal Developer Platform features via APIs and Kubernetes operators. • Improve deployment safety, rollbackability, and release observability. • Improve reliability of critical stateful systems such as databases, caches, queues, and streaming platforms. • Participate in on-call, troubleshoot, coordinate incident response, and facilitate blameless post-incident reviews. • Execute disaster recovery drills and analyze cloud/platform usage for cost and resource-efficiency gains. • Strengthen observability, reduce operational toil, improve incident response, define SRE standards, and help teams own their systems in production.

🎯 Requisitos

• 7+ years of production experience operating Kubernetes-based platforms and cloud infrastructure. • Understanding and application of SRE practices, including SLIs, SLOs, error budgets, production readiness, incident response, post-incident learning, toil reduction, scalability, capacity planning, high availability, backups, and disaster recovery. • Ability to design and improve observability and alerting for critical systems using metrics, logs, traces, and golden signals. • Experience troubleshooting complex distributed systems. • Ability to write maintainable software to automate operational tasks and reduce manual intervention. • Experience with stateful production systems such as relational databases, caches, queues, or streaming platforms. • Ability to balance reliability, performance, cost, and delivery speed pragmatically. • Comfort working in a transitional environment where SRE practices are being introduced. • Effective collaboration with Engineering, Platform, Security, and Product stakeholders. • Clear communication, strong documentation, and interest in coaching teams toward stronger production ownership. • Initiative and accountability, including raising risks early and driving improvements through completion. • All applications and CVs must be submitted in English.

🏖️ Benefícios

• Remote Flexibility: The freedom to work from home any day that works for you. • 25 working days of paid vacation • Jornada Intensiva in August • Premium health, dental, and mental health support via Alan; pre-existing conditions are covered. • €150/month meal allowance on your Alan card • 50% off Ametller Origen prepared dishes at the office • Flexible Remuneration for extra meal costs (up to €70/mo) and public transport (up to €136/mo) • Table, ergonomic chair, and monitor for home setup • Free Spanish classes • Cash rewards for employee referrals • Daily office breakfast • Monthly team events • Inclusive, international work environment

Candidatar-se

Vagas Similares

🕒 Agosto 21

Akamai Technologies

5001 - 10000

🔒 Cibersegurança

DevSecOps Engineer securing Akamai’s cloud-edge platform through CI/CD automation, container orchestration, and infrastructure as code. Building scalable storage solutions for enterprises.

🇪🇸 Espanha – Remoto

💰 Post-IPO Equity em 2001-07

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 18

ArangoDB

51 - 200

🏥 Saúde

📦 Logística

💼 Consultoria

Site Reliability Engineer maintaining Kubernetes and cloud infrastructure for Arango’s contextual AI data platform. Automating operations, observability, deployments, and reliability across distributed database systems.

🇪🇸 Espanha – Remoto

💰 $27.800.000 Series B em 2021-10

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 18

HostPapa

51 - 200

💼 Consultoria

📦 Logística

📣 Marketing

Site Reliability Engineer improving CloudBlue’s multi-tenant SaaS reliability, scalability, and observability. Operating Kubernetes platforms, leading incident response, and strengthening cloud infrastructure for service providers worldwide.

🇪🇸 Espanha – Remoto

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 17

Mirantis

501 - 1000

💼 Consultoria

🏥 Saúde

📦 Logística

Senior SRE deploying and operating Kubernetes-based AI infrastructure on NVIDIA-certified hardware for Mirantis, a cloud-native infrastructure company. Improving reliability, security, scalability, and automation.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 14

Devoteam

5001 - 10000

💼 Consultoria

🏥 Saúde

📣 Marketing

Data AWS DevSecOps professional evolving secure cloud data platforms for Devoteam’s large-organization clients. Advising teams on architecture, security, governance and observability in a remote Spain-based role.

🇪🇸 Espanha – Remoto

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório