Site Reliability Engineer

Job not on LinkedIn

🔥 12 hours ago

🇨🇷 Costa Rica – Remote

⏰ Full Time

🟡 Mid-level

🟠 Senior

⛑ DevOps & Site Reliability Engineer (SRE)

👻 Ghost score 10%

infoinfo

🗣️🇪🇸 Spanish Required

Apply Now
Find Similar Remote Jobs

📊 Check your resume score for this job

Improve your chances of getting an interview by checking your resume score before you apply.

Logo of EX Squared

EX Squared

501 - 1000 employees

Founded 2000

💼 Consulting

🤖 Artificial Intelligence

🤝 B2B

Consulting • Artificial Intelligence • B2B

EX Squared is a digital product and experience consultancy that helps enterprises move AI and digital initiatives from ambition into production. Since 2001 the firm has delivered strategy, UX/UI and multi-channel digital experiences plus engineering and IT infrastructure work, and specializes in GenAI, machine learning, computer vision, and NLP. EX Squared is a certified Optimizely and Sitecore partner and focuses on building enterprise-scale digital products and advanced AI-driven solutions for large B2B clients.

📋 Description

• Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos. • Implementar y evolucionar prácticas de observabilidad utilizando métricas, logs y trazas. • Definir y mantener SLIs y SLOs con equipos de desarrollo y stakeholders del negocio. • Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios. • Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas. • Promover el modelo “you build it, you run it”. • Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD. • Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración. • Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios. • Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering. • Trabajar cercanamente con equipos de desarrollo y plataforma.

🎯 Requirements

• Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations. • Experiencia hands-on trabajando con servicios críticos y ambientes productivos. • Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones. • Experiencia con plataformas de cloud computing. • Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento. • Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis. • Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad. • Experiencia con automatización y scripting. • Conocimiento de CI/CD y procesos modernos de deployment. • Experiencia con Infrastructure as Code, idealmente Terraform. • Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad. • Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones. • Deseable experiencia con AWS y arquitecturas cloud-native. • Deseable experiencia con Terraform y automatización de infraestructura. • Deseable experiencia con Docker y Kubernetes. • Deseable conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes. • Deseable experiencia trabajando con estrategias de High Availability y Disaster Recovery. • Deseable experiencia en análisis de capacidad, performance y escalabilidad. • Deseable experiencia participando en esquemas de on-call y gestión de incidentes críticos. • Deseables certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.

🏖️ Benefits

• Seguro médico privado. • Asociación solidarista. • Vacaciones y feriados de acuerdo con la legislación de Costa Rica. • Oportunidades de aprendizaje y crecimiento profesional. • Participación en proyectos tecnológicos de alto impacto.

Apply Now

Similar Jobs

🕒 September 15

GFT Technologies

10,000+ employees

💼 Consulting

🛡️ Insurance

🔒 Cybersecurity

Ingeniero DevOps senior desarrollando y automatizando despliegues para Oracle Banking Collections en GFT Technologies. Gestionando CI/CD, ambientes, releases y soporte productivo remoto.

🗣️🇪🇸 Spanish Required

Docker

Java

Jenkins

Kubernetes

Linux

Oracle

Spring

Spring Boot

SpringBoot

Terraform

🕒 August 31

Commit

501 - 1000

🔒 Cybersecurity

DevOps Engineer modernizing AWS infrastructure and production support. Migrating the company’s AWS codebase to GitHub Actions and standardizing CI/CD automation.

AWS

Docker

EC2

Python

Terraform

🕒 July 30

GFT Technologies

10,000+ employees

💼 Consulting

🛡️ Insurance

🔒 Cybersecurity

DevOps & Platform Engineer focused on pipeline creation and migration to GitLab in the Alternative Asset Management industry. Collaborating with teams to deliver infrastructure solutions and automate cloud-related tasks.

🗣️🇪🇸 Spanish Required

AWS

Cloud

Docker

DynamoDB

EC2

Jenkins

Kubernetes

Linux

Python

Terraform

🕒 July 21

CSC Generation

1001 - 5000

🛒 Retail

🛍️ eCommerce

🤖 Artificial Intelligence

Site Reliability Engineer ensuring reliability, performance, and scalability across Backcountry's multi-cloud platform. Collaborating with engineering teams to improve systems and support features.

🇨🇷 Costa Rica – Remote

💰 Venture Round on 2019-01

⏰ Full Time

🟡 Mid-level

🟠 Senior

⛑ DevOps & Site Reliability Engineer (SRE)

Ansible

AWS

Azure

Cloud

DNS

Google Cloud Platform

Grafana

JavaScript

Kubernetes

Linux

Node.js

Prometheus

Python

Terraform

TypeScript

🕒 July 9

Akamai Technologies

5001 - 10000

🔒 Cybersecurity

Site Reliability Engineer II creating solutions to improve automation and efficiency for systems. Optimizing workflows and collaborating on deployment and monitoring within Akamai's Compute products.

🇨🇷 Costa Rica – Remote

💵 ₡16.9M - ₡30.5M / year

💰 Post-IPO Equity on 2001-07

⏰ Full Time

🟢 Junior

🟡 Mid-level

⛑ DevOps & Site Reliability Engineer (SRE)

Ansible

Distributed Systems

Grafana

Kubernetes

Linux

Prometheus

Python

SaltStack

Terraform

Unix

Go