Senior Site Reliability Engineer

🕒 Julho 16

🇮🇳 Índia – Remoto

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 15%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Akamai Technologies

Akamai Technologies

5001 - 10000 funcionários

🔒 Cibersegurança

💰 Post-IPO Equity em 2001-07

Cloud Computing • Cybersecurity • Content Delivery

A Akamai Technologies é um provedor líder de serviços em nuvem especializado em oferecer soluções de segurança, computação em nuvem e entrega de conteúdo. A empresa oferece uma gama de serviços, como segurança de API, proteção contra DDoS e otimização de desempenho para aplicativos web, garantindo experiências de usuário seguras e confiáveis. Com uma infraestrutura global robusta, a Akamai capacita empresas a otimizar sua presença digital, protegendo contra diversas ameaças cibernéticas e melhorando o desempenho de aplicativos.

Descrição

• Leading complex reliability and performance investigations across Akamai's global edge, media delivery, and web delivery platforms. • Troubleshooting critical distributed systems issues spanning application, platform, network, and operating system layers, serving as the highest technical escalation point. • Partnering with Engineering, Product, Support, and Network teams to identify root causes and deliver scalable, long-term solutions that improve platform reliability. • Designing and improving observability through SLIs, SLOs, KPIs, telemetry, dashboards, and alerts to identify and address customer-impacting issues. • Analyzing platform performance, traffic patterns, and system bottlenecks to improve scalability, resilience, and overall service reliability. • Developing automation, internal tools, AI-assisted diagnostics, and self-service workflows to streamline operations, reduce manual effort, and accelerate incident response. • Enhancing operational excellence through reliability-centered architecture reviews, post-incident analysis, continuous improvements, and offering off-hours support during critical incidents as needed.

🎯 Requisitos

• Possess Bachelors in CS/Engineering or a related field with 6 years of industry experience in large-scale SRE/Systems Infrastructure roles. • Have logical reasoning skills diagnosing complex performance bottlenecks, data integrity anomalies, and system failure modes in distributed environments. • Have understanding of internet technologies and foundational networking concepts, including caching, proxies, TLS, TCP/IP, DNS, and HTTP/HTTPS architectures. • Have foundation in Linux/Unix administration, diagnostic tools, and low-level environment troubleshooting. • Be able to retrieve data, analyze telemetry streams, and troubleshoot platform data integrity issues through SQL queries. • Have experience developing automation tools using languages like Python, Bash, or Go. • Demonstrate expertise in AI models and focus on implementing agentic workflows to reduce operational inefficiencies effectively.

🏖️ Benefícios

• We support your health, well-being, finances, and life beyond work. See our benefits. • FlexBase adapts to your job's needs • Akamai's FlexBase program is yet another way we show our commitment to providing employees with an exceptional workplace experience. It's not about telling employees where to work; it's about supporting employees to do their best work.

Candidatar-se

Vagas Similares

🕒 Julho 13

MRSOOL | مرسول

201 - 500

🍽️ Alimentos e Bebidas

✈️ Turismo

💼 Consultoria

Site Reliability Engineer II for Mrsool, enhancing infrastructure and supporting development teams in a dynamic environment. Ensuring reliability for a leading delivery platform in the MENA region.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 9

DBSync

51 - 200

💼 Consultoria

🏥 Saúde

📦 Logística

Forward Deployment Engineer at DBSync solving tasks for Cloud technology users and ensuring customer success through technical expertise.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 8

MariaDB

201 - 500

🏢 Corporativo

QA and release engineer testing MariaDB MaxScale, a database proxy for MariaDB clusters. Managing releases, Linux packages, CI/CD automation, and build infrastructure.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 8

Pythian

201 - 500

💼 Consultoria

🏥 Saúde

📦 Logística

Site Reliability Engineer at Pythian focusing on operating large-scale distributed systems. Responsible for designing, deploying, and operating infrastructure with strong collaboration across teams.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Julho 7

Resilinc

201 - 500

💼 Consultoria

📦 Logística

🏥 Saúde

Site Reliability Engineer responsible for platform availability and automation in cloud environments at Resilinc. Focused on leveraging agentic AI for impactful supply chain solutions.

🗣️🇺🇸🇬🇧 Inglês obrigatório