Site Reliability Engineer – L3 Support

🕒 4 dias atrás

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of SS&C Technologies

SS&C Technologies

10.000+ funcionários

Fundada em 1986

💼 Consultoria

🛡️ Seguros

📦 Logística

Consulting • Insurance • Logistics

SS&C Technologies é líder global em tecnologia para serviços financeiros e saúde, reconhecida como a maior administradora independente de hedge funds e de private equity do mundo, além de a maior agente de transferência de fundos mútuos. A empresa oferece um portfólio abrangente de soluções, incluindo gestão de ativos, banking, saúde, seguros e wealth management, alavancando software proprietário e ampla expertise para atender às necessidades operacionais de clientes em diversos setores.

Descrição

• Monitor the health, availability, performance, and security of production services. • Proactively identify emerging issues using telemetry, logs, metrics, and distributed tracing. • Investigate, troubleshoot, and resolve complex production incidents across application and infrastructure layers. • Act as the L3 escalation point for operational issues that cannot be resolved by L1 or L2 support. • Participate in an on-call rotation for critical production incidents. • Lead incident response activities, including coordination, communication, and post-incident reviews. • Perform root cause analysis and ensure corrective actions are implemented to prevent recurrence. • Develop and maintain operational runbooks, dashboards, alerts, and standard operating procedures. • Improve platform observability by enhancing monitoring, alerting, dashboards, and service-level indicators. • Work closely with software engineering teams to improve service reliability, scalability, and resilience. • Identify opportunities to automate operational tasks and eliminate repetitive manual work. • Support production deployments, infrastructure changes, and maintenance activities. • Assist with disaster recovery exercises, resilience testing, and operational readiness reviews. • Ensure operational activities comply with FedRAMP High security and compliance requirements. • Contribute to continuous improvement initiatives across reliability, performance, and operational excellence.

🎯 Requisitos

• U.S. Citizenship (required) • 3–6 years of experience in Site Reliability Engineering, Production Engineering, DevOps, Platform Engineering, or a senior production support role • Experience supporting mission-critical cloud-based production systems • Strong understanding of Linux operating systems and networking fundamentals • Experience troubleshooting distributed applications running in Kubernetes • Experience with public cloud platforms, preferably AWS • Experience with infrastructure as code and configuration management • Strong scripting or programming skills (e.g. Python, Bash, PowerShell, Go, or similar) • Experience using monitoring and observability platforms such as Prometheus, Grafana, CloudWatch, Datadog, Splunk, or OpenTelemetry • Experience analysing application logs, metrics, and traces to diagnose production issues • Understanding of incident management, problem management, and root cause analysis • Strong analytical and troubleshooting skills • Excellent written and verbal communication skills.

🏖️ Benefícios

• Hybrid Work Model & a Business Casual Dress Code, including jeans • 401k Matching Program • Professional Development Reimbursement • Flexible Personal/Vacation Time Off • Sick Leave • Paid Holidays • Medical, Dental, Vision • Employee Assistance Program • Parental Leave • Discounts on fitness clubs, travel and more!

Candidatar-se

Vagas Similares

🕒 4 dias atrás

C5MI

201 - 500

💼 Consultoria

🏢 Corporativo

📦 Logística

DevSecOps Engineer supporting the design and deployment of secure software solutions within C5MI. Collaborating with teams to enhance system reliability and security compliance.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 4 dias atrás

C5MI

201 - 500

💼 Consultoria

🏢 Corporativo

📦 Logística

Azure DevOps Administrator managing ADO environment and coaching delivery teams to align with SDLC standards. Ensuring configuration and governance for C5MI's Azure DevOps and SDLC compliance.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $100.000 - $120.000 / ano

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 4 dias atrás

Smithfield Foods

10.000+ funcionários

🏭 Manufatura

🌾 Agricultura

🍽️ Alimentos e Bebidas

Sr. Utilities Engineer optimizing and managing utility systems at Smithfield Foods. Focusing on industrial refrigeration, boiler, and compressed air systems for manufacturing processes.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 4 dias atrás

Kofax

1001 - 5000

☁️ SaaS

🏢 Corporativo

🤖 Inteligência Artificial

Cloud Operations Engineer supporting Kofax Cloud Solutions technology stack. Assisting in system operation, management, and vendor communications.

🇺🇸 Estados Unidos – Remoto (EUA)

💰 $1.900.000 Post IPO equity em 2015-02

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 4 dias atrás

Koniag Government Services

1001 - 5000

🏛️ Governo

🎖️ Defesa

💼 Consultoria

AWS Cloud Infrastructure Engineer specializing in RPA operations with a focus on AWS services for government customer. Responsible for the maintenance and security of cloud infrastructure.

🇺🇸 Estados Unidos – Remoto (EUA)

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório