Lead Software Engineer, Cloud Site Reliability

Job not on LinkedIn

🔥 1 minute ago

🇮🇳 India – Remote

⏰ Full Time

🟠 Senior

⛑ DevOps & Site Reliability Engineer (SRE)

👻 Ghost score 13%

infoinfo
Apply Now
Find Similar Remote Jobs

📊 Check your resume score for this job

Improve your chances of getting an interview by checking your resume score before you apply.

Logo of iCert Global

iCert Global

51 - 200 employees

💼 Consulting

📣 Marketing

📚 Education

Consulting • Marketing • Education

iCert Global is a professional certification training provider that offers a wide array of courses across various domains, including project management, business analysis, IT service management, agile and scrum strategies, quality management, cloud technology, and cybersecurity. The company provides instructor-led online classes, e-learning options, and corporate training programs designed to empower individuals and enterprises. Through globally recognized certification courses, iCert Global aims to help learners advance their careers and stay competitive in a fast-evolving job market.

📋 Description

• Lead 24x7 NOC operations with mandatory rotational shifts, ensuring system availability and SLA adherence • Act as Major Incident Manager for P1/P2 incidents, driving triage, war room coordination, and stakeholder communication • Implement and enhance observability practices across logs, metrics, and traces • Use Datadog and Azure Monitor for monitoring and alerting • Drive proactive monitoring, alert tuning, anomaly detection, and AIOps initiatives • Manage Azure infrastructure and AKS clusters, including troubleshooting, scaling, and performance tuning • Build automation and self-healing workflows using Terraform, ARM, Helm, Power Automate, and scripting • Collaborate with engineering teams to improve reliability, deployment pipelines, and cloud-native architecture • Develop dashboards and reports using Power BI and ServiceNow • Handle monthly business reviews and leadership reporting • Mentor team members and drive process standardization and operational excellence • Support availability, reliability, performance, emergency response, and capacity planning of Icertis SaaS applications and related services • Execute infrastructure and access provisioning, upgrades, deployments, and change management • Drive architectural improvements to enhance scalability and optimize overall cost

🎯 Requirements

• 7–12 years of experience in CloudOps / SRE / NOC environments (24x7 operations) • Strong expertise in Azure Infrastructure (VMs, Networking, Storage) • Hands-on experience with Azure Kubernetes Service (AKS), Kubernetes, Docker • Strong experience with monitoring and observability tools (Datadog, Azure Monitor) • Proven experience in Incident Management / Major Incident Handling and monthly reporting • Experience with Infrastructure as Code (Terraform, ARM templates, Helm) • Scripting skills in PowerShell, Python, or Bash • Experience with ServiceNow (Incident, Problem, Change modules and dashboards) • Good understanding of distributed systems and cloud-native architecture • Excellent communication, leadership, and problem-solving skills • Experience in multi-cloud environments (Azure/AWS) • Exposure to AIOps / predictive monitoring / self-healing systems • Azure / Datadog / Kubernetes certifications are preferred • Bachelor's Degree

Apply Now

Similar Jobs

🕒 Yesterday

Miratech

501 - 1000

🤝 B2B

💼 Consulting

☁️ SaaS

Senior DevOps Engineer migrating 2,000+ GitHub repositories and CI/CD ecosystems for global IT services company Miratech. Automating enterprise platforms across GitHub, Terraform, AWS/EKS, Kubernetes, and Jenkins.

AWS

Cloud

Jenkins

Kubernetes

Python

Terraform

🕒 Yesterday

Miratech

501 - 1000

🤝 B2B

💼 Consulting

☁️ SaaS

Senior Observability/DevOps Engineer migrating enterprise Datadog environments for Miratech, a global IT services and consulting company. Automating resilient observability platforms with Datadog, Terraform, AWS, and Kubernetes.

AWS

Kubernetes

ServiceNow

Terraform

🕒 Yesterday

Miratech

501 - 1000

🤝 B2B

💼 Consulting

☁️ SaaS

Senior Observability/DevOps Engineer migrating enterprise Datadog monitoring, logging, security, and automation platforms. Building resilient observability infrastructure with Terraform, AWS, and Kubernetes for Miratech’s global clients.

AWS

Kubernetes

ServiceNow

Terraform

🕒 Yesterday

Miratech

501 - 1000

🤝 B2B

💼 Consulting

☁️ SaaS

Senior Observability/DevOps Engineer migrating enterprise Datadog environments with Terraform, AWS, and Kubernetes. Building resilient observability platforms for Miratech’s global IT services clients.

AWS

Kubernetes

ServiceNow

Terraform

🕒 4 days ago

MRSOOL | مرسول

201 - 500

🍽️ Food & Beverage

✈️ Travel

💼 Consulting

Site Reliability Engineer II improving infrastructure, deployments, monitoring, and reliability for Mrsool’s MENA delivery platform. Supporting scalable systems and 24/7 application availability.

Ansible

AWS

Azure

Chef

Cloud

Distributed Systems

Docker

Google Cloud Platform

Grafana

Java

Kubernetes

Prometheus

Puppet

Python

Ruby

Terraform

Go