Senior DevOps Engineer

🕒 Setembro 10

🏖️ New Jersey – Remoto

infoinfo

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 12%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Akkadian Labs

Akkadian Labs

51 - 200 funcionários

☁️ SaaS

🏢 Corporativo

📡 Telecomunicações

SaaS • Enterprise • Telecommunications

A Akkadian Labs é um provedor líder de soluções de provisionamento automatizado para ambientes de Comunicações Unificadas (UC). Eles oferecem um conjunto de produtos, incluindo Akkadian Provisioning Manager, Console, Contact Manager e Site Builder, projetados para simplificar a adoção, implementação e gestão de UC. Suas soluções facilitam o provisionamento sem erros em plataformas como Webex, Microsoft e Zoom, ajudando a gerenciar milhões de usuários empresariais de forma eficiente. A Akkadian Labs trabalha em estreita colaboração com parceiros e emprega automação para reduzir o trabalho manual repetitivo, melhorar a segurança e alcançar um rápido retorno sobre investimento (ROI). Eles são reconhecidos por sua parceria com provedores UC e suporte por meio de um console intuitivo que atende a ambientes de alto volume de chamadas.

Descrição

• Design, implement, and maintain scalable and secure infrastructure and DevOps processes • Deploy and maintain scalable infrastructure in AWS and hybrid cloud environments • Manage infrastructure-as-code using Terraform, CloudFormation, or similar tools • Maintain Linux-based environments • Design and implement Docker containerization and Kubernetes orchestration • Design, deploy, and manage AI agent workloads, including compute provisioning and resource scaling for inference-heavy tasks • Build and maintain AI model deployment pipelines, including versioning, testing, and production rollback • Monitor AI API consumption and infrastructure costs; implement alerting and usage controls • Implement infrastructure-level security guardrails for AI systems, including access controls and data isolation • Manage monitoring and observability using Prometheus, Grafana, and the ELK stack • Troubleshoot system issues and contribute to incident response and root cause analysis • Improve system reliability, performance, and uptime • Build, maintain, and optimize CI/CD pipelines using Jenkins, Bitbucket CI/CD, or similar tools • Automate builds, testing, deployments, and system updates • Integrate pipelines with Akkadian tools • Implement secure DevOps practices, security controls, compliance initiatives, and vulnerability remediation • Collaborate with DevOps, engineering, QA, and product teams on deployments and releases • Maintain infrastructure, process, and operational documentation • Participate in collaborative team processes and continuous improvement initiatives

🎯 Requisitos

• 10+ years of experience in DevOps or Site Reliability Engineering (SRE) • Expertise with AWS, including EC2, ECS, S3, IAM, Lambda, and CloudWatch • Expertise with infrastructure-as-code tools, including Terraform and CloudFormation • Strong knowledge of Linux environments • Experience with Docker and Kubernetes • Scripting ability in Python, Bash, or similar languages • Experience building or maintaining CI/CD pipelines and related tools • Experience with Prometheus, Grafana, and ELK for monitoring and observability • Experience implementing secure DevOps practices and compliance frameworks such as SOC2 and ISO • Experience supporting AI or machine learning workloads and compute environments • Exposure to AI model deployment pipelines and model versioning practices • Familiarity with hybrid cloud or on-premises environments • Exposure to DevOps security best practices, including AI-specific data isolation and access controls • Experience supporting production systems and participating in on-call rotations

🏖️ Benefícios

• Fully remote environment • Medical insurance • Dental insurance • Vision insurance • Company-paid life insurance • Company-paid disability policies • 401(k) with a generous matching program • Paid time off

Candidatar-se

Vagas Similares

🕒 Setembro 10

Casper Studios

2 - 10

🤖 Inteligência Artificial

🏢 Corporativo

📱 Mídia

AI Security & DevOps Engineer securing AI systems from prototype to production for Casper Studios, an AI services firm. Owning security standards, platform controls, and enterprise client approvals.

🇺🇸 Estados Unidos – Remoto (EUA)

💵 $150.000 - $180.000 / ano

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Setembro 9

Trumid

51 - 200

💳 Fintech

💸 Finanças

☁️ SaaS

Senior DBRE safeguarding Postgres durability, recovery, and performance for Trumid’s fixed-income trading platform. Owning failover, observability, backups, and data resilience.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Setembro 9

Replicant

51 - 200

💼 Consultoria

🏥 Saúde

🛡️ Seguros

Senior SRE building CI/CD, observability, and Kubernetes infrastructure for Replicant’s AI-powered customer-service platform. Improving reliability and developer tooling for large-scale conversational traffic.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Setembro 9

Ancestry

1001 - 5000

💼 Consultoria

🏥 Saúde

📣 Marketing

Site Reliability Engineer maintaining Ancestry’s family-history platform availability through incident response, AWS operations, and automation. Developing AI agentic workflows and tooling for a 24/7 Command Center.

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Setembro 9

Keyfactor

201 - 500

🚘 Automotivo

🏥 Saúde

🔐 Segurança

Senior DevOps Engineer automating cloud and on-premise infrastructure for Keyfactor’s cryptographic identity security platform. Improving Kubernetes, CI/CD, and Infrastructure as Code delivery.

🗣️🇺🇸🇬🇧 Inglês obrigatório