Senior DevOps Engineer, AI Platform

🕒 Ontem

🇦🇷 Argentina – Remoto

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

👻 Score fantasma 10%

infoinfo

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Newfold Digital

Newfold Digital

1001 - 5000 funcionários

Fundada em 2021

💼 Consultoria

📣 Marketing

📦 Logística

💰 Venture Round em 2021-01

Consulting • Marketing • Logistics

A Newfold Digital é uma provedora líder de soluções de presença online, atendendo milhões de pequenas e médias empresas no mundo todo. Por meio de seu portfólio de marcas — incluindo Bluehost, CrazyDomains, HostGator, Network Solutions, Register. com, Web. com e muitas outras — a Newfold Digital ajuda clientes de todos os portes a construir uma presença digital que gera resultados e agrega valor aos negócios. Com um amplo portfólio de produtos, como domínios, criadores de sites, hospedagem, segurança, marketing digital, design profissional de sites e serviços de SEO, além de suporte personalizado, a Newfold Digital colabora com seus clientes para atender às suas necessidades de presença online.

Descrição

• Build and operate infrastructure powering AI platforms, agent runtimes, web applications, backend services, APIs, and shared platform capabilities • Translate application and platform technical designs into production-ready cloud infrastructure with minimal supervision • Design, provision, operate, and troubleshoot Kubernetes environments, primarily Azure Kubernetes Service and Oracle Kubernetes Engine • Support AI workloads including LiteLLM-based gateways, Python agent runtimes, RAG workers, MCP services, background workers, and asynchronous processing pipelines • Design and manage ingress and egress networking, load balancers, DNS, TLS, private connectivity, routing, NAT, firewalls, network policies, and service-to-service communication • Build and operate infrastructure for web applications and backend services, including APIs, databases, caches, queues, scheduled jobs, and event-driven workloads • Build and maintain CI/CD pipelines using Jenkins and Bitbucket, integrating Docker, Helm, Kubernetes, ArgoCD, and container registries • Automate infrastructure provisioning and configuration using Terraform, Helm, Kubernetes manifests, Python, Bash, and related tooling • Implement end-to-end observability using metrics, logs, distributed tracing, dashboards, alerts, health checks, and SLOs • Own production readiness, incident troubleshooting, root cause analysis, scalability, reliability, and infrastructure cost optimization • Create reusable infrastructure patterns that allow engineering teams to launch new services quickly and consistently • Determine required cloud resources, Kubernetes configuration, namespaces, scaling models, and supporting services from technical designs • Configure ingress and egress, private connectivity, DNS, TLS, service communication, identities, and secrets • Provision and operate dependencies such as PostgreSQL, Redis, RabbitMQ, storage, and other shared services • Build Jenkins and Bitbucket CI/CD flows for build, test, container publishing, deployment, validation, and rollback • Define observability, health checks, dashboards, alerts, capacity monitoring, and operational runbooks before production launch • Own infrastructure delivery through UAT and production, partnering with architects and engineers on design tradeoffs

🎯 Requisitos

• 7 or more years of experience in DevOps, SRE, Platform Engineering, Cloud Infrastructure, or a related role • Strong hands-on experience operating production Kubernetes environments and deep knowledge of networking, scheduling, storage, autoscaling, security, and troubleshooting • Strong Microsoft Azure experience, including AKS, networking, identity, storage, and monitoring • OCI experience is preferred, or demonstrated ability to work across cloud providers • Strong cloud networking knowledge across virtual networks, subnets, routing, NAT, load balancers, private networking, DNS, TLS, firewalls, ingress, and egress • Strong experience with Jenkins, Bitbucket, Docker, Terraform, Helm, Kubernetes, and Infrastructure as Code • Proven experience supporting production web applications and backend services, including REST APIs, microservices, background workers, and asynchronous architectures • Hands-on experience with databases, caching, and messaging systems such as PostgreSQL, Redis, RabbitMQ, or equivalent technologies • Experience implementing production observability using OpenTelemetry, Grafana, Prometheus, Sentry, cloud monitoring, or similar tools • Strong Linux, systems, and production troubleshooting skills • Working knowledge of Python, especially backend services built with frameworks such as FastAPI • Familiarity with at least one additional language such as C#, Java, Go, JavaScript, or TypeScript • Understanding of HTTP, HTTPS, DNS, TCP/IP, proxies, authentication, APIs, connection pooling, caching, concurrency, queues, retries, dead letter queues, and asynchronous processing • Ability to read application logs and stack traces and diagnose latency, memory, CPU, connection, and dependency issues

Candidatar-se

Vagas Similares

🕒 2 dias atrás

Teladoc Health

5001 - 10000

🏥 Saúde

👥 B2C

☁️ SaaS

Senior SRE operating and scaling Azure-based infrastructure for Teladoc Health’s virtual-care platform. Leading reliability, observability, automation, and incident response for critical healthcare services.

🇦🇷 Argentina – Remoto

💰 $80.000.000 Post-IPO Debt - Teladoc Health em 2016-07

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 3 dias atrás

Wizeline

1001 - 5000

💼 Consultoria

🏥 Saúde

📣 Marketing

Site Reliability Engineer securing multi-cloud infrastructure and automating cloud-risk remediation. Wizeline develops AI-powered digital products and platforms for global clients.

🇦🇷 Argentina – Remoto

💰 $43.000.000 Series B em 2018-03

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 4 dias atrás

Commit

501 - 1000

🔒 Cibersegurança

Senior DevOps Engineer modernizing AWS infrastructure and migrating the company’s codebase to GitHub Actions. Strengthening production support, infrastructure automation, observability, security, and cost optimization.

🇦🇷 Argentina – Remoto

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 25

Helpware

1001 - 5000

📦 Logística

📣 Marketing

💼 Consultoria

Engenheiro(a) DevOps Sênior responsável pela infraestrutura de Azure, AKS, Terraform e CI/CD. Atuará apoiando operações seguras em cloud, observabilidade, alta disponibilidade e migrações entre Azure e Google Cloud.

🇦🇷 Argentina – Remoto

💰 Seed Round em 2016-01

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório

🕒 Agosto 19

Helpware

1001 - 5000

📦 Logística

📣 Marketing

💼 Consultoria

Engenheiro(a) Sênior DevSecOps protegendo infraestrutura em nuvem, plataformas Kubernetes e pipelines de CI/CD. Automatiza guardrails de segurança e controles da cadeia de suprimentos de software na Argentina, Brasil e México.

🇦🇷 Argentina – Remoto

💰 Seed Round em 2016-01

⏰ Tempo Integral

🟠 Sênior

⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)

🗣️🇺🇸🇬🇧 Inglês obrigatório