
201 - 500 funcionários
Fundada em 2007
💸 Finanças
🤖 Inteligência Artificial
Finance • Artificial Intelligence
O Voleon Group é uma empresa de gestão de investimentos que aplica aprendizado de máquina e pesquisa estatística rigorosa aos mercados financeiros. Fundada com uma abordagem acadêmica à pesquisa, a Voleon enfatiza modelos escaláveis, gerenciamento de risco e previsões financeiras baseadas em dados, em vez de intuição humana. Com sede próxima à UC Berkeley e operando através da Voleon Capital Management LP e afiliadas, a empresa contrata pesquisadores com doutorado em estatística, ciência da computação e campos quantitativos relacionados para desenvolver estratégias de investimento automatizadas e gerenciar fundos.
🕒 3 dias atrás
🏄 California – Remoto
💵 $205.000 - $235.000 / ano
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

201 - 500 funcionários
Fundada em 2007
💸 Finanças
🤖 Inteligência Artificial
Finance • Artificial Intelligence
O Voleon Group é uma empresa de gestão de investimentos que aplica aprendizado de máquina e pesquisa estatística rigorosa aos mercados financeiros. Fundada com uma abordagem acadêmica à pesquisa, a Voleon enfatiza modelos escaláveis, gerenciamento de risco e previsões financeiras baseadas em dados, em vez de intuição humana. Com sede próxima à UC Berkeley e operando através da Voleon Capital Management LP e afiliadas, a empresa contrata pesquisadores com doutorado em estatística, ciência da computação e campos quantitativos relacionados para desenvolver estratégias de investimento automatizadas e gerenciar fundos.
• Be a first responder in the event of cluster outages or issues. Triage and resolve urgent issues as they arise • Ensure a high degree of cluster uptime (measured in multiple nines), and define + track SLAs to quantify reliability • Diagnose systemic/recurring patterns of problems, and engineer precision solutions to them in collaboration with engineering teams • Develop robust metrics and observability for cluster health and use those metrics to inform your work. Build out custom observability mechanisms when off-the-shelf ones won't do • Help software and research teams design policies around fair cluster usage, and help develop enforcement mechanisms for said policies • Assist in forecasting cluster growth, and help select appropriate scale-up strategies. Help optimize operations across dimensions of cost and usability
• 5+ years of experience in SRE or DevOps roles, preferably working as a senior engineer or tech lead • Knowledge of HPC/batch compute frameworks (Slurm, Kueue, AWS/GCP Batch) and/or machine learning training systems (Kubeflow, MLflow, Horovod) • Ability to develop scripts and utilities of moderate complexity in a common scripting language (Python, Ruby, etc.) • Familiarity with infrastructure-as-code and configuration management tools (Terraform, Ansible) • Experience with cloud infrastructure (AWS or GCP) • Familiarity designing and implementing modern observability stacks (Prometheus, Grafana, Loki, ELK, OpenTelemetry) • Experience with distributed storage technologies (Lustre, Ceph, S3) • Embodies a "system engineer" rather than "system administrator" mindset, thinking systematically and leveraging automation • Bachelor degree in computer science
• medical, dental, and vision coverage • life and AD&D insurance • 20 days of paid time off • 9 sick days • 401(k) plan with a company match
Candidatar-se🕒 3 dias atrás
Site Reliability Engineer managing reliability and observability for GPU One platform. Leading incident response and ensuring SLOs for customer SLAs.
🇺🇸 Estados Unidos – Remoto (EUA)
⏰ Tempo Integral
🟡 Pleno
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 3 dias atrás
Senior DevOps Engineer at Zafran working on compliance certifications and implementing security controls across infrastructure. Collaborating with teams to enhance security posture and ensure regulatory compliance.
🇺🇸 Estados Unidos – Remoto (EUA)
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 3 dias atrás
Site Reliability Engineer ensuring the stability and resilience of Runpod's distributed platform. Collaborating with engineering teams on reliability frameworks and preventing incidents.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $150.000 - $200.000 / ano
💰 $20.000.000 Seed em 2024-06
⏰ Tempo Integral
🟡 Pleno
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 3 dias atrás
Senior Site Reliability Engineer at Talkiatry, building SRE principles for mental health care. Collaborate with teams to minimize outages and improve reliability for patient services.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $160.000 - $185.000 / ano
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório
🕒 4 dias atrás
Site Reliability Engineer optimizing infrastructure resilience and performance for a leading live streaming platform. Driving enhancement and automation of cloud-based infrastructure with a global network.
🇺🇸 Estados Unidos – Remoto (EUA)
💵 $169.000 - $215.000 / ano
⏰ Tempo Integral
🟠 Sênior
⛑ DevOps & Engenheiro de Confiabilidade do Site (SRE)
🗣️🇺🇸🇬🇧 Inglês obrigatório