Pesquisador(a) de IA — Otimização de Inferência

Vaga não está no LinkedIn

🕒 Janeiro 23

🌏 Qualquer lugar do mundo

⏰ Tempo Integral

🟡 Pleno

🟠 Sênior

🧠 Cientista de Pesquisa em IA

🗣️🇺🇸🇬🇧 Inglês obrigatório

Candidatar-se
Encontrar Vagas Remotas Similares

📊 Verifique sua pontuação de currículo para esta vaga

Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

Logo of Featherless AI

Featherless AI

1 - 10 funcionários

Fundada em 2023

🤖 Inteligência Artificial

☁️ SaaS

🔌 API

Artificial Intelligence • SaaS • API

A Featherless AI é um provedor de inferência de IA sem servidor e hospedagem de modelos que oferece acesso via API a um grande e crescente catálogo de modelos de pesos abertos (12. 200+), permitindo que desenvolvedores e empresas implante, ajustem e executem modelos em escala sem gerenciar servidores. A empresa oferece preços de assinatura fixa com tokens ilimitados, orquestração de GPU, uso privado/anônimo (sem logs) e opções para hospedagem própria em nível empresarial ou unidades de escala para alta concorrência. A Featherless AI também opera como um laboratório de pesquisa em IA focado em modelos de código aberto e pós-transformadores, alegando melhorias significativas de custo e desempenho para modelos grandes e agentes de IA.

Descrição

• Pesquisar e desenvolver técnicas para otimizar o desempenho de inferência em grandes redes neurais. • Melhorar latência, throughput, eficiência de memória e custo por inferência. • Projetar e avaliar otimizações a nível de modelo (quantization, pruning, otimização de KV-cache, simplificações dependentes da arquitetura). • Implementar otimizações a nível de sistema (dynamic batching, kernel fusion, inferência multi-GPU, otimização de prefill vs decode). • Realizar benchmark de cargas de inferência em aceleradores de hardware. • Colaborar com equipes de engenharia para implantar pipelines de inferência otimizados. • Transformar resultados de pesquisa em melhorias prontas para produção.

🎯 Requisitos

• Sólida formação em machine learning, deep learning ou sistemas de IA. • Experiência prática na otimização de inferência para modelos em larga escala. • Proficiência em Python e frameworks modernos de ML (por exemplo, PyTorch). • Experiência com ferramentas de inferência (por exemplo, Triton, TensorRT, vLLM, ONNX Runtime). • Capacidade de desenhar experimentos e comunicar resultados de forma clara.

🏖️ Benefícios

• Plano de saúde • Arranjos de trabalho flexíveis • Oportunidades de desenvolvimento profissional

Candidatar-se