
1 - 10 funcionários
Fundada em 2023
🤖 Inteligência Artificial
☁️ SaaS
🔌 API
Artificial Intelligence • SaaS • API
A Featherless AI é um provedor de inferência de IA sem servidor e hospedagem de modelos que oferece acesso via API a um grande e crescente catálogo de modelos de pesos abertos (12. 200+), permitindo que desenvolvedores e empresas implante, ajustem e executem modelos em escala sem gerenciar servidores. A empresa oferece preços de assinatura fixa com tokens ilimitados, orquestração de GPU, uso privado/anônimo (sem logs) e opções para hospedagem própria em nível empresarial ou unidades de escala para alta concorrência. A Featherless AI também opera como um laboratório de pesquisa em IA focado em modelos de código aberto e pós-transformadores, alegando melhorias significativas de custo e desempenho para modelos grandes e agentes de IA.
🕒 Janeiro 23
🗣️🇺🇸🇬🇧 Inglês obrigatório
Melhore suas chances de conseguir uma entrevista verificando sua pontuação de currículo antes de se candidatar.

1 - 10 funcionários
Fundada em 2023
🤖 Inteligência Artificial
☁️ SaaS
🔌 API
Artificial Intelligence • SaaS • API
A Featherless AI é um provedor de inferência de IA sem servidor e hospedagem de modelos que oferece acesso via API a um grande e crescente catálogo de modelos de pesos abertos (12. 200+), permitindo que desenvolvedores e empresas implante, ajustem e executem modelos em escala sem gerenciar servidores. A empresa oferece preços de assinatura fixa com tokens ilimitados, orquestração de GPU, uso privado/anônimo (sem logs) e opções para hospedagem própria em nível empresarial ou unidades de escala para alta concorrência. A Featherless AI também opera como um laboratório de pesquisa em IA focado em modelos de código aberto e pós-transformadores, alegando melhorias significativas de custo e desempenho para modelos grandes e agentes de IA.
• Pesquisar e desenvolver técnicas para otimizar o desempenho de inferência em grandes redes neurais. • Melhorar latência, throughput, eficiência de memória e custo por inferência. • Projetar e avaliar otimizações a nível de modelo (quantization, pruning, otimização de KV-cache, simplificações dependentes da arquitetura). • Implementar otimizações a nível de sistema (dynamic batching, kernel fusion, inferência multi-GPU, otimização de prefill vs decode). • Realizar benchmark de cargas de inferência em aceleradores de hardware. • Colaborar com equipes de engenharia para implantar pipelines de inferência otimizados. • Transformar resultados de pesquisa em melhorias prontas para produção.
• Sólida formação em machine learning, deep learning ou sistemas de IA. • Experiência prática na otimização de inferência para modelos em larga escala. • Proficiência em Python e frameworks modernos de ML (por exemplo, PyTorch). • Experiência com ferramentas de inferência (por exemplo, Triton, TensorRT, vLLM, ONNX Runtime). • Capacidade de desenhar experimentos e comunicar resultados de forma clara.
• Plano de saúde • Arranjos de trabalho flexíveis • Oportunidades de desenvolvimento profissional
Candidatar-se