
11 - 50 Mitarbeiter
Gegründet 2025
🤖 Künstliche Intelligenz
🤝 B2B
🏢 Unternehmen
Artificial Intelligence • B2B • Enterprise
Inferact ist ein Startup, das von den Schöpfern und Hauptentwicklern von vLLM, der führenden Open-Source-LLM-Inferenz-Engine, gegründet wurde. Das Unternehmen hat das Ziel, den Fortschritt der KI zu beschleunigen, indem es die Modellinferenz kostengünstiger und schneller macht und die Leistung und Unterstützung von vLLM für neue Architekturen und Accelerator-Hardware erweitert. Inferact kombiniert tiefgehende Expertise an der Schnittstelle von Modellen und Hardware, um Infrastrukturen für die Inferenz bereitzustellen, die von Forschungslabors, Großunternehmen und Startups genutzt werden, und entwickelt weiterhin Optimierungen für die Open-Source-Community.
🔥 vor wenigen Sekunden
🗣️🇺🇸🇬🇧 Englisch erforderlich
Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

11 - 50 Mitarbeiter
Gegründet 2025
🤖 Künstliche Intelligenz
🤝 B2B
🏢 Unternehmen
Artificial Intelligence • B2B • Enterprise
Inferact ist ein Startup, das von den Schöpfern und Hauptentwicklern von vLLM, der führenden Open-Source-LLM-Inferenz-Engine, gegründet wurde. Das Unternehmen hat das Ziel, den Fortschritt der KI zu beschleunigen, indem es die Modellinferenz kostengünstiger und schneller macht und die Leistung und Unterstützung von vLLM für neue Architekturen und Accelerator-Hardware erweitert. Inferact kombiniert tiefgehende Expertise an der Schnittstelle von Modellen und Hardware, um Infrastrukturen für die Inferenz bereitzustellen, die von Forschungslabors, Großunternehmen und Startups genutzt werden, und entwickelt weiterhin Optimierungen für die Open-Source-Community.
• Die Grenzen des Servings von LLMs und Diffusionsmodellen erweitern • Im Kern von vLLM arbeiten, um die Modellausführung auf unterschiedlichen Hardwareplattformen und Architekturen zu optimieren • Innovative Lösungen für Inferenz-Runtimes bei Mixture-of-Experts-, multimodalen und agentenbasierten Architekturen entwickeln • In Forschungsarbeiten beschriebene Inferenztechniken und Modellarchitekturen implementieren • Leistungsfähigen und wartbaren Code beitragen • Komplexe Codebasen im Bereich Machine Learning debuggen • Die Ausführung von KI-Inferenz direkt verbessern, indem sie kostengünstiger und schneller gemacht wird
• Bachelorabschluss oder gleichwertige Berufserfahrung in Informatik, Ingenieurwesen oder einem vergleichbaren Fachgebiet • Fundierte Kenntnisse von Transformer-Architekturen und ihren Varianten • Sehr gute Programmierkenntnisse in Python sowie Erfahrung mit den Interna von PyTorch • Erfahrung mit LLM-Inferenzsystemen wie vLLM, TensorRT-LLM, SGLang oder TGI • Fähigkeit, Modellarchitekturen und Inferenztechniken aus Forschungsarbeiten zu verstehen und zu implementieren • Fähigkeit, leistungsfähigen und wartbaren Code zu entwickeln und komplexe ML-Codebasen zu debuggen • Von Vorteil: fundierte Kenntnisse im Speichermanagement des KV-Cache, im Prefix-Caching und im hybriden Model Serving • Von Vorteil: Kenntnisse von RL-Frameworks und -Algorithmen für LLMs • Von Vorteil: Erfahrung mit multimodaler Inferenz für Audio, Bilder, Video und Text • Beiträge zu Open-Source-Projekten im Bereich Machine Learning oder Systeminfrastruktur sind von Vorteil • Zusätzlich von Vorteil: Implementierung zentraler Funktionen in vLLM oder anderen Inferenz-Engine-Projekten • Zusätzlich von Vorteil: Beiträge zu vLLM-Integrationen wie verl, OpenRLHF, Unsloth oder LlamaFactory • Zusätzlich von Vorteil: vielbeachtete technische Blogbeiträge oder eigene Projekte zu vLLM oder LLM-Inferenz • Erforderliche Bewerbungsunterlagen: Lebenslauf, GitHub-Benutzername und ein Link zu einem relevanten persönlichen Projekt, Open-Source-Beitrag oder technischen Blogbeitrag
• Attraktive Zusatzleistungen, die auf den jeweiligen Arbeitsort abgestimmt sind, einschließlich Krankenversicherung, sofern zutreffend • Beteiligung am Unternehmen (Equity) • Unterstützung bei der Visumbeantragung nach Einzelfallprüfung • Vollständig remote möglich • Zeitzonenflexible Arbeitszeiten mit regelmäßiger Überschneidung mit der pazifischen Zeitzone für wichtige Abstimmungen
Jetzt Bewerben🕒 vor 15 Tagen
Engineering Delivery Manager zur Verbesserung von Vorhersagbarkeit, Qualität und Transparenz in externen Engineering-Teams. Progress Partners entwickelt SaaS- und Mobile-Plattformen, die weltweit genutzt werden.
🗣️🇺🇸🇬🇧 Englisch erforderlich
🕒 vor 1 Monat
Ingenieur für Entwicklerproduktivität bei Supabase, der lokale Entwicklungs-Workflows verbessert und Engineering-Prozesse optimiert. Fokus auf Entwicklerproduktivität mit KI-unterstützten Tools und CI-Systemen.
🌏 Überall auf der Welt
💰 €80.000.000 Series B im 2022-05
⏰ Vollzeit
🟠 Senior
🔴 Experte
🖥 Softwareentwickler
🗣️🇺🇸🇬🇧 Englisch erforderlich
🕒 vor 3 Monaten
Ingenieur, der die Weiterentwicklung von OrioleDB bei Supabase vorantreibt und eng mit der PostgreSQL-Community zusammenarbeitet. Entwurf und Implementierung neuer Datenbankfunktionen sowie Sicherstellung der Systemzuverlässigkeit.
🌏 Überall auf der Welt
💰 €80.000.000 Series B im 2022-05
⏰ Vollzeit
🟠 Senior
🔴 Experte
🖥 Softwareentwickler
🗣️🇺🇸🇬🇧 Englisch erforderlich
🕒 vor 5 Monaten
VP Engineering, verantwortlich für die technologische Vision und Strategie bei ClosedWon, einem KI-basierten Vertriebscoaching-Unternehmen. Zusammenarbeit mit der Unternehmensleitung zur Steuerung und Umsetzung innovativer Lösungen.
🗣️🇺🇸🇬🇧 Englisch erforderlich