LLM Inference Engineer

🕒 vor 2 Monaten

🏄 California – Remote

infoinfo

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

👷🏻‍♀️ Ingenieur

👻 Geisterscore 42%

infoinfo

🗣️🇺🇸🇬🇧 Englisch erforderlich

Jetzt Bewerben
Ähnliche Remote-Jobs finden

📊 Überprüfen Sie Ihre Lebenslauf-Bewertung für diese Stelle

Verbessern Sie Ihre Chancen auf ein Vorstellungsgespräch, indem Sie Ihre Lebenslauf-Bewertung vor der Bewerbung überprüfen.

Logo of NEAR AI

NEAR AI

11 - 50 Mitarbeiter

Gegründet 2017

🤖 Künstliche Intelligenz

🔒 Cybersecurity

🏢 Unternehmen

Artificial Intelligence • Cybersecurity • Enterprise

NEAR AI ist ein auf Datenschutz ausgerichtetes AI-Infrastrukturunternehmen, das vertrauliche Inferenz und autonome KI-Agenten für Unternehmen, Regierungen und AI-Anwendungen betreibt. Die NEAR AI Cloud und das IronClaw-Agenten-Framework führen Modelle und Workflows innerhalb hardware-gestützter Trusted Execution Environments (TEE) mit kryptographischer Isolation, keinem Bedienerzugang und hardware-signierter Beglaubigung zur unabhängigen Verifikation aus. NEAR AI bietet eine schlüsselfertige Plattform zur Bereitstellung privater Modelle, Automatisierung von wiederkehrenden Vorgängen, Integration mit internen Tools (Slack, E-Mail, Notion) und Bereitstellung regulierter oder souveräner Workloads über einen Marktplatz von Agenten für Finanzen, Recht, Betrieb, Forschung und Sicherheit.

Beschreibung

• Architect and maintain production high-traffic LLM serving systems • Optimize throughput, latency, and cost for leading open-source LLMs • Push the boundaries of how large language models are served • Contribute to decentralized and confidential machine learning infrastructure enabling user-owned AI • Help build highly scalable and efficient infrastructure for open-source AI at global scale

🎯 Anforderungen

• Strong hands-on experience in LLM inference, with expertise debugging and optimizing major inference engines such as SGLang, vLLM, or TensorRT • Deep knowledge of state-of-the-art GPU architectures • Ability to effectively exploit GPU architectures using PyTorch, Triton, CuTe, CUDA, etc. • Proven track record in designing and maintaining end-to-end high-traffic LLM serving systems • Strong problem-solving skills • Ability to communicate technical ideas clearly • Experience with Trusted Execution Environments (TEE) preferred as a nice-to-have • Active contribution to open-source LLM inference engines preferred as a nice-to-have

🏖️ Vorteile

• Interview accommodations available upon request

Jetzt Bewerben

Ähnliche Jobs

🕒 vor 2 Monaten

Olsson

1001 - 5000

🏗️ Bauwesen

Senior Engineer on Railroad Bridge team designing and delivering structural projects. Collaborating with project managers and clients while mentoring junior engineers and ensuring quality solutions.

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

Wand AI

51 - 200

🤖 Künstliche Intelligenz

🏢 Unternehmen

☁️ SaaS

Forward Deployed Engineer focused on designing and deploying AI solutions for enterprises. Involves hands-on technical work and strong customer engagement in a fast-paced startup environment.

🇺🇸 Vereinigte Staaten – Remote

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

👷🏻‍♀️ Ingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

Surge AI

51 - 200

🤖 Künstliche Intelligenz

🔌 API

☁️ SaaS

Lead Adversarial Engineer managing red teaming against frontier models and ensuring awareness of risks. Collaborating across teams to validate findings and improve security protocols in AI systems.

🇺🇸 Vereinigte Staaten – Remote

💰 €25.000.000 Series A im 2020-07

⏰ Vollzeit

🟠 Senior

👷🏻‍♀️ Ingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

YA Group

501 - 1000

💼 Beratung

🏗️ Bauwesen

🛡️ Versicherung

Senior Traffic Engineer at YA Group providing expert-level forensic consulting in traffic engineering. Evaluating roadway designs and ensuring compliance with engineering standards.

🇺🇸 Vereinigte Staaten – Remote

💰 Private equity im 2021-09

⏰ Vollzeit

🟠 Senior

👷🏻‍♀️ Ingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich

🕒 vor 2 Monaten

TRM Labs

201 - 500

₿ Crypto

📋 Compliance

🤝 B2B

Agent Engineer developing next-generation AI applications at TRM Labs. Focused on building robust AI infrastructures and agentic systems for investigative tasks.

🇺🇸 Vereinigte Staaten – Remote

💵 $200.000 - $275.000 / Jahr

⏰ Vollzeit

🟡 Mittelstufe

🟠 Senior

👷🏻‍♀️ Ingenieur

🗣️🇺🇸🇬🇧 Englisch erforderlich