Programme IA sur mesureC'est gratuit →

Hippocratic AI

Publiée il y a 8 jours · Menlo Park

LLM Inference Engineer (Mid, Senior, Staff)

  • Menlo Park

Description du poste

As HAI’s LLM Inference Engineer, you will own the serving infrastructure that determines whether our breakthrough healthcare AI reaches patients efficiently and reliably You’ll optimize the systems that translate raw model capability into sub-100ms responses—making the difference between conversational experiences that feel natural and those that feel broken This role exists because inference optimization at scale is where research meets reality: your work directly determines latency, cost, and availability for millions of patient conversations across healthcare systems Own your first major outcome: By day 90, you will have shipped a measurable improvement to our inference serving stack (reduced latency, improved throughput, or optimized cost per inference), validated the gains across our production deployment scenarios, and established the performance optimization roadmap that will guide infrastructure investment Drive lasting impact: At 12 months, you will have designed and deployed advanced serving architectures (disaggregated inference, optimized caching, speculative decoding) that meaningfully improve patient experience and operational efficiency, contributed novel optimization techniques that become part of our core infrastructure, and made our serving stack a durable competitive advantage in healthcare AI deployment You’ll work alongside systems engineers, ML researchers, and infrastructure experts who are obsessed with making AI systems fast, reliable, and cost-effective. This is a team that values deep technical rigor, continuous benchmarking, and solving hard systems problems that have real impact on patient experience and business unit economics Design and implement multi-node serving architectures for distributed LLM inference Optimize multi-LoRA serving systems Apply advanced quantization techniques (FP4/FP6) to reduce model footprint while preserving quality Implement speculative decoding and other latency optimization strategies Develop disa

Annonce publiée sur Welcome to the Jungle et reprise par Intelligence Academy. Seule l'annonce d'origine fait foi ; nous ne sommes pas l'employeur.

Offres semblables

aujourd'hui
  • Fontenay-sous-Bois
  • Freelance

Description du poste Taux journalier (TJM): 450€ Accompgner l'équipe Cyber Authorité CIO pilote l'outillage cyber du Groupe. Elle apporte une expertise de production de rapports et de rédaction de scripts permettant l'execution de controles cyber. Pour cela l'entité CIO à la charge de collecter les données CYBER des di

via Adzuna
aujourd'hui
  • Aubagne
  • CDI
  • 42 k€ – 48 k€ / an

Description du poste Salaire: 42K€ à 48K€ Envie de rejoindre une équipe où Intelligence Artificielle, Cloud et développement Full-Stack se rencontrent autour de projets à forts enjeux ? Cette opportunité est faite pour vous ! Nous poursuivons notre développement et recherchons actuellement un.e Ingénieur Développeur d

via Adzuna
  • Deux-Sèvres
  • 36 k€ – 45 k€ / an

Vos missions Vous prenez en charge le développement commercial de nos offres de services, avec une forte orientation Data, IA et Cybersécurité. Vous serez notamment amené(e) à : - développer les comptes clients sur lesquels Sapiens Group est déjà référencé ; - identifier de nouveaux décideurs, managers et porteurs de p

via Adzuna
  • Six-Fours-les-Plages
  • Stage

Rejoignez la direction ES (Équipements Systèmes) et le site d'Ollioules qui accueille des activités de conception, de développement et d'intégration à bord de systèmes informatiques de haute technologie équipant les navires de la Marine nationale et des clients internationaux. Naval Group a construit un réseau d'Open.L

via Adzuna

Toutes les offres Ingénieur / développeur IA →