Senior AI/LLM Engineer - IA Générative & Agentique (RAG, Fine-tuning, Inférence) - Freelance (H/F)
CONTEXTE Vous rejoignez la division IA d'une grande banque d'investissement européenne, au sein de la plateforme CIB. L'équipe Data Science conçoit et délivre des produits IA déjà en production : extraction automatisée de données à partir de documents financiers, chatbot agentique et génération de données. Ces produits sont utilisés au quotidien par les équipes métiers - vos améliorations ont un impact direct et mesurable. VOS MISSIONS - Concevoir, fine-tuner et améliorer des pipelines RAG et agentiques en production - Travailler sur l'inférence de modèles : déploiement de LLMs sur GPU (vLLM), optimisation latence / débit / coûts - Mettre en place l'évaluation et l'observabilité des pipelines IA (Phoenix/Arize, DSPy) : datasets d'évaluation, métriques de qualité, boucles d'amélioration continue - Améliorer en continu la qualité d'extraction et les performances des agents - Partager vos connaissances et coacher les profils moins expérimentés POURQUOI CETTE MISSION - Des produits GenAI réellement en production, dans un environnement exigeant et à fort impact - Une stack à l'état de l'art : vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize) - Un vrai mandat technique : du delivery, pas des slides - L'opportunité d'apporter un regard neuf à une équipe qui investit sérieusement dans l'IA STACK : Python, vLLM, LangGraph, Google ADK, DSPy, Phoenix (Arize), FastAPI, Kubernetes PROCESSUS DE RECRUTEMENT 1) Test technique Python sur HackerRank. 2) Entretien en présentiel à Paris, incluant des exercices de mathématiques et de code sur table, sans assistance IA. 3) Vérification des références techniques 1) 5 ans d'expérience minimum, dont au moins 3 ans en entreprise sur des sujets agentique, RAG, IA générative 2) Compréhension profonde du fonctionnement des LLMs (architecture transformer, attention, tokenisation, décodage, quantization) - capable de l'expliquer et de le démontrer 3) Expérience concrète de l'inférence en production : vLLM, GPU, optimisation de performances 4) Pratique du fine-tuning (SFT, LoRA/QLoRA) et de l'amélioration de systèmes RAG en production 5) Solides bases en mathématiques et Python (testées en entretien présentiel) 6) Références techniques vérifiables
Cette annonce provient de France Travail. Voir l'annonce originale ↗