Ingénieur Cloud & MlOps
le1817 · Lyon, Auvergne-Rhone-Alpes, France
About The Role
Rejoignez le 1817, la digital factory du groupe Vicat, un leader mondial de l'industrie du ciment. En tant qu'Ingénieur Cloud & MLOps, vous serez responsable de la conception, de la construction et de l'exploitation de notre plateforme, ainsi que de l'industrialisation et du déploiement de nos solutions. Vous travaillerez en étroite collaboration avec une équipe multidisciplinaire et aurez un impact direct sur l'optimisation de nos processus industriels.
- Concevoir, construire et opérer la plateforme sur laquelle tournent nos solutions, du cloud au datacenter interne jusqu’aux équipements de terrain.
- Rendre reproductible le déploiement d’une solution sur un nouveau site ou chez un nouveau client, en assurant l'orchestration élastique et les standards réutilisables.
- Industrialiser la mise en production des modèles, en mettant en place des chaînes de déploiement, versioning et rollback, et en automatisant le réentraînement.
**Environnement technique de l’équipe**
Cloud (AWS) et environnements on-premise · conteneurisation (Docker) et orchestration (Kubernetes) · Infrastructure as Code (Terraform, Ansible ou équivalent) · chaînes CI/CD (GitLab CI, GitHub Actions ou équivalent) · déploiement continu (Helm, ArgoCD / Flux ou équivalent) · Linux · observabilité (Prometheus, Grafana, Loki ou équivalent) · Python · Git et pratiques de développement collaboratif · registry de modèles et suivi d’expérimentations (MLflow ou équivalent)
**Formation et expérience**
- Formation supérieure Bac+5 : école d’ingénieur ou master en informatique, systèmes distribués, infrastructure, data engineering ou data science
- Plus de 3 ans d’expérience en ingénierie de plateforme, cloud, DevOps, SRE et 3 ans en MLOps, dont une expérience significative de systèmes réellement exploités en production, avec ce que cela implique de mises à jour, d’incidents et de reprises
**Compétences techniques indispensables**
- Conception et exploitation d’une plateforme cloud : réseau, identités et droits, secrets, environnements, coûts
- Conteneurisation et orchestration : Docker, Kubernetes
- Automatisation et Infrastructure as Code
- Conception et exploitation de chaînes d’intégration et de déploiement continus
- Administration Linux, bases solides en réseau et en sécurité – suffisantes pour dialoguer avec les équipes IT et OT
- Mise en place d’une chaîne d’observabilité : métriques, journaux, alerting
- Pratique de l’exploitation : gestion d’incidents, astreinte ou permanence, post-mortems, sauvegarde et restauration
- **Compréhension des contraintes propres aux systèmes ML en production** : versioning conjoint du code, des données et des modèles ; dérive ; dépendance à la qualité des flux entrants ; validation qui ne se réduit pas à des tests unitaires. Il n’est pas attendu que vous entraîniez les modèles, mais que vous sachiez ce qui casse quand ils tournent
- Maîtrise de Python et des pratiques de développement logiciel : code testé, versionné, documenté, pensé pour être exploité par d’autres
- Anglais lu et parlé
**Compétences techniques appréciées**
- Pratique des outils MLOps : registry de modèles, suivi d’expérimentations, lineage, détection de dérive, automatisation du réentraînement
- Déploiement et exploitation en environnement contraint : edge, ressources limitées, connectivité intermittente
- Connaissance des environnements industriels et de la séparation des réseaux IT/OT
- Gestion de ressources de calcul mutualisées, notamment GPU
- Démarche FinOps sur des charges de calcul variables
- Culture data science suffisante pour comprendre ce que fait un modèle et dialoguer avec ceux qui le construisent
- Sensibilité aux exigences de conformité et d’audit (AI Act, audits internes)
**Compétences comportementales**
- **Sens du service et de la plateforme** : ce qui est construit est utilisé quotidiennement par d’autres ; sa qualité se mesure à l’autonomie qu’il leur donne
- **Sens du concret** : préférer une chaîne simple, comprise et réellement exploitée à une architecture élégante que personne ne sait opérer
- **Fiabilité et sens des responsabilités** : ce qui tourne sur un site de production ne s’arrête pas sans conséquence
- **Calme en incident** : savoir rétablir d’abord, comprendre ensuite, et documenter pour que cela ne recommence pas
- **Culture produit** : penser dès la conception à la réutilisation, ce qui est construit pour un site doit pouvoir servir ailleurs
- **Curiosité pour le procédé industriel** : envie de comprendre les contraintes d’exploitation, d’aller en salle de contrôle et d’écouter ceux qui conduisent l’installation
- **Sens du collectif et pédagogie** : rendre les autres autonomes plutôt que rester le passage obligé
- **Autonomie et responsabilité** : assumer ses développements jusqu’à leur exploitation en production
Similar roles you might like
See all →This is an external listing. JobSpring does not represent or verify the employer. Report this listing
