LLM privé en production : choisir l’architecture et l’équipe qui l’exploitera
Déployer un modèle de langage en production se décide en trois temps : l’architecture (API d’un fournisseur, service managé d’un cloud, ou modèle ouvert hébergé sur vos GPU), la chaîne qui alimente le modèle en documents fiables, et l’exploitation, qui surveille la qualité des réponses et le coût par requête. Le prestataire doit savoir faire les trois, ou s’associer à qui sait.
Par la rédaction d’agencedevops.fr · données vérifiées le · méthode
Trois architectures possibles
| Architecture | Atouts | Limites |
|---|---|---|
| API d’un fournisseur de modèles | démarrage immédiat, modèles les plus récents, paiement à la requête | données envoyées hors de votre infrastructure, dépendance aux évolutions du fournisseur |
| Service managé d’un cloud (par exemple Amazon Bedrock) | modèles appelés dans votre environnement cloud, contrôles d’accès et journalisation intégrés | catalogue de modèles propre à chaque cloud, coût à la requête |
| Modèle ouvert hébergé sur vos GPU, servi par un moteur comme vLLM | données gardées chez vous, version du modèle maîtrisée, coût fixe à fort volume | GPU à réserver et à exploiter, compétences rares, modèles parfois moins performants |
Pour une première mise en production, beaucoup d’entreprises commencent par un service managé, puis hébergent un modèle ouvert quand le volume ou la sensibilité des données le justifient. Les clouds français proposent aussi des instances GPU, utiles quand la localisation des données compte.
La recherche documentaire augmentée
La plupart des projets d’entreprise ne réentraînent pas de modèle : ils lui donnent accès à vos documents au moment de répondre. Cette chaîne, dite RAG, a ses propres étapes : extraction et découpage des documents, calcul des représentations vectorielles, base de recherche, sélection des passages pertinents, puis génération. La qualité de la réponse dépend davantage de cette chaîne que du modèle. Un bon prestataire commence par un jeu de questions de test avec les réponses attendues, et mesure chaque changement par rapport à ce jeu.
Exploiter un LLM en production
- Évaluer en continu la justesse des réponses sur un jeu de référence, à chaque changement de modèle, de consigne ou de documents.
- Surveiller le coût par requête et poser des plafonds, par utilisateur et par jour.
- Journaliser les questions et réponses, dans le respect des règles de protection des données.
- Encadrer les agents : un agent qui agit sur vos systèmes ne doit déclencher seul aucune action sensible.
- Se protéger des injections d’instructions cachées dans les documents ou les pages consultées, un risque que l’ANSSI décrit dans ses recommandations sur l’IA générative.
Le coût
Les missions freelance MLOps relevées entre août et octobre 2026 affichent un TJM médian de 522 € HT, parmi les plus élevés de notre relevé. Une première mise en production d’un assistant documentaire demande souvent quelques semaines de travail ; l’exploitation dépend de l’architecture : une instance GPU dédiée se paie en continu, une API à la requête. Faites chiffrer les deux scénarios sur votre volume prévu.
| Mot-clé de la mission | Offres | 1er quartile | Médiane | 3e quartile |
|---|---|---|---|---|
| MLOps | 36 | 468 € | 522 € | 575 € |
| Architecte cloud | 24 | 488 € | 540 € | 600 € |
| Ingénieur DevOps | 269 | 414 € | 475 € | 525 € |
Source : offres de missions freelance publiées sur Free-Work affichant un TJM en euros, en France, relevé du 2 octobre 2026 (offres publiées entre le 14 août 2026 et le 2 octobre 2026). Milieu de la fourchette affichée ; ce sont des TJM proposés par les donneurs d’ordre, hors marge d’agence.
Entreprises classées à consulter
Les entreprises qui ont une page de service consacrée à l’IA ou au MLOps, notées avec notre barème public :
| Rang | Entreprise | Registre | Score |
|---|---|---|---|
| 1 | Orange Business | siège à Issy-les-Moulineaux, créée en 1991, 10 000 salariés et plus | 70 |
| 2 | Claranet | siège à Cesson-Sevigne, créée en 1998, 500 à 999 salariés | 69 |
| 3 | Cloud Temple | siège à Puteaux, créée en 2017, 100 à 199 salariés | 69 |
| 4 | Inherent | siège à Maxeville, créée en 1981, 500 à 999 salariés | 67 |
| 5 | BT Blue | siège à Chateaubourg, créée en 2005, 100 à 199 salariés | 61 |
| 6 | Theodo Cloud | siège à Paris, créée en 2007, 200 à 249 salariés | 61 |
| 7 | Alter Way | siège à Asnieres-sur-Seine, créée en 2006, 100 à 199 salariés | 60 |
| 8 | Stack Labs | siège à Paris, créée en 2002, 2 000 à 4 999 salariés | 58 |
Le classement complet est sur la page agences MLOps. Pour des données sensibles, voir aussi le guide SecNumCloud.
Questions fréquentes
Quelle agence peut déployer un LLM ou des agents IA sur notre cloud ?
Une équipe qui réunit l’infrastructure, les données et l’évaluation des modèles. Notre classement MLOps note les entreprises qui ont une offre dédiée avec un barème public ; demandez-leur une référence en production depuis plusieurs mois.
Faut-il héberger son propre modèle ?
Pas nécessairement. Une API ou un service managé suffit pour beaucoup d’usages. Héberger un modèle ouvert se justifie quand les données ne doivent pas sortir de votre infrastructure, que les volumes sont élevés, ou que vous voulez maîtriser la version du modèle dans la durée.
Combien coûte un LLM privé ?
La prestation se chiffre en jours, au TJM médian MLOps relevé de 522 € HT. L’exploitation dépend surtout des GPU : une instance dédiée tourne en continu, alors qu’une API se paie à la requête. Faites calculer les deux pour votre volume réel.
Quels risques de sécurité pour un système d’IA générative ?
L’ANSSI recommande notamment de cloisonner le système, de maîtriser la chaîne d’approvisionnement des modèles et des données, de journaliser les échanges et de ne pas laisser le modèle déclencher seul des actions sensibles. Les injections d’instructions cachées dans les documents sont un risque propre à ces systèmes.
Sources
- ANSSI, recommandations de sécurité pour un système d’IA générative : cyber.gouv.fr/publications/recommandations-de-securite-pour-un-systeme-dia-generative
- AWS, Amazon Bedrock : aws.amazon.com/fr/bedrock/
- vLLM, documentation : docs.vllm.ai/
- OVHcloud, instances GPU : ovhcloud.com/fr/public-cloud/gpu/
- Free-Work, missions freelance MLOps publiées (relevé) : free-work.com/fr/tech-it/jobs