Une plateforme IA à la demande, 100 % open source : du GPU local au cloud souverain
samedi 14 novembre15:00 — 15:5555 minSalle A202
Description
Vous voulez déployer de l'IA générative pour vos équipes, et chaque option coince. Le tout-cloud propriétaire est puissant, mais vos données partent chez un tiers, la facture se disperse entre dix fournisseurs et vous êtes captif de leurs API. Le tout-local est souverain et maîtrisé, mais borné par votre budget GPU et par les modèles que vous pouvez réellement faire tourner.
Et si on refusait de choisir ?
Je présente une plateforme d'IA « à la demande » qui couvre toute la chaîne, du GPU sous le bureau jusqu'aux grands clouds, avec une brique d'orchestration 100 % open source. Trois cartes RTX 6000 Pro font tourner des modèles en open weights (famille Qwen) en interne via vLLM. LiteLLM sert de passerelle unique : un seul endpoint compatible OpenAI, une simple clé d'API, et derrière, le routage vers le bon modèle selon l'usage. Open WebUI donne aux utilisateurs finaux une interface de chat auto-hébergée, pendant que les développeurs consomment exactement le même socle via l'API — ils ne voient qu'une URL et un endpoint.
La logique est en paliers : d'abord les modèles 100 % internes, puis des modèles open weights plus gros hébergés en France (Scaleway, OVH) pour la souveraineté, et enfin, seulement quand c'est nécessaire, typiquement le développement agentique, un relais vers les clouds américains. Le tout piloté au même endroit : qui a droit à quels modèles, quelle consommation, quels quotas, et une facturation simplifiée à un seul jeton par fournisseur.
Je partagerai l'architecture réelle, les choix, les pièges, et un retour d'expérience concret : 4 mois de POC et 2 mois de production au compteur au moment du talk. Vous repartirez avec un schéma reproductible pour bâtir votre propre passerelle IA souveraine et réversible, et une idée claire de là où l'open source vous rend libre, et de là où il vous donne surtout du levier sur le propriétaire.
Public visé
Développeurs et experts en hébergement souverain
Intervenant·e
Julien Del Rio
Consultant IA au sein du Programme d'IA interne de Numih France, je déploie l'IA générative pour les métiers avec une obsession : la souveraineté et l'efficacité. Au quotidien, je construis et industrialise des architectures LLM locales et souveraines (vLLM, modèles open weights, automatisation n8n), après un parcours de 15 ans qui m'a mené du développement Android à la direction technique, en passant par l'entrepreneuriat et les clusters numériques.
Fondateur et organisateur du DevFest Toulouse et du GDG Toulouse, je suis un engagé pour l'écosystème tech toulousain.
Dans le même créneau
- Salle A001Rust: Peut-on RIIR de tout ?Igor Laborie
- Salle A002Des MP3 d'eMule au web décentralisé : la folle histoire du Peer-to-PeerLaurent Grangeau
- Salle A201Développeur Blender & glTF: Retour d'expérienceJulien Duroure
- Salle A203Faire des applis full-stack sans serveurGwenn Le Bihan
- Salle A302Mettez à jour vos systèmes embarqués en toute sécurité avec RAUCThomas Bonnefille
- Salle A303OpenWeb : rendre accessible les données des silosAntoine Duparay (Fla)
- Salle A304Urcheon : construire les données d’un jeu vidéo, des sources au paquet distribuéThomas Debesse
- Salle B00Art algorithmique : de p5.js à des expos à Londres et New YorkCamille Roux
- Salle B207Qu’est-ce qu’une IA générative libre ?Bertrand Boisvert
- Salle B208Les plateformes passent, les podcasts restentBenjamin Bellamy et Walid Nouh
- Salle C002Les droits d'auteurs en Europe, l'affaire Like c. Google et l'entrainement des IA générativesMichaël Scherer
Cette session vous intéresse ?
L'entrée est libre et gratuite, mais l'inscription nous aide à préparer au mieux votre venue.
S'inscrire gratuitement— 14 & 15 novembre 2026