De la configuration de l’infrastructure
à l’inférence via un CLI.
Plateforme d’inférence GPU. Un prototype fonctionnel qui masquait l’infrastructure GPU, le model serving et le routage derrière une interface pour développeurs, bâti autour de vLLM.
- Contexte
- Un prototype indépendant de Koeo.
- Service
- Infrastructure d’inférence, outils pour développeurs, routage, scaling et automatisation.
- Secteur
- Infrastructure d’IA
- Spécialité
- Améliorer l’infrastructure d’IA
- Statut
- Prototype fonctionnel. Le développement a pris fin avant la mise en production.
Aperçu
Nous avons bâti un prototype qui permettait aux développeurs de travailler avec des modèles open source via un CLI et une API compatible OpenAI, sans assembler eux-mêmes l’infrastructure GPU. Les tests ont couvert plusieurs modèles de Hugging Face sur des GPU grand public et du hardware RTX 6000.
L’objectif commercial était de mieux utiliser la capacité GPU disponible et de soutenir une monétisation fondée sur l’inférence, plutôt que de simplement louer chaque GPU à l’heure.
Défi
Se lancer en inférence impliquait de configurer l’infrastructure, de charger un modèle et d’y connecter l’application. La plateforme devait prendre en charge ces étapes tout en offrant aux développeurs une interface simple.
Le côté de l’offre avait aussi besoin d’attentes de service définies. Un MOU avec un partenaire couvrait l’accès aux GPU pour les tests du prototype, l’accès en production étant conditionnel à des tests concluants.
Solution
Le prototype utilisait vLLM comme base d’inférence, avec le routage, le scaling et l’automatisation autour. Un CLI permettait aux développeurs de configurer l’accès et de commencer à travailler avec les modèles. Il pouvait aussi être utilisé depuis Claude Code ou connecté par MCP.
Le chargement du modèle demeurait une étape distincte et variait selon la taille du modèle. La plateforme s’appuyait sur les capacités PagedAttention de vLLM pour améliorer l’utilisation.
Résultats
Configuration pour développeurs en quelques minutes.
- Configuration du CLI
- L’installation et la configuration prenaient généralement quelques minutes
- Chargement du modèle
- Généralement 2 à 3 minutes, selon la taille du modèle
- Hardware testé
- GPU grand public et hardware RTX 6000
- Validation par un partenaire
- Un MOU signé pour l’accès aux GPU du prototype et un accès conditionnel en production
- Stade de livraison
- Prototype fonctionnel; le développement a pris fin avant la mise en production
Ces temps ont été observés pendant les tests du prototype et varient selon la taille du modèle. La configuration du CLI et le chargement du modèle sont des étapes distinctes. La performance en production, les gains d’utilisation et les économies n’ont pas été mesurés.
Expérience pertinente en model serving, en infrastructure GPU et en outils pour développeurs.