Illustration : des cartes graphiques grand public montées sur un long établi, des câbles étiquetés, un wattmètre de banc et un ordinateur portable.
Une illustration du contexte, et non une photographie.

De la configuration de l’infrastructure
à l’inférence via un CLI.

Plateforme d’inférence GPU. Un prototype fonctionnel qui masquait l’infrastructure GPU, le model serving et le routage derrière une interface pour développeurs, bâti autour de vLLM.

Contexte
Un prototype indépendant de Koeo.
Service
Infrastructure d’inférence, outils pour développeurs, routage, scaling et automatisation.
Secteur
Infrastructure d’IA
Spécialité
Améliorer l’infrastructure d’IA
Statut
Prototype fonctionnel. Le développement a pris fin avant la mise en production.

Aperçu

Nous avons bâti un prototype qui permettait aux développeurs de travailler avec des modèles open source via un CLI et une API compatible OpenAI, sans assembler eux-mêmes l’infrastructure GPU. Les tests ont couvert plusieurs modèles de Hugging Face sur des GPU grand public et du hardware RTX 6000.

L’objectif commercial était de mieux utiliser la capacité GPU disponible et de soutenir une monétisation fondée sur l’inférence, plutôt que de simplement louer chaque GPU à l’heure.

Défi

Se lancer en inférence impliquait de configurer l’infrastructure, de charger un modèle et d’y connecter l’application. La plateforme devait prendre en charge ces étapes tout en offrant aux développeurs une interface simple.

Le côté de l’offre avait aussi besoin d’attentes de service définies. Un MOU avec un partenaire couvrait l’accès aux GPU pour les tests du prototype, l’accès en production étant conditionnel à des tests concluants.

Solution

Le prototype utilisait vLLM comme base d’inférence, avec le routage, le scaling et l’automatisation autour. Un CLI permettait aux développeurs de configurer l’accès et de commencer à travailler avec les modèles. Il pouvait aussi être utilisé depuis Claude Code ou connecté par MCP.

Le chargement du modèle demeurait une étape distincte et variait selon la taille du modèle. La plateforme s’appuyait sur les capacités PagedAttention de vLLM pour améliorer l’utilisation.

Résultats

Configuration pour développeurs en quelques minutes.

Configuration du CLI
L’installation et la configuration prenaient généralement quelques minutes
Chargement du modèle
Généralement 2 à 3 minutes, selon la taille du modèle
Hardware testé
GPU grand public et hardware RTX 6000
Validation par un partenaire
Un MOU signé pour l’accès aux GPU du prototype et un accès conditionnel en production
Stade de livraison
Prototype fonctionnel; le développement a pris fin avant la mise en production

Ces temps ont été observés pendant les tests du prototype et varient selon la taille du modèle. La configuration du CLI et le chargement du modèle sont des étapes distinctes. La performance en production, les gains d’utilisation et les économies n’ont pas été mesurés.

Expérience pertinente en model serving, en infrastructure GPU et en outils pour développeurs.