La situation
L'entreprise avait ancré l'IA au cœur de ses opérations quotidiennes - et dans une pile croissante de factures au token. Chaque charge de travail s'exécutait sur des API cloud facturées à l'usage : les coûts augmentaient linéairement avec le succès, des données sensibles franchissaient une frontière externe à chaque appel, et la capacité, la latence et le comportement des modèles relevaient en dernier ressort des décisions d'un tiers. Ce qui avait été le chemin le plus rapide pour adopter l'IA était devenu une dépendance structurelle.
Le problème derrière le problème
C'est un arbitrage entre construire et louer, et la réponse honnête change avec l'échelle. En dessous d'un certain volume soutenu, louer est le bon choix - nous le disons régulièrement en session de diagnostic. Cette entreprise avait dépassé la ligne : des charges de travail prévisibles et à fort volume, où le matériel possédé s'amortit ; des exigences de maîtrise des données qui plaident contre une frontière externe ; et assez de maturité opérationnelle pour exploiter sa propre pile. Le diagnostic a chiffré ce point de bascule avant que le moindre matériel ne soit spécifié.
Ce que nous construisons
Une infrastructure d'inférence sur mesure - du matériel spécifié pour le profil de charge réel de l'entreprise plutôt qu'une commande de GPU générique - et la couche plateforme qui la rend exploitable : serving de modèles, routage, monitoring et repli. La migration avance charge par charge : chacune est benchmarkée contre sa référence cloud sur la qualité, la latence et le coût, mise en production sur la nouvelle pile, et seulement ensuite suivie de la charge suivante.
La difficulté
Migrer une activité en marche sans l'interrompre. Chaque charge de travail déplacée est une charge dont l'entreprise dépend au quotidien : chaque migration est donc livrée avec un chemin de retour vers l'API cloud qu'elle remplace, et la bascule n'a lieu qu'une fois que la version on-premise a égalé sa référence en mode shadow, en production. La discipline est délibérément ennuyeuse - c'est tout l'intérêt d'une infrastructure.
Où en est le projet
La mission est en cours : les premières charges de travail tournent en production sur le nouveau matériel, la file de migration avance, et les chiffres qui comptent - coût par charge de travail face à la référence cloud, latence, et volume de données sensibles qui ne sort plus de l'entreprise - sont mesurés à mesure que chaque charge atterrit. Conformément à notre propre règle, les résultats avant/après complets seront publiés quand les chiffres « après » seront disponibles.