La situazione
L'azienda aveva costruito l'AI dentro la propria operatività quotidiana - e dentro una pila crescente di fatture a token. Ogni carico di lavoro girava su API cloud a consumo: i costi crescevano linearmente con il successo, a ogni chiamata dati sensibili varcavano un confine esterno e capacità, latenza e comportamento dei modelli erano in ultima analisi decisioni di qualcun altro. Quella che era nata come la via più rapida per adottare l'AI era diventata una dipendenza strutturale.
Il problema dietro il problema
È una decisione tra costruire e affittare, e la risposta onesta cambia con la scala. Sotto un certo volume costante affittare è la scelta giusta - lo diciamo con regolarità nelle sessioni di diagnosi. Questa azienda era oltre quella soglia: carichi di lavoro prevedibili e ad alto volume, dove l'hardware di proprietà si ripaga; requisiti di controllo dei dati che sconsigliano un confine esterno; e una maturità operativa sufficiente per gestire uno stack proprio. La diagnosi ha dato un prezzo al punto di pareggio prima che venisse specificato un solo componente hardware.
Che cosa stiamo costruendo
Un'infrastruttura di inferenza su misura - hardware specificato sul profilo reale dei carichi di lavoro dell'azienda, non un ordine generico di GPU - e il livello di piattaforma che la rende utilizzabile: model serving, routing, monitoraggio e fallback. La migrazione procede un carico di lavoro alla volta: ognuno viene confrontato con la propria baseline cloud su qualità, latenza e costo, portato in produzione sul nuovo stack, e solo allora si passa al successivo.
La parte difficile
Migrare un'azienda in funzione senza interromperla. Ogni carico di lavoro spostato è un carico da cui l'azienda dipende ogni giorno: per questo ogni migrazione arriva con un percorso di rollback verso l'API cloud che sostituisce, e il passaggio definitivo avviene solo dopo che la versione on-premise ha eguagliato la propria baseline in modalità shadow, in produzione. La disciplina è volutamente noiosa - ed è esattamente il punto dell'infrastruttura.
A che punto siamo
La collaborazione è in corso: i primi carichi di lavoro sono in produzione sul nuovo hardware, la coda di migrazione avanza e i numeri che contano - costo per carico di lavoro rispetto alla baseline cloud, latenza e quanti dati sensibili non escono più dall'azienda - vengono misurati man mano che ogni carico atterra. Come da nostra regola, i confronti completi prima-dopo saranno pubblicati quando ci saranno i numeri del dopo.