Situacija
Kompanija je AI ugradila duboko u svakodnevno poslovanje — i u sve deblji svežanj faktura po tokenu. Svaki workload išao je preko cloud API-ja koji se naplaćuju po potrošnji: trošak je rastao linearno sa uspehom, osetljivi podaci prelazili su spoljnu granicu pri svakom pozivu, a kapacitet, latencija i ponašanje modela bili su na kraju tuđe odluke. Ono što je počelo kao najbrži način da se AI uvede postalo je strukturna zavisnost.
Problem ispod problema
Ovo je odluka o tome da li graditi ili iznajmljivati, a pošten odgovor menja se sa obimom. Ispod određenog stalnog obima, iznajmljivanje je ispravno — to redovno kažemo i na dijagnostičkim sesijama. Ova kompanija bila je preko te granice: predvidivi workload-i velikog obima kod kojih se sopstveni hardver isplati, zahtevi za kontrolom podataka koji govore protiv spoljne granice i dovoljno operativne zrelosti da vodi sopstveni stack. Dijagnoza je izračunala tačku preloma pre nego što je specificiran ijedan komad hardvera.
Šta gradimo
Namensku infrastrukturu za inferenciju — hardver specificiran prema stvarnom profilu opterećenja kompanije, a ne generička GPU narudžbina — i platformski sloj koji je čini upotrebljivom: serviranje modela, rutiranje, monitoring i fallback. Migracija ide workload po workload: svaki se meri u odnosu na svoju cloud osnovicu za kvalitet, latenciju i trošak, prebacuje u produkciju na novom stack-u, i tek onda sledi naredni.
Najteži deo
Preseliti posao koji radi, a da se pritom ne prekine. Svaki workload koji se seli kompaniji treba svakodnevno, pa svaka migracija ide sa putanjom za povratak na cloud API koji zamenjuje, a prebacivanje se dešava tek kada on-prem verzija dostigne svoju osnovicu u produkcionom shadow režimu. Disciplina je namerno dosadna — a to je i poenta infrastrukture.
Dokle se stiglo
Angažman je u toku: prvi workload-i rade u produkciji na novom hardveru, red za migraciju se pomera, a brojevi koji su bitni — trošak po workload-u u odnosu na cloud osnovicu, latencija i koliko osetljivih podataka više ne napušta kuću — mere se kako svaki workload sleće. Po sopstvenom pravilu, kompletne tvrdnje o stanju pre i posle objavljujemo kada brojke sa druge strane budu potpune.