Skip to content

Migracija kompanijskog AI-ja na sopstveni hardver

Angažman u toku: selimo kompletne AI workload-e jedne kompanije sa cloud API-ja koji se naplaćuju po potrošnji na namenski on-prem hardver za inferenciju — zbog kontrole troška, kontrole podataka i predvidivog kapaciteta.

AI rešenjaPosvećen timU toku
u toku
status angažmana
on-prem
namenski hardver za inferenciju
workload po workload
migracija, u produkciji
u kući
gde podaci sada ostaju

Situacija

Kompanija je AI ugradila duboko u svakodnevno poslovanje — i u sve deblji svežanj faktura po tokenu. Svaki workload išao je preko cloud API-ja koji se naplaćuju po potrošnji: trošak je rastao linearno sa uspehom, osetljivi podaci prelazili su spoljnu granicu pri svakom pozivu, a kapacitet, latencija i ponašanje modela bili su na kraju tuđe odluke. Ono što je počelo kao najbrži način da se AI uvede postalo je strukturna zavisnost.

Problem ispod problema

Ovo je odluka o tome da li graditi ili iznajmljivati, a pošten odgovor menja se sa obimom. Ispod određenog stalnog obima, iznajmljivanje je ispravno — to redovno kažemo i na dijagnostičkim sesijama. Ova kompanija bila je preko te granice: predvidivi workload-i velikog obima kod kojih se sopstveni hardver isplati, zahtevi za kontrolom podataka koji govore protiv spoljne granice i dovoljno operativne zrelosti da vodi sopstveni stack. Dijagnoza je izračunala tačku preloma pre nego što je specificiran ijedan komad hardvera.

Šta gradimo

Namensku infrastrukturu za inferenciju — hardver specificiran prema stvarnom profilu opterećenja kompanije, a ne generička GPU narudžbina — i platformski sloj koji je čini upotrebljivom: serviranje modela, rutiranje, monitoring i fallback. Migracija ide workload po workload: svaki se meri u odnosu na svoju cloud osnovicu za kvalitet, latenciju i trošak, prebacuje u produkciju na novom stack-u, i tek onda sledi naredni.

Oblik sistema: namenski specificiran hardver za inferenciju · sloj za serviranje i rutiranje modela · merenje svakog workload-a u odnosu na cloud osnovicu · monitoring, planiranje kapaciteta i fallback putanje

Najteži deo

Preseliti posao koji radi, a da se pritom ne prekine. Svaki workload koji se seli kompaniji treba svakodnevno, pa svaka migracija ide sa putanjom za povratak na cloud API koji zamenjuje, a prebacivanje se dešava tek kada on-prem verzija dostigne svoju osnovicu u produkcionom shadow režimu. Disciplina je namerno dosadna — a to je i poenta infrastrukture.

Dokle se stiglo

Angažman je u toku: prvi workload-i rade u produkciji na novom hardveru, red za migraciju se pomera, a brojevi koji su bitni — trošak po workload-u u odnosu na cloud osnovicu, latencija i koliko osetljivih podataka više ne napušta kuću — mere se kako svaki workload sleće. Po sopstvenom pravilu, kompletne tvrdnje o stanju pre i posle objavljujemo kada brojke sa druge strane budu potpune.

Da li vam AI računi rastu brže od AI vrednosti?

Dijagnostička sesija je besplatna — i počinje traženjem vaše tačke preloma između gradnje i iznajmljivanja.