La situación
La empresa había integrado la IA en el fondo de sus operaciones diarias - y en una pila creciente de facturas por token. Todas las cargas de trabajo se ejecutaban contra API de nube medidas por consumo: los costes crecían de forma lineal con el éxito, los datos sensibles cruzaban una frontera externa en cada llamada, y la capacidad, la latencia y el comportamiento de los modelos eran, en última instancia, decisiones de otros. Lo que empezó como la vía más rápida para adoptar IA se había convertido en una dependencia estructural.
El problema detrás del problema
Esta es una decisión de construir o alquilar, y la respuesta honesta cambia con la escala. Por debajo de cierto volumen sostenido, alquilar es lo correcto - lo decimos con frecuencia en las sesiones de diagnóstico. Esta empresa había pasado esa línea: cargas de trabajo predecibles y de gran volumen en las que el hardware propio se amortiza, requisitos de control de datos que desaconsejan una frontera externa y madurez operativa suficiente para gestionar su propia infraestructura. El diagnóstico puso precio al punto de corte antes de especificar una sola pieza de hardware.
Lo que estamos construyendo
Infraestructura de inferencia a medida - hardware especificado para el perfil real de carga de la empresa y no un pedido genérico de GPU - y la capa de plataforma que la hace utilizable: servicio de modelos, enrutado, monitorización y rutas de reserva. La migración avanza carga por carga: cada una se compara con su referencia en la nube en calidad, latencia y coste, se pasa a producción sobre la nueva infraestructura y solo entonces se aborda la siguiente.
La parte difícil
Migrar un negocio en marcha sin interrumpirlo. Cada carga de trabajo que se mueve es una de la que la empresa depende a diario, así que cada migración se entrega con una vía de retorno a la API de nube que sustituye, y el cambio definitivo solo se produce después de que la versión propia haya igualado su referencia en modo sombra en producción. La disciplina es deliberadamente aburrida - que es exactamente de lo que se trata en infraestructura.
En qué punto está
La colaboración sigue en curso: las primeras cargas de trabajo ya están en producción sobre el nuevo hardware, la cola de migración avanza y las cifras que importan - coste por carga de trabajo frente a la referencia en la nube, latencia y cuántos datos sensibles han dejado de salir de la empresa - se miden a medida que cada carga aterriza. Por nuestra propia regla, las cifras completas de antes y después se publicarán cuando estén las de después.