← Volver a velar.run

Velar Cloud

Una nube GPU serverless que construimos y operamos en 2025–26. Qué era, qué nos enseñó y dónde está hoy.

Qué construimos

Velar Cloud permitía correr una función de Python en una GPU con un decorador. Debajo: un motor de facturación por segundo que medía cada job de GPU al segundo exacto y escalaba a cero entre llamadas; una caché de imágenes por content-hash que bajó los redeploys a menos de 15 segundos; fan-out en paralelo de una llamada de Python sobre 50 GPUs; y endpoints persistentes que mantenían los modelos calientes en VRAM, para que el tráfico de producción nunca pagara un cold start.

Qué nos enseñó operarla

El tiempo idle de la GPU es la factura. La mayor parte de lo que pagaban los clientes era capacidad esperando trabajo, y medir por segundo hizo visible ese desperdicio por primera vez.

Los rate limits y los cold starts son las caídas. Casi todos los incidentes que atendimos fueron uno de los dos, no fallas de hardware. Las herramientas que importaron fueron las aburridas: dashboards de utilización, atribución de gasto por job y runbooks para los modos de falla que se repetían.

Dónde está hoy

Velar Cloud está en pausa en 2026 mientras el equipo hace ingeniería de confiabilidad y costos para clientes. La plataforma sigue sosteniendo nuestros engagements gestionados y la lista de espera del producto sigue abierta.

Unirse a la lista de espera →