El AI Gateway es una API unificada y compatible con OpenAI para modelos de OpenAI, Anthropic, Google, xAI y DeepSeek — un endpoint, un token, un saldo. Abre la página AI Gateway en my.cubepath.com.
El valor está en lo que elimina: ni una cuenta, ni una clave, ni una relación de facturación, ni un SDK distinto por proveedor. Mantienes una sola integración y cambias de proveedor cambiando un nombre de modelo.
Empezar
- 1Crea un token de APIPulsa Create API Token para obtener una clave del gateway.
- 2Añade AI FundsRecarga tu saldo de AI Funds. El consumo es de pago por uso, facturado por token.
- 3Apunta tu SDK al gatewayUsa cualquier SDK compatible con OpenAI: pon la Base URL del gateway y tu token de CubePath, elige un modelo por su nombre y envía peticiones.
Como la API es compatible con OpenAI, la mayoría del código existente solo necesita cambiar la URL base y la clave — la forma de las peticiones y respuestas se mantiene.
Modelos
Explora el catálogo Models para ver qué hay disponible y cuánto cuesta. Cada entrada muestra:
- Precio por 1M de tokens, de entrada y de salida por separado. La salida suele costar varias veces más que la entrada, y por eso las respuestas largas salen más caras que los prompts largos.
- Ventana de contexto — cuánto puedes enviar en una petición.
- Salida máxima — el techo de una sola respuesta.
- Capacidades — streaming, visión, uso de herramientas.
ConsejoCambia de proveedor cambiando solo el nombre del modelo en tu petición. Tu token, tu endpoint y tu facturación siguen siendo exactamente los mismos, lo que abarata probar un modelo más económico frente al actual con tráfico real.
Vigilar el coste
El panel registra peticiones, tokens y coste, por día y por modelo, en los últimos 30 días.
Léelo por modelo y no en total. Lo habitual es descubrir que un único endpoint de tu aplicación — un resumidor, un clasificador que corre en cada petición — se lleva la mayor parte de la factura, y mover solo esa llamada a un modelo más pequeño cambia la cifra de forma apreciable.
NotaLa facturación es por token, no por petición. Una sola petición con mucho contexto cuesta bastante más que varias pequeñas, así que recortar lo que envías suele ser la mayor palanca disponible.
Buenas prácticas
- Usa el modelo más pequeño que pase tus evaluaciones, no el más grande que te puedas permitir. La diferencia de calidad suele ser menor que la de precio.
- Limita la salida máxima en endpoints donde una respuesta desbocada saldría cara.
- Saca los prompts del bucle cuando puedas. Cachear un resultado que volverás a necesitar es gratis; regenerarlo no.