¿Cambiar de proveedor de IA es un lío? Un AI Gateway para monitorización, caché y failover (costes -40%)

Cuando OpenAI te limita el rate, cambiar openai.chat.completions.create por anthropic.messages.create de Claude no es trivial: los formatos de petición y la estructura de parámetros son distintos. Hay que probar todo, y si vuelves atrás, otra vez lo mismo.
Con tres o más proveedores de IA, el control de costes se descontrola. ¿Qué equipo gasta más? ¿Cuántas peticiones son repetidas? ¿Por qué la factura pasó de 500 a 8.000 dólares? Las consolas de cada proveedor no lo responden.
AI Gateway es la entrada unificada: una sola interfaz para varios proveedores, failover automático, caché inteligente y un panel donde monitorizar cada gasto. Este artículo compara Cloudflare, Portkey y Alibaba Cloud Higress, con código de integración completo.
¿Por qué necesitas AI Gateway? Tres dolores reales
Dolor 1: Cambiar entre proveedores es una pesadilla
Seguro que te ha pasado: el proyecto empezó con OpenAI GPT-4, luego descubriste que Claude de Anthropic rinde mejor en ciertas tareas y quieres probar. Abres el código y te entra el pánico.
OpenAI se llama así:
const openai = new OpenAI({apiKey: 'sk-xxx'});
const response = await openai.chat.completions.create({
model: "gpt-4",
messages: [{role: "user", content: "Hello"}]
});
Claude es así:
const anthropic = new Anthropic({apiKey: 'sk-ant-xxx'});
const response = await anthropic.messages.create({
model: "claude-3-5-sonnet-20241022",
max_tokens: 1024,
messages: [{role: "user", content: "Hello"}]
});
¿Ves? Hasta la estructura base es distinta, y encima hay diferencias de parámetros. Si tienes decenas de llamadas a IA en el código, el cambio te rompe. Peor aún: Google Gemini, Cohere, Azure OpenAI… cada API tiene su formato. ¿Cómo aguantas eso?
Los datos no mienten: el 70% de las aplicaciones de IA usan más de dos proveedores de modelos. ¿Por qué? Cada modelo destaca en algo distinto: GPT-4 caro pero potente, Claude más barato para lotes, Gemini con cuota gratuita alta para pruebas… tienes que alternar. Pero el coste de cambiar es tan alto que desespera.
Dolor 2: El agujero negro de costes
Un caso real: una empresa amiga montó un chatbot de IA; al principio 500 dólares al mes, normal. De repente 8.000 en un mes y el jefe explotó. Tras investigar, un desarrollador había dejado logs en pruebas: cada petición llamaba dos veces a la API, sin caché, y las mismas preguntas se repetían una y otra vez.
Eso es no tener monitorización unificada. No sabes:
- ¿Cuánto gastas al día? Cuando llega la factura, ya es tarde
- ¿Qué equipo consume más? Producto prueba a lo loco y tú no te enteras
- ¿Qué peticiones son las más caras? La generación larga con GPT-4 se come el presupuesto, pero no lo ves
- ¿Cuánto se desperdicia? El 40% son peticiones repetidas quemando dinero, invisible
"El gasto empresarial en IA crece un 300% interanual; el 40% se desperdicia en peticiones repetidas"
Dolor 3: Punto único de fallo a punto de explotar
En 2024 OpenAI cayó al menos 6 veces, unas 2 horas de media cada vez. Si tu servicio depende solo de OpenAI:
- A las 4 de la madrugada, las alertas saltan
- Llegan quejas de clientes
- Miras la página de estado de OpenAI sin poder hacer nada
- El jefe pregunta qué pasa; respondes: «OpenAI está caído, no hay más»
- El jefe: «¿Y por qué no tienes respaldo?»
- Tú: «…»
Sin tolerancia a fallos eres pasivo. Si cae el modelo principal, cae el negocio; no hay Plan B. ¿Te da miedo?
Con un AI Gateway configurado con failover automático, si cae OpenAI cambia a Claude; si Claude también falla, a Gemini. Todo en segundos y el usuario ni lo nota. La disponibilidad pasa del 95% a más del 99,9%.
Funciones clave de AI Gateway
Tras tantos dolores, ¿cómo lo resuelve AI Gateway? Es una capa intermedia entre tu aplicación y los proveedores de IA que se encarga del trabajo sucio.
Función 1: API unificada — un solo código para todo
Es lo mejor. Sigues usando el SDK de OpenAI, pero cambiando una línea de baseURL llamas a Claude, Gemini o más de 200 modelos.
Con Portkey Gateway, el código queda así:
const openai = new OpenAI({
apiKey: 'your-openai-key',
baseURL: "http://localhost:8787/v1", // ¡solo cambia esta línea!
defaultHeaders: {
'x-portkey-provider': 'openai' // ¿Claude? Cambia a 'anthropic'
}
});
// El resto del código igual
const response = await openai.chat.completions.create({
model: "gpt-4",
messages: [{role: "user", content: "Hello"}]
});
¿Quieres Claude? Cambia x-portkey-provider a anthropic y el model a claude-3-5-sonnet-20241022. Listo. Sin tocar la lógica de negocio.
Cloudflare es similar: apunta baseURL al endpoint de su Gateway. Así alternas OpenAI, Anthropic, Google y Azure sin reescribir montones de código.
Función 2: Caché inteligente — preguntas repetidas sin coste
Ahorra de verdad. AI Gateway recuerda preguntas y respuestas anteriores; si alguien repite la misma, devuelve la caché sin llamar a la API ni gastar tokens.
Dos tipos de caché:
- Exacta: solo si el texto es idéntico. Preguntas «¿Qué es la IA?» y la próxima vez con esas mismas palabras, caché directa
- Semántica: basta parecido. «¿Qué es la IA?» y «¿Qué es inteligencia artificial?» cuentan como lo mismo
"El precio con acierto de caché de Qwen es solo el 40% del precio original"
Muy útil en chatbots: «¿Cómo devolver?», «¿Cuánto cuesta el envío?» — con caché en preguntas frecuentes, el coste puede bajar más del 60%.
Ojo: no caches lo que debe ser en tiempo real. «¿Qué tiempo hace hoy?», «¿Últimas noticias?» — ahí la caché miente. AI Gateway suele permitir reglas: qué rutas cachear y TTL.
Función 3: Failover automático — respaldo en segundos
Garantía de estabilidad. Configuras fallback en cascada, por ejemplo:
- Primero OpenAI GPT-4, 5 reintentos
- Si falla, Claude 3.5 Sonnet
- Si Claude también cae, Gemini Pro como último recurso
Todo automático; tu código no se entera. Ejemplo de configuración en Portkey:
{
"retry": { "count": 5 },
"strategy": { "mode": "fallback" },
"targets": [
{
"provider": "openai",
"api_key": "sk-xxx",
"override_params": {"model": "gpt-4"}
},
{
"provider": "anthropic",
"api_key": "sk-ant-xxx",
"override_params": {"model": "claude-3-5-sonnet-20241022"}
},
{
"provider": "google",
"api_key": "gt5xxx",
"override_params": {"model": "gemini-pro"}
}
]
}
Pasas esta config en el header y el Gateway hace fallback en orden. El Universal Endpoint de Cloudflare permite algo parecido con varios providers en una petición.
Con esto la disponibilidad sube del 95% a más del 99,9%. ¿OpenAI caído? Pasa a Claude. ¿Claude con rate limit? Gemini aguanta. El usuario no lo nota.
Función 4: Monitorización y análisis de costes
AI Gateway registra en tiempo real:
- QPS: peticiones por segundo; picos claros
- Consumo de tokens: por modelo, en vivo
- Coste: según tarifas de cada modelo
- Tasa de error: qué falla y por qué
El panel de Cloudflare es muy completo: QPS, error rate y paneles específicos de LLM para tokens, coste y acierto de caché. Ves:
- Cuánto gastas hoy y la tendencia
- Qué equipo (consumer) consume más
- Qué modelo es más caro
- Cuánto ahorra la caché
Así controlas el presupuesto. Puedes alertar, por ejemplo: «avísame si el gasto diario supera 100 dólares».
Función 5: Rate limiting y permisos — que un equipo no tumbe el servicio
Imprescindible en empresa. API Keys independientes por equipo, cada una con cuota y límites.
Por ejemplo:
- Desarrollo: 100.000 tokens/día, GPT-4
- Pruebas: 10.000 tokens/día, solo GPT-3.5
- Producto: 50.000 tokens/día, Claude
Así las pruebas no agotan la cuota de producción. El consumo por equipo queda claro.
Los Gateway avanzados incluyen filtro de contenido sensible para bloquear peticiones indebidas. Higress de Alibaba Cloud lo ofrece para control empresarial.
Comparativa: Cloudflare vs Portkey vs Alibaba Cloud
Hay muchas opciones, pero estas tres son las principales. Comparación objetiva para elegir.
Opción 1: Cloudflare AI Gateway — ideal para empezar
Ventajas:
- Totalmente gratuito: cualquier cuenta Cloudflare, sin cargo extra
- Cero despliegue: sin instalar nada, registro y listo
- Una línea de código: cambia
baseURL, 5 minutos - Aceleración global: red CDN de Cloudflare
Limitaciones: - Los datos pasan por servidores de Cloudflare (dicen que no los leen)
- Caché semántica en roadmap; hoy solo exacta
- Menos modelos, unos 10+ proveedores principales
Ideal para: - Proyectos personales, validación rápida
- Equipos pequeños sin ops
- Cuando la privacidad de datos no es crítica
"Desde la beta de septiembre de 2023, Cloudflare AI Gateway ha proxyado más de 500 millones de peticiones"
Opción 2: Portkey Gateway — empresas, máxima potencia
Ventajas:
- Open source gratuito: en GitHub, despliegue privado bajo tu control
- 200+ modelos: casi todo lo que imagines
- Rendimiento: según ellos, 9,9× más rápido que otros gateways; ~45 KB tras instalar
- Funciones completas: balanceo, reintentos, backoff exponencial, 50+ reglas de guardrails
Despliegue:
# Muy simple en local
npx @portkey-ai/gateway
# Tu AI Gateway corre en http://localhost:8787
Destacados:
- Caché semántica (DashVector)
- Reintentos inteligentes con backoff exponencial
- Cloudflare Workers, Docker, Node.js, Replit, etc.
Ideal para: - Medianas y grandes empresas con compliance
- Despliegue privado
- Máximas funciones y rendimiento
Opción 3: Alibaba Cloud Higress — mejor en China
Ventajas:
- Acceso rápido en China: servidores locales, baja latencia
- Integración profunda: Alibaba Cloud Bailian, PAI
- Estabilidad empresarial: lo usan internamente en Alibaba
- Soporte MCP: APIs a MCP según estándares recientes
Técnicos: - Arquitectura 3-en-1: gateway de contenedores + microservicios + IA
- Multi-nube y despliegue privado
- Optimizado para modelos chinos (Qwen, ERNIE, etc.)
Ideal para: - Empresas ya en Alibaba Cloud
- Arquitectura híbrida (local + nube)
- Usuarios en China, sensibles a latencia
Tabla comparativa
| Función | Cloudflare | Portkey | Higress |
|---|---|---|---|
| Despliegue | Nube | Open source / nube | Privado / nube |
| Precio | Gratis | Open source gratis | Pago por uso |
| Modelos | 10+ | 200+ | Principales cubiertos |
| Caché semántica | En roadmap | ✅ Sí | ✅ Sí |
| Despliegue privado | ❌ | ✅ | ✅ |
| Acceso China | Regular | Regular | ⭐⭐⭐ |
| Panel | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
| Facilidad | Muy fácil | Fácil | Media |
| Empresa | Básico | ⭐⭐⭐ | ⭐⭐⭐ |
| Recomendación: |
- Personal / pruebas rápidas → Cloudflare, 5 minutos, gratis
- Startup / PYME → Portkey, open source, funciones suficientes
- Gran empresa / Alibaba Cloud → Higress, estable, con soporte
- Proyectos internacionales → Cloudflare o Portkey, no Higress
- China y latencia crítica → Higress, el más rápido allí
Práctica: tu primer AI Gateway en 10 minutos
Vamos al código. Uso Portkey porque corre en local sin registro; validación más rápida.
Paso 1: Desplegar Gateway (30 segundos)
En la terminal:
npx @portkey-ai/gateway
Si ves esto, listo:
🚀 AI Gateway running on http://localhost:8787
Tu AI Gateway ya corre en local. En http://localhost:8787/public/ hay panel de administración.
Paso 2: Configurar fallback multi-modelo (2 minutos)
Estrategia de tres niveles: OpenAI → Claude → Gemini.
Crea gateway-config.json:
{
"retry": {
"count": 5
},
"strategy": {
"mode": "fallback"
},
"targets": [
{
"provider": "openai",
"api_key": "tu OpenAI Key",
"override_params": {
"model": "gpt-4"
}
},
{
"provider": "anthropic",
"api_key": "tu Claude Key",
"override_params": {
"model": "claude-3-5-sonnet-20241022"
}
},
{
"provider": "google",
"api_key": "tu Google Key",
"override_params": {
"model": "gemini-pro"
}
}
]
}
Notas:
retry.count: 5→ 5 reintentos si falla el principalstrategy.mode: "fallback"→ modo failovertargets→ tres proveedores en orden
Paso 3: Adaptar tu código (1 minuto)
Antes podía ser:
const openai = new OpenAI({
apiKey: 'sk-xxx'
});
const response = await openai.chat.completions.create({
model: "gpt-4",
messages: [{role: "user", content: "Escribe un poema"}]
});
Ahora solo 3 líneas:
const fs = require('fs');
const config = JSON.parse(fs.readFileSync('./gateway-config.json'));
const openai = new OpenAI({
apiKey: 'any-key', // ya no importa, las keys reales están en el config
baseURL: "http://localhost:8787/v1", // 👈 aquí
defaultHeaders: {
'x-portkey-config': JSON.stringify(config) // 👈 y esto
}
});
// ¡El resto igual!
const response = await openai.chat.completions.create({
model: "gpt-4", // lo sobrescribe override_params del config
messages: [{role: "user", content: "Escribe un poema"}]
});
Ya tienes tolerancia a fallos en tres niveles. Si cae OpenAI, pasa a Claude sin que tu código lo gestione.
Paso 4: Probar el fallback (1 minuto)
Fuerza el fallo de OpenAI: pon una api_key incorrecta:
{
"provider": "openai",
"api_key": "sk-wrong-key", // 👈 a propósito
"override_params": {"model": "gpt-4"}
}
Ejecuta y mira los logs:
[Gateway] OpenAI request failed: Invalid API Key
[Gateway] Retrying with anthropic...
[Gateway] Success with anthropic (claude-3-5-sonnet-20241022)
El Gateway reintenta 5 veces, cambia a Claude y responde. Automático; tu código no maneja el error.
Paso 5: Caché para bajar costes (2 minutos)
Portkey soporta caché con configuración. Versión simple con Redis:
// Si tienes Redis, configura caché así
const openai = new OpenAI({
baseURL: "http://localhost:8787/v1",
defaultHeaders: {
'x-portkey-config': JSON.stringify(config),
'x-portkey-cache': 'simple', // caché simple
'x-portkey-cache-force-refresh': 'false'
}
});
Primera petición:
await openai.chat.completions.create({
messages: [{role: "user", content: "¿Qué es la IA?"}]
});
// API real, ~800 ms, ~0,002 USD
Segunda petición igual:
await openai.chat.completions.create({
messages: [{role: "user", content: "¿Qué es la IA?"}]
});
// Caché, ~50 ms, 0 USD
16× más rápido y sin coste. Cuanto más frecuentes las preguntas, más ahorras.
Paso 6: Ver monitorización (1 minuto)
En http://localhost:8787/public/:
- Peticiones totales y tasa de éxito
- Llamadas por provider
- Acierto de caché
- Logs de error
El panel local de Portkey es básico pero suficiente. Para más:
- Portkey Cloud (hosted, cuota gratis para personal)
- Cloudflare AI Gateway (panel muy potente)
- Prometheus + Grafana propio
Código completo de ejemplo
const OpenAI = require('openai');
const fs = require('fs');
// Lee la configuración
const config = {
"retry": {"count": 5},
"strategy": {"mode": "fallback"},
"targets": [
{
"provider": "openai",
"api_key": process.env.OPENAI_KEY,
"override_params": {"model": "gpt-4"}
},
{
"provider": "anthropic",
"api_key": process.env.ANTHROPIC_KEY,
"override_params": {"model": "claude-3-5-sonnet-20241022"}
}
]
};
// Cliente
const client = new OpenAI({
apiKey: 'placeholder',
baseURL: "http://localhost:8787/v1",
defaultHeaders: {
'x-portkey-config': JSON.stringify(config),
'x-portkey-cache': 'simple'
}
});
// Uso
async function chat(prompt) {
const response = await client.chat.completions.create({
model: "gpt-4", // el modelo real lo define el config
messages: [{role: "user", content: prompt}]
});
return response.choices[0].message.content;
}
// Prueba
chat("Explica AI Gateway en una frase").then(console.log);
Aunque falle OpenAI, obtienes respuesta de Claude sin afectar al negocio.
Buenas prácticas empresariales y trampas
Montar AI Gateway es el primer paso; para sacarle partido, cuida estos detalles. Son lecciones aprendidas a golpes.
Práctica 1: Entornos separados — no mezcles dev y prod
Error común: una sola config para desarrollo, pruebas y producción. Resultado:
- Pruebas agotan cuota en producción
- Un cambio en dev rompe prod
- Factura mezclada, imposible separar test de negocio real
Enfoque correcto:
// Según NODE_ENV
const config = process.env.NODE_ENV === 'production'
? productionConfig // prod: GPT-4 + Claude 3.5 respaldo
: developmentConfig; // dev: GPT-3.5 o modelo local
// Producción
const productionConfig = {
"targets": [
{"provider": "openai", "api_key": process.env.PROD_OPENAI_KEY,
"override_params": {"model": "gpt-4"}},
{"provider": "anthropic", "api_key": process.env.PROD_ANTHROPIC_KEY,
"override_params": {"model": "claude-3-5-sonnet-20241022"}}
]
};
// Desarrollo
const developmentConfig = {
"targets": [
{"provider": "openai", "api_key": process.env.DEV_OPENAI_KEY,
"override_params": {"model": "gpt-3.5-turbo"}} // modelo barato
]
};
Desarrollo y pruebas sin tocar producción. API Keys separadas: más seguro y más barato.
Práctica 2: Control de costes — no dejes que la factura se dispare
Sin control es quemar dinero. Estrategias obligatorias:
1. Presupuesto mensual por equipo
// Límites en la config del Gateway
{
"consumer": "product-team",
"budget": {
"monthly_limit_usd": 1000, // máximo 1000 USD/mes
"alert_threshold": 0.8 // alerta al 80%
}
}
2. Caché en preguntas frecuentes
Analiza peticiones, Top 10 frecuentes con caché. En atención al cliente:
- «¿Cómo devolver?»
- «¿Cuánto cuesta el envío?»
- «¿Cómo pedir factura?»
Respuestas estables; una semana de TTL ahorra más del 60%.
3. Revisión semanal de tokens
Cada semana mira el panel: Top 10 por consumo - ¿Inputs anormalmente largos? (¿alguien metió un libro entero?)
- ¿Peticiones caras? ¿Se puede optimizar el prompt?
- ¿Repeticiones sin caché? ¿Por qué?
Una empresa encontró una petición de 8.000 tokens: el prompt tenía ejemplos innecesarios. Tras optimizar, 2.000 tokens; coste -75%.
Práctica 3: Seguridad — no filtres datos sensibles
Crítico en empresa.
1. No envíes datos sensibles a APIs externas
Filtro de contenido para teléfonos, DNI, tarjetas, etc.:
// Pseudocódigo; configúralo en la capa Gateway
if (request.content.contains(PHONE_PATTERN)) {
return error("Información sensible detectada; petición bloqueada");
}
Higress y gateways empresariales lo soportan.
2. Rotación de API Keys
No uses la misma clave años. Rota cada 3 meses. Secret Manager, no hardcode.
3. Logs de producción anonimizados
No registres el input completo del usuario:
// Log anonimizado
{
"request_id": "abc123",
"model": "gpt-4",
"input_length": 256, // solo longitud
"input_sample": "Consulta del usuario sobre...[anonimizado]",
"cost": 0.002
}
Trampa 1: Abuso de caché — no caches datos en tiempo real
Caso: quejas de «el tiempo siempre sale mal». La respuesta del tiempo estaba cacheada 24 h: por la mañana sol, por la noche lluvia y seguía diciendo sol.
Solución:
Lista blanca/negra de rutas:
const cacheRules = {
cacheable: [
"/api/ai/faq",
"/api/ai/docs-summary"
],
nocache: [
"/api/ai/realtime",
"/api/ai/news",
"/api/ai/personalized"
]
};
O TTL corto:
{
"cache": {
"ttl": 300 // 5 minutos para casi tiempo real
}
}
Trampa 2: Fallback mal configurado — el respaldo debe ser equivalente
Caso: GPT-4 con fallback a GPT-3.5 para ahorrar. Al limitar GPT-4, cae a 3.5, calidad baja, usuarios: «¿por qué la IA se volvió tonta?»
Solución:
Respaldo del mismo nivel, sin degradar:
{
"targets": [
{"provider": "openai", "model": "gpt-4"},
{"provider": "anthropic", "model": "claude-3-5-sonnet"}, // ✅ mismo nivel
{"provider": "google", "model": "gemini-pro"} // ✅ mismo nivel
]
}
No hagas esto:
{
"targets": [
{"provider": "openai", "model": "gpt-4"},
{"provider": "openai", "model": "gpt-3.5-turbo"} // ❌ degradación
]
}
Si degradas, al menos avisa:
if (response.provider === 'fallback_model') {
console.warn('Usando modelo de respaldo; la calidad puede bajar');
}
Trampa 3: No mirar métricas — desplegar y olvidar
Problema: Gateway montado con esfuerzo y nadie mira el panel hasta el desastre.
Solución:
- Informe semanal automático
Cada lunes por email:- Peticiones, éxito, coste de la semana
- Top 10 tokens
- Errores
- Tendencia de caché
- Alertas clave
- Coste: gasto diario >80% del presupuesto
- Errores: tasa >5%
- Latencia: P99 >3 s
- Fallback: respaldo >20% de llamadas
- Revisión semanal (15 min)
Tres preguntas:- ¿Subida anómala de costes?
- ¿Errores optimizables?
- ¿Se puede subir acierto de caché?
Caso real: una empresa vio pico miércoles 15-17 h. Era la reunión de producto probando funciones. Pasaron pruebas a dev; coste de prod -30%.
Conclusión
En resumen, tres ideas:
Primero, cambiar proveedores, costes fuera de control y punto único de fallo son inevitables en apps de IA. Puedes levantarte a las 3 de la madrugada a cambiar código, o montar AI Gateway una vez y dormir tranquilo.
Segundo, AI Gateway no es rocket science: 10 minutos y funciona. Portkey con un comando; Cloudflare con registrarte. Tres líneas de código para fallback multi-modelo, caché y monitorización global: -40% costes, 99,9% disponibilidad. Muy rentable.
Tercero, desplegar es el inicio; el valor está en optimizar de forma continua. Revisa métricas cada semana, ajusta caché y fallback, limpia peticiones inútiles… en seis meses puedes ahorrar miles de dólares.
Actúa ya:
- Hoy: 10 minutos con Portkey en local y comprueba lo fácil que es
- Paso a paso: piloto en un proyecto pequeño, luego escala
- Hábito: panel cada semana, costes cada mes
- Comparte: cuéntanos en comentarios qué problemas tuviste con AI Gateway
No esperes: más proveedores significa más lío; los costes solo suben. Un día antes con AI Gateway es un día antes de tranquilidad y ahorro. Pruébalo; es gratis y puede sorprenderte.
Referencias:
- Blog oficial de Cloudflare AI Gateway
- Repositorio GitHub de Portkey Gateway
- Documentación de AI Gateway de Alibaba Cloud
- Guía de configuración de AI Fallback
FAQ
¿Qué diferencia hay entre AI Gateway y un proxy de API?
• Caché inteligente (menos llamadas repetidas)
• Failover automático (si falla el modelo principal, cambia al de respaldo)
• Monitorización de costes a nivel de token
• API unificada en formato OpenAI
Un proxy de API normal solo reenvía peticiones, sin estas optimizaciones para IA.
¿La versión gratuita de AI Gateway es suficiente?
Opciones gratuitas:
• Cloudflare AI Gateway es totalmente gratuito y sin límite de peticiones
• La versión open source de Portkey en despliegue local también es gratuita
Solo si superas 100.000 peticiones diarias o necesitas SLA empresarial conviene pagar.
En pruebas reales, la red CDN global de Cloudflare es incluso más rápida que muchas opciones de pago.
¿Cómo elegir entre Cloudflare, Portkey y Alibaba Cloud Higress?
Proyectos personales:
• Cloudflare (cero configuración, totalmente gratuito)
Si necesitas despliegue privado o 200+ modelos:
• Portkey (open source, el más completo)
Empresas en China o que ya usan Alibaba Cloud:
• Higress (acceso rápido en China, soporte empresarial)
Si no estás seguro, empieza con Cloudflare para validar rápido y migra si hace falta.
¿AI Gateway aumenta la latencia?
• La red edge de Cloudflare suma unos 50-100 ms
• Portkey en local tiene menos latencia
Con caché activada, las peticiones cacheadas pasan de ~800 ms a menos de 50 ms; la experiencia mejora.
Prueba la latencia en rutas no críticas antes de decidir.
¿Cómo evitar fugas de API Key en AI Gateway?
1) Guarda las API Key en variables de entorno o Secret Manager; nunca las hardcodees
2) Usa claves distintas por entorno (desarrollo, pruebas, producción)
3) Rota las claves periódicamente (cada 3 meses recomendado)
4) Añade un token de autenticación personalizado en la capa Gateway
5) Monitoriza patrones anómalos y rota de inmediato si detectas algo raro
En entornos empresariales también puedes usar listas blancas de IP y firma de peticiones.
15 min de lectura · Publicado el: 1 dic 2025 · Actualizado el: 21 ago 2026
Guía Cloudflare AI Stack
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
¿La API de OpenAI siempre hace timeout? Crea un canal privado con Workers, sin costo y más estable
Monta un proxy de API de IA con Cloudflare Workers sin costo y en 5 minutos. Compatible con OpenAI, Claude y Gemini: 100.000 peticiones gratis al día, con código completo y guía de configuración segura.
Parte 2 de 5
Siguiente
¿Las bases de datos vectoriales son demasiado caras? La versión gratuita de Vectorize te permite implementar búsqueda semántica en 30 minutos
Tutorial de Cloudflare Vectorize sin coste inicial: implementa búsqueda semántica en 30 minutos, ahorra 50 USD/mes frente a Pinecone. Código completo y guía de errores comunes para proyectos personales y validación rápida de MVP, con cuota gratuita de 5 millones de vectores.
Parte 4 de 5



Comentarios
Inicia sesión con GitHub para dejar un comentario