Introducción
Los equipos que implementan modelos de IA en producción enfrentan hoy un problema concreto: la fragmentación de herramientas para gestionar inferencias. Por un lado, Workers AI ofrece GPU administradas por Cloudflare para ejecutar modelos como LLMs de manera serverless. Por otro, AI Gateway permite proxiar requests a proveedores externos (OpenAI, Anthropic, etc.) con observabilidad, logging y control de acceso. Mantener ambas soluciones en silos obliga a duplicar configuraciones, dividir la visibilidad de métricas y manejar facturas separadas, lo que complejiza la operación a escala.
La unificación de ambos productos en un único plano de control resuelve este problema al centralizar el monitoreo, la facturación y el enrutamiento para todos los modelos, sin importar dónde estén alojados. Este cambio, anunciado por Cloudflare en su blog oficial, no solo simplifica la gestión sino que habilita capacidades avanzadas como failover automático entre proveedores y enrutamiento inteligente basado en el tipo de tarea.
Qué ocurrió
Cloudflare integró Workers AI y AI Gateway en un único plano de control, eliminando la distinción técnica entre ambos productos a nivel de API y bindings. Ahora, los desarrolladores pueden:
- Usar un binding unificado para invocar tanto modelos alojados en Workers AI como proveedores externos.
- Acceder a una API REST única (/ai/), que abstrae el proveedor subyacente.
- Obtener observabilidad automática (logs, latencia, tokens consumidos) sin configurar explícitamente un gateway.
El cambio es retrocompatible: las aplicaciones existentes que llaman directamente a Workers AI seguirán funcionando, pero al routingThrough AI Gateway (mediante un parámetro adicional) se habilitan las capacidades de monitoreo y facturación unificada. Además, Cloudflare habilitó el uso de créditos de AI Gateway para consumir modelos de Workers AI, con límites de rate elevados para quienes adopten este enfoque.
Impacto para DevOps / Infraestructura / Cloud / Seguridad
Para los equipos de infraestructura, la unificación reduce la complejidad operativa. Antes, monitorear el uso de IA requería:
- Consultar logs separados para Workers AI (en la dashboard de Workers) y AI Gateway (en su propia consola).
- Gestionar presupuestos por producto, con facturas distintas.
- Implementar lógica de fallback manual en el código para manejar fallos de proveedores.
Con el nuevo plano de control:
- Visibilidad centralizada: Todas las requests a modelos (propios o externos) aparecen en un solo dashboard, con métricas detalladas por modelo, latencia desglosada (P50, P99), tokens consumidos y tasas de error. Esto es crítico para auditar prompts/respuestas (por ejemplo, detectar injections) y optimizar costos.
- Facturación unificada: Los créditos de AI Gateway ahora cubren Workers AI, OpenAI, Anthropic y otros proveedores soportados. Esto simplifica la gestión financiera, especialmente en entornos multi-equipo.
- Resiliencia mejorada: El enrutamiento centrado en el modelo (model-first routing) permite failover automático entre proveedores que hostean el mismo modelo (ej: llama-3-70b en Workers AI y Meta). Cloudflare planea implementar esto en los próximos meses, reduciendo la necesidad de código custom para manejar caídas.
Para seguridad, la centralización facilita:
- Control de acceso: Políticas de autenticación y rate limiting aplicables a todos los modelos desde un solo lugar.
- Auditoría: Logs completos de requests/responses (opcionalmente con retención cero, ZDR) para cumplir requisitos como GDPR o HIPAA.
Detalles técnicos
Bindings unificados
El binding ai en Workers ahora sirve para ambos casos de uso. Ejemplo en JavaScript:
// Antes: llamada directa a Workers AI (sin observabilidad)
const response = await ai.predictions.generate({
model: «llama-3-70b»,
prompt: «¿Cuál es la capital de Argentina?»
});
// Ahora: routing a través de AI Gateway (con observabilidad)
const response = await ai.predictions.generate({
model: «llama-3-70b»,
prompt: «¿Cuál es la capital de Argentina?»,
gateway: «default» // Usa el gateway por defecto (se crea auto)
});
El parámetro gateway puede ser:
- «default»: Gateway automático con logging y billing unificado.
- Un nombre de gateway personalizado (ej: «mi-gateway-prod») para aislar tráfico por aplicación.
API REST unificada
La endpoint /ai/v1 (documentación) permite las mismas operaciones. Ejemplo con curl:
curl -X POST https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/models/llama-3-70b \
-H «Authorization: Bearer {api_token}» \
-H «Content-Type: application/json» \
-d ‘{
«prompt»: «¿Cuál es la capital de Argentina?»,
«gateway»: «default»
}’
Facturación unificada
- Los créditos de AI Gateway ahora se consumen al usar Workers AI, OpenAI, Anthropic, etc.
- Límites de rate elevados: Cloudflare ofrece límites más altos para modelos de Workers AI cuando se usa el plano de control unificado. Los valores exactos varían por modelo y region; consultar la documentación oficial para detalles.
- Pre-pago: Se puede cargar saldo en USD para evitar facturas sorpresivas.
Enrutamiento centrado en el modelo
El nuevo sistema de routing (en pilotaje interno) funciona así:
Componentes afectados
- Workers: El runtime ahora incluye el binding ai actualizado.
- AI Gateway: La consola (en cloudflare.com/dashboard/ai-gateway) ahora muestra datos de Workers AI.
- WARP / Zero Trust: Las políticas de acceso a la API /ai/ pueden gestionarse desde Security > API Shield.
Qué deberían hacer los administradores y equipos técnicos
1. Migra a los bindings/API unificados
- Para usuarios de Workers AI: Añade el parámetro gateway: «default» a las llamadas existentes al binding ai para habilitar logging y billing unificado. Ejemplo:
// Before
ai.predictions.generate({ model: «llama-3-70b», prompt: «…» });
// After
ai.predictions.generate({
model: «llama-3-70b»,
prompt: «…»,
gateway: «default»
});
- Para usuarios de AI Gateway: No es necesario cambiar nada, pero puedes empezar a usar modelos de Workers AI añadiéndolos a tu configuración de gateway.
2. Centraliza el monitoreo
- Explora el dashboard de AI Gateway (cloudflare.com/dashboard/ai-gateway) para ver métricas agregadas de todos los modelos.
- Configura alertas para:
– Tasa de errores > 1% (puede indicar problemas con un proveedor).
– Tokens consumidos > umbral (para controlar costos).
– Latencia P99 > 5 segundos (degradación de performance).
3. Unifica la facturación
- Carga créditos en AI Gateway desde la consola (Account > AI Gateway > Billing).
- Verifica que los costos de Workers AI se reflejen en el mismo lugar.
- Si usas EKS/AKS, considera usar un service account dedicated para las requests a /ai/ y monitorear su consumo con Prometheus + Grafana.
4. Prepara el enrutamiento avanzado
- Revisa la lista de modelos disponibles en Workers AI (catálogo) y identifica aquellos que también están en otros proveedores (ej: llama-3, mistral-7b).
- Cuando Cloudflare active el model-first routing, podrás especificar solo el modelo en tu código y dejar que el gateway maneje el proveedor. Para probar esto cuando esté disponible, usa:
ai.predictions.generate({
model: «llama-3-70b», // Sin especificar proveedor
prompt: «…»
});
5. Revisa permisos y seguridad
- Asegúrate de que los API tokens usados para /ai/ tengan el scope ai:read y ai:edit.
- Si usas Zero Trust, aplica políticas de acceso:
– Restringir la API /ai/ a IPs de tus clusters (EKS/AKS).
– Requerir autenticación con SAML o Okta.
- Habilita Zero Data Retention (ZDR) para gatesways que procesen datos sensibles:
curl -X PUT https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/gateways/{gateway_id} \
-H «Authorization: Bearer {api_token}» \
-H «Content-Type: application/json» \
-d ‘{«zdr»: true}’
Conclusión
La unificación de Workers AI y AI Gateway en Cloudflare elimina silos operativos, proporcionando una única interfaz para gestionar todo el tráfico de inferencia. Para los equipos de DevOps, esto significa menos configuración, visibilidad centralizada y resiliencia mejorada gracias al failover automático. Para los de seguridad, simplifica el control de acceso y la auditoría. Aunque el cambio es incremental (y retrocompatible), las capacidades futuras como el enrutamiento inteligente basado en la tarea prometen reducir aún más la complejidad de construir aplicaciones de IA robustas.
La recomendación práctica es empezar a usar el gateway por defecto para todas las llamadas a modelos, incluso las de Workers AI, y centralizar el monitoreo y la facturación. Esto permitirá aprovechar las nuevas funcionalidades apenas se lancen, sin cambios adicionales en el código.
Fuentes
- https://blog.cloudflare.com/workers-ai-gateway-unification/
- https://developers.cloudflare.com/workers-ai/models/
- https://developers.cloudflare.com/ai-gateway/
