Infraestructura cloud de alta disponibilidad: SLA, RPO, RTO y DRP explicados
Cuando un proveedor promete "alta disponibilidad" conviene preguntar cuatro cosas: qué SLA garantiza, cuántos datos podrías perder (RPO), cuánto tardarías en volver a operar (RTO) y qué plan de recuperación (DRP) existe. Estas cuatro siglas definen, en la práctica, cuánto le cuesta a tu empresa una caída. Aquí las explicamos en simple y te damos una checklist para elegir un plan de infraestructura cloud o hosting gestionado.
SLA: cuántas horas al año puede estar caído tu sistema
El SLA (Service Level Agreement) es el compromiso de disponibilidad del servicio. Un porcentaje que parece alto puede significar muchas horas de caída al año:
| Disponibilidad | Caída máxima por año | Caída máxima por mes | Uso típico |
|---|---|---|---|
| 99% | ~3 días 15 h | ~7 h 18 min | Sitios informativos, ambientes de prueba |
| 99,5% | ~1 día 20 h | ~3 h 39 min | Aplicaciones internas no críticas |
| 99,9% | ~8 h 46 min | ~44 min | Sistemas de negocio, e-commerce, ERP |
| 99,99% | ~53 min | ~4 min | Operaciones críticas, banca, salud, logística |
| 99,999% | ~5 min | ~26 s | Infraestructura de misión crítica |
Cada "nueve" adicional multiplica el costo de la arquitectura: redundancia de servidores, múltiples zonas o regiones, balanceo de carga y operación 24/7. Por eso la pregunta correcta no es "¿cuál es el SLA más alto?", sino "¿cuánto me cuesta cada hora sin sistema?".
RPO y RTO: cuántos datos pierdes y cuánto tardas en volver
- RPO (Recovery Point Objective): el máximo de datos que aceptas perder, medido en tiempo. Un RPO de 15 minutos significa respaldos o replicación al menos cada 15 minutos. Un RPO "cercano a cero" exige replicación síncrona a un sitio espejo.
- RTO (Recovery Time Objective): el tiempo máximo que puedes estar detenido antes de recuperar el servicio. Un RTO de 1 hora requiere automatización de recuperación y un equipo disponible 24/7; un RTO de 24 horas puede resolverse con respaldos y restauración manual.
RPO y RTO deben definirse por sistema: el ERP, el e-commerce y el correo no tienen la misma criticidad, y tratarlos igual encarece todo sin necesidad.
DRP: el plan que se prueba antes del desastre
El DRP (Disaster Recovery Plan) documenta cómo se recupera la operación ante una caída mayor: pérdida de un datacenter, ransomware, error humano o falla del proveedor. Un DRP serio incluye inventario de sistemas con su RPO/RTO, sitio de recuperación (otra región o proveedor), procedimientos paso a paso, responsables, comunicación con clientes y, sobre todo, pruebas periódicas. Un plan que nunca se ensayó es una hipótesis, no un plan.
Arquitecturas de alta disponibilidad, de menor a mayor
- Cloud gestionado en una zona con respaldos automáticos: cubre fallas de hardware y errores de configuración. Base de cualquier plan.
- Multi-zona con balanceo de carga y failover automático: tolera la caída de un datacenter completo dentro de la misma región.
- Híbrido cloud + servidor en terreno: útil cuando la operación no puede depender de la conectividad (plantas, bodegas, sucursales) y se replica hacia la nube en tiempo real.
- Multi-región con replicación continua y DRP: tolera desastres regionales; es el estándar para operaciones críticas.
- Infraestructura dedicada y sitio espejo con RPO cercano a cero: máxima aislación y control, para industrias reguladas o de alto volumen transaccional.
Checklist para elegir proveedor de hosting o cloud en Chile
- SLA por escrito, con penalidades y método de medición.
- RPO y RTO comprometidos por sistema, no genéricos.
- Respaldos automáticos, cifrados, con copia fuera de la región y pruebas de restauración documentadas.
- Monitoreo y observabilidad 24/7 con alertas proactivas, no solo "cuando el cliente avisa".
- Soporte N1·N2·N3 con escalamiento definido y posibilidad de atención en terreno.
- Gestión de parches, actualizaciones y seguridad incluida (no como servicio aparte).
- Cifrado en tránsito y en reposo, control de accesos y registro de auditoría.
- Transparencia de costos: qué escala automáticamente y qué se cobra aparte.
Planes de infraestructura con operación 24/7/365
En Aindox administramos infraestructura cloud y hosting gestionado con planes desde Cloud Esencial hasta Alta Disponibilidad Multi-Región y Dedicada Premium, con SLA de hasta 99,99%+, respaldos continuos, DRP y soporte N1·N2·N3. Te ayudamos a definir el RPO y RTO correctos para cada sistema.
Ver planes cloud