<aside>
🚧
En preparación. Este mini lab acompañará al Tema 01 y se publicará junto con su demostración en video.
</aside>
¿Qué vamos a demostrar?
La idea es comprobar en la práctica que el modo de inferencia no se elige por el modelo, sino por las necesidades del caso de uso: latencia, volumen de solicitudes y patrón de tráfico.
Escenario
Partiremos de una aplicación que necesita generar predicciones de forma interactiva, pero cuyo tráfico cambia mucho durante el día. A partir de ese problema compararemos las opciones de inferencia disponibles en Amazon SageMaker AI y razonaremos cuál encaja mejor.
Conceptos que conectaremos
- Real-Time Inference: cuando necesitamos respuestas de baja latencia para solicitudes online.
- Serverless Inference: cuando el tráfico es intermitente o impredecible y queremos evitar capacidad dedicada permanente.
- Asynchronous Inference: cuando las solicitudes pueden tardar más o necesitan ponerse en cola.
- Batch Transform: cuando procesamos grandes cantidades de datos offline y no necesitamos una respuesta inmediata.
Recorrido previsto del mini lab
- Partir del problema y definir los requisitos de latencia y tráfico.
- Identificar qué opciones de inferencia podrían resolverlo.
- Revisar en la consola de SageMaker AI dónde se expresan esas decisiones.
- Configurar un ejemplo orientado a Serverless Inference para el escenario planteado.
- Contrastar la decisión con un escenario Batch para demostrar cómo cambia la arquitectura cuando cambia el problema.
¿Qué deberías poder explicar al terminar?
Por qué el mismo modelo puede requerir una arquitectura de inferencia distinta dependiendo de cómo lo vaya a utilizar una aplicación o un negocio.
🎓 Versión workshop — 30 minutos