Qué es
AWS Glue es un servicio de integración de datos sin servidores. Sirve para descubrir qué datos tienes, catalogarlos y transformarlos (ETL) para dejarlos listos para el análisis o el ML (Machine Learning: aprendizaje automático). Su pieza más transversal es el catálogo de datos: un registro central de tablas (esquema y ubicación) que usan Athena, Redshift Spectrum, EMR (Elastic MapReduce) y Lake Formation. Los trabajos de ETL corren sobre Apache Spark o Python sin clústeres que gestionar.
Conceptos clave
- Catálogo de datos (Data Catalog): bases de datos y tablas con su esquema, formato y ubicación en S3 (Simple Storage Service) u otras fuentes; compatible con el metastore de Apache Hive.
- Crawlers: recorren S3 o bases de datos, infieren el esquema y crean o actualizan las tablas y particiones del catálogo.
- Trabajos ETL: Spark (lotes o streaming) o Python shell; se escriben en código o se diseñan visualmente con Glue Studio. Se pagan por DPU-hora.
- Job bookmarks: recuerdan qué datos ya se procesaron para que cada ejecución solo trate los nuevos.
- Desencadenadores y flujos de trabajo: programar trabajos o encadenarlos.
- Glue DataBrew: preparación visual de datos sin código para analistas.
- Calidad de datos: reglas para validar los datos en el catálogo o en los trabajos.
- Detección de datos sensibles: identifica PII (Personally Identifiable Information: datos personales identificables) en los trabajos para enmascararla.
Casos de uso típicos
- Catalogar un lago de datos en S3 para consultarlo con Athena.
- Convertir datos CSV (Comma-Separated Values: texto con valores separados por comas) o JSON (JavaScript Object Notation: formato de datos en texto) a Parquet, limpiarlos y particionarlos.
- Mover y transformar datos entre bases de datos, S3 y Redshift.
- Preparar conjuntos de datos para entrenar modelos de ML.
Cuándo NO usarlo
- Solo copiar datos de aplicaciones SaaS sin transformar: AppFlow.
- Migrar o replicar una base de datos: DMS (Database Migration Service).
- Entregar streaming a S3 sin transformaciones complejas: Firehose.
- Si necesitas control total del clúster de big data: EMR.
Modelo de precios
Los trabajos ETL y los crawlers se pagan por DPU-hora, facturada por segundo; el catálogo por objetos guardados (con un primer millón gratuito) y peticiones; DataBrew por sesión y trabajo. La ejecución flexible (Flex) abarata trabajos que no son urgentes.
Seguridad y alta disponibilidad
- Roles de IAM (Identity and Access Management) para que los trabajos accedan a los datos.
- Cifrado del catálogo, de los registros y de los datos con KMS (Key Management Service).
- Permisos detallados sobre el catálogo con Lake Formation.
- Conexiones a fuentes dentro de una VPC (Virtual Private Cloud).
Trampas de examen
- "Descubrir el esquema de los datos de S3 automáticamente": crawler de Glue.
- "Catálogo central para Athena, EMR y Redshift Spectrum": Glue Data Catalog.
- "ETL sin servidores": trabajos de Glue.
- "Procesar solo los datos nuevos en cada ejecución": job bookmarks.
- "Preparar datos sin código": Glue DataBrew.
- "Migrar una base de datos": DMS, no Glue.
Preguntas de práctica
Preguntas originales escritas para estos apuntes. No son preguntas reales de examen.
Fuentes
- What is AWS Glue?, documentación de AWS (consultada el 26/09/2026).
- Using crawlers to populate the Data Catalog, documentación de AWS (consultada el 26/09/2026).
- Tracking processed data using job bookmarks, documentación de AWS (consultada el 26/09/2026).