← Volver al catálogo

AWS Glue

En una frase: ETL sin servidor con catálogo de datos y rastreadores que descubren esquemas
Categoría: Análisis (Analytics)
Certificaciones: SAA-C03 SAP-C02 AIF-C01 CLF-C02
Documentación oficial: Documentación de AWS Glue ↗

Qué es

AWS Glue es un servicio de integración de datos sin servidores. Sirve para descubrir qué datos tienes, catalogarlos y transformarlos (ETL) para dejarlos listos para el análisis o el ML (Machine Learning: aprendizaje automático). Su pieza más transversal es el catálogo de datos: un registro central de tablas (esquema y ubicación) que usan Athena, Redshift Spectrum, EMR (Elastic MapReduce) y Lake Formation. Los trabajos de ETL corren sobre Apache Spark o Python sin clústeres que gestionar.

Conceptos clave

  • Catálogo de datos (Data Catalog): bases de datos y tablas con su esquema, formato y ubicación en S3 (Simple Storage Service) u otras fuentes; compatible con el metastore de Apache Hive.
  • Crawlers: recorren S3 o bases de datos, infieren el esquema y crean o actualizan las tablas y particiones del catálogo.
  • Trabajos ETL: Spark (lotes o streaming) o Python shell; se escriben en código o se diseñan visualmente con Glue Studio. Se pagan por DPU-hora.
  • Job bookmarks: recuerdan qué datos ya se procesaron para que cada ejecución solo trate los nuevos.
  • Desencadenadores y flujos de trabajo: programar trabajos o encadenarlos.
  • Glue DataBrew: preparación visual de datos sin código para analistas.
  • Calidad de datos: reglas para validar los datos en el catálogo o en los trabajos.
  • Detección de datos sensibles: identifica PII (Personally Identifiable Information: datos personales identificables) en los trabajos para enmascararla.

Casos de uso típicos

  • Catalogar un lago de datos en S3 para consultarlo con Athena.
  • Convertir datos CSV (Comma-Separated Values: texto con valores separados por comas) o JSON (JavaScript Object Notation: formato de datos en texto) a Parquet, limpiarlos y particionarlos.
  • Mover y transformar datos entre bases de datos, S3 y Redshift.
  • Preparar conjuntos de datos para entrenar modelos de ML.

Cuándo NO usarlo

  • Solo copiar datos de aplicaciones SaaS sin transformar: AppFlow.
  • Migrar o replicar una base de datos: DMS (Database Migration Service).
  • Entregar streaming a S3 sin transformaciones complejas: Firehose.
  • Si necesitas control total del clúster de big data: EMR.

Modelo de precios

Los trabajos ETL y los crawlers se pagan por DPU-hora, facturada por segundo; el catálogo por objetos guardados (con un primer millón gratuito) y peticiones; DataBrew por sesión y trabajo. La ejecución flexible (Flex) abarata trabajos que no son urgentes.

Seguridad y alta disponibilidad

Trampas de examen

  • "Descubrir el esquema de los datos de S3 automáticamente": crawler de Glue.
  • "Catálogo central para Athena, EMR y Redshift Spectrum": Glue Data Catalog.
  • "ETL sin servidores": trabajos de Glue.
  • "Procesar solo los datos nuevos en cada ejecución": job bookmarks.
  • "Preparar datos sin código": Glue DataBrew.
  • "Migrar una base de datos": DMS, no Glue.

Preguntas de práctica

Preguntas originales escritas para estos apuntes. No son preguntas reales de examen.

Fuentes