← Todos los módulos
Módulo 3: Procesamiento Distribuido
intermedioEl paradigma MapReduce, la arquitectura Hadoop/YARN y Apache Spark con RDDs y DataFrames.
- 3.1 El paradigma MapReduceCómo funciona MapReduce: fases map, shuffle & sort y reduce, word count paso a paso, combiners y sus limitaciones.
- 3.2 Hadoop y YARN: gestión de recursos del clústerArquitectura de YARN (ResourceManager, NodeManager, ApplicationMaster, contenedores), ciclo de vida de un job y el ecosistema Hadoop.
- 3.3 Apache Spark: procesamiento en memoriaRDD, DataFrame y Dataset; transformaciones lazy vs acciones; el DAG de ejecución y por qué Spark supera a MapReduce.
- 3.4 Lab 3: Tu primer job de Spark en localInstala PySpark, ejecuta un WordCount con RDDs, migra el mismo cálculo a DataFrames y lee el plan de ejecución en la Spark UI.