Capítulo 1: Introducción a la IA distribuida moderna
- Por qué la IA moderna requiere distribución
- El ciclo de vida del modelo de IA moderno
- Marco de decisión: ¿cuándo se necesitan sistemas distribuidos?
- Práctica: ejecución de entrenamiento distribuido
- Fundamentos de IA distribuida con PyTorch
Capítulo 2: Hardware de GPU, redes y estrategias de paralelismo
- Potencia computacional: clústeres de IA y métricas
- CPU, GPU, TPU y NPU
- Interconexiones de alta velocidad: la columna vertebral de la red
- Sistemas de programación de chips: SPMD y CUDA
- Comunicación distribuida: patrones y primitivas
- Paralelismo: estrategias principales
- Selección de estrategia: cómo elegir el enfoque adecuado
- Práctica: inspección de hardware y pruebas de ancho de banda
Capítulo 3: Entrenamiento distribuido con PyTorch DDP
- Cómo funciona DDP internamente
- Configuración de DDP en un solo nodo
- Configuración de DDP en múltiples nodos
- Depuración y resolución de problemas
- Perfilado y optimización del rendimiento de DDP
- Checkpointing y reanudación de trabajos distribuidos
- Paralelismo de datos elástico
- Ejemplo completo: DDP con un transformer
Capítulo 4: Escalado con Fully Sharded Data Parallel (FSDP)
- De DDP a FSDP
- Por qué FSDP permite modelos más grandes que la memoria
- FSDP2: la API de particionamiento por parámetro
- Un ejemplo práctico completo: sumarización con T5 y FSDP
- Checkpointing con FSDP2
- Prefetching: optimización de la comunicación
- Checkpointing de activaciones y offloading
- Entrenamiento con FSDP en múltiples nodos
- Depuración de problemas en FSDP
- Comparación de FSDP2 con ZeRO y DDP
Capítulo 5: Más allá del particionamiento de estado con DeepSpeed y Megatron
- ZeRO etapa 1: particionamiento del estado del optimizador
- ZeRO etapa 2: particionamiento del estado del optimizador y de los gradientes
- ZeRO etapa 3: particionamiento completo (como FSDP)
- ZeRO-Offload: extensión de memoria en CPU
- ZeRO-Infinity: offload en NVMe para modelos masivos
- ZeRO++: ZeRO optimizado para la comunicación
- Megatron: el paralelismo de cómputo como un segundo eje
- El paralelismo híbrido en la práctica
- Elección de la estrategia adecuada
Capítulo 6: Inferencia distribuida y vLLM
- Del entrenamiento a la inferencia
- Introducción a vLLM
- Caché KV
- PagedAttention: resolución de la fragmentación de la caché KV
- El problema de out of memory
- Arquitectura de vLLM
- Paralelismo de tensores, datos, pipeline y expertos
- Combinación de estrategias de paralelismo
- Ejemplos prácticos
Capítulo 7: Optimización entre solicitudes con SGLang
- Una filosofía diferente para la inferencia distribuida
- Arquitectura y teoría fundamental de SGLang
- Arquitectura distribuida basada en router
- Desagregación de prefill/decode
- Despliegue multinodo de SGLang
- Expertos para modelos MoE
- Decodificación especulativa
- Atención con paralelismo de datos
- Patrones de despliegue en producción
Capítulo 8: Ejecución de entrenamiento distribuido con SLURM
- Introducción a los clústeres para HPC y entrenamiento de IA
- Configuración de SLURM para entrenamiento multi-GPU
- Envío de trabajos de entrenamiento distribuido
- Ejecución interactiva con srun
- Lanzamiento de frameworks de entrenamiento distribuido con SLURM
- Características avanzadas de SLURM para entrenamiento
- Monitoreo y depuración
- Buenas prácticas
- Resolución de problemas comunes
Capítulo 9: Pila de servicio de LLM en producción
- Anatomía de un sistema de servicio de LLM en producción
- Enrutamiento de solicitudes y gestión de tráfico
- Operaciones: observabilidad, confiabilidad y costos
- Despliegue de servicios de LLM en Kubernetes
- Despliegue en Kubernetes con llm-d
Capítulo 10: Benchmarking distribuido y optimización del rendimiento
- La brecha de rendimiento en sistemas distribuidos
- Por qué importa el benchmarking
- Fundamentos de benchmarking
- Benchmarking de entrenamiento
- Benchmarking de inferencia
Capítulo 11: El panorama cambiante de la IA distribuida
- La evolución de la IA distribuida
- Mezcla de expertos: la arquitectura dominante
- El continuo entre el borde y la nube
- Paralelismo a escala
- Cuando las cosas fallan: tolerancia a fallos
- Más allá del texto: entrenamiento distribuido multimodal
- Aprendizaje federado: un paradigma alternativo
- IA agéntica: la siguiente frontera
- La economía de escala
- Preparándose para el futuro

