Ir directamente a la información del producto
1 de 5

Sistemas de IA distribuidos

Sistemas de IA distribuidos

Una guía práctica para construir sistemas escalables de entrenamiento, inferencia y servicio para IA en producción

Convierte el laberinto de GPU, paralelismo, inferencia y orquestación en una ruta práctica para llevar IA de una sola máquina a producción.

Precio habitual $ 296.74 MXN
Precio habitual $ 479.98 MXN Precio de oferta $ 296.74 MXN
-38% Próximamente

⚡ Libro completo (última edición)

⚡ Formatos EPUB y PDF

⚡ En español latinoamericano neutro

⚡ Envío instantáneo

⚡ Incluye audioresumen*

⚡ Incluye videoresumen*

⚡ Incluye recursos adicionales*

⚡ Actualizaciones [gratis]

     *NotebookLM Pro

Mercado Pago Compra ahora, paga después con Mercado Pago
  • American Express
  • Apple Pay
  • Google Pay
  • Maestro
  • Mastercard
  • PayPal
  • USDC
  • Visa

Integra en una sola secuencia lo que normalmente se aprende por separado: hardware e interconexiones, entrenamiento distribuido, particionamiento, inferencia, orquestación, servicio, observabilidad y benchmarking. No presenta DDP, FSDP, ZeRO, Megatron, vLLM o SGLang como herramientas aisladas, sino como decisiones dentro del mismo ciclo de vida, con código probado y ejercicios.

Libro electrónico - Última edición, de Fuheng Wu (autor)

Consigue un fragmento


Tu modelo no necesita otra demo: necesita un sistema que escale

Domina la ruta completa desde una GPU hasta un servicio de IA en producción

Un prototipo puede verse impecable en una sola máquina. Pero al cruzar a múltiples GPU aparecen los bloqueos: memoria insuficiente, sincronización que se congela, checkpoints frágiles, caché KV saturada y latencia que nadie sabe explicar. ⚙️

El problema no es una herramienta aislada. Es no ver el sistema completo.

Sistemas de IA distribuidos, de Fuheng Wu, conecta hardware, redes, entrenamiento, inferencia y operación en una sola ruta práctica. Comienza por estimar memoria y cómputo para que sepas cuándo distribuir. Después te lleva por PyTorch DDP y FSDP, DeepSpeed ZeRO y Megatron, sin esconder las decisiones que separan una configuración funcional de una arquitectura sólida. 🧠

La segunda mitad entra donde muchos libros se detienen: inferencia con vLLM y SGLang, caché KV, PagedAttention, SLURM, Kubernetes, enrutamiento, observabilidad y benchmarking. No solo aprenderás a lanzar trabajos; aprenderás a medir, depurar y elegir.

Cada capítulo incorpora código probado, ejercicios y orientación para resolver fallos reales. Así transformas documentación dispersa en un criterio que puedes repetir frente a una nueva GPU, un modelo más grande o una carga impredecible. 🔍

Si trabajas en ML, DevOps, plataforma, HPC o nube, aquí encontrarás el puente entre el modelo que funciona en laboratorio y el servicio que resiste producción.

Deja de adivinar dónde está el cuello de botella. Construye el mapa, prueba las decisiones y escala con intención. 🚀

INFO

Sistemas de IA distribuidos

Una guía práctica para construir sistemas escalables de entrenamiento, inferencia y servicio para IA en producción

Fuheng Wu

Aprende IA distribuida de principio a fin con frameworks de entrenamiento, motores de inferencia y herramientas de orquestación para construir sistemas listos para producción.

Características principales

  • Comprende el hardware de GPU, las interconexiones de alta velocidad y las estrategias de paralelismo.
  • Practica con ejercicios al final de cada capítulo.
  • Implementa entrenamiento distribuido con técnicas optimizadas para los recursos.
  • Despliega inferencia de alto rendimiento con optimización avanzada y gestión de memoria.
  • Construye pilas de servicio con planificación, orquestación y observabilidad.

Una ruta completa, no otro tutorial aislado

A medida que los modelos de IA crecen hasta miles de millones y billones de parámetros, los sistemas distribuidos se vuelven esenciales para entrenarlos y servirlos. Muchos recursos explican una pieza del problema; este libro une el recorrido completo, desde el entrenamiento distribuido hasta la inferencia y el despliegue en producción, con ejemplos prácticos y orientados al trabajo real.

Comenzarás con la estimación de GPU y memoria, la preparación de datos, la arquitectura de GPU, las interconexiones y las principales estrategias de paralelismo. Después trabajarás con paralelismo de datos en uno y múltiples nodos, particionamiento de parámetros y métodos para reducir el consumo de memoria de modelos grandes.

Luego pasarás a la inferencia distribuida: atención optimizada, caché KV, fusión de operadores y diseños basados en routers con vLLM y SGLang. También desplegarás cargas en SLURM y Kubernetes, con planificación de GPU, enrutamiento, confiabilidad y observabilidad.

La sección final aborda benchmarking, ajuste de rendimiento y tendencias como modelos MoE, coordinación entre el borde y la nube, aprendizaje federado e IA agéntica. Cada capítulo incluye código probado, orientación de depuración y ejercicios.

Al finalizar, podrás construir sistemas de IA distribuidos que escalen desde una sola GPU hasta grandes clústeres.

Acerca del autor

Fuheng Wu es líder técnico principal de ML en Oracle Generative AI, especializado en entrenamiento distribuido, inferencia y sistemas de GPU para cargas de trabajo de IA empresarial. Ha desarrollado componentes clave de los modelos de visión e IA de documentos a gran escala de Oracle y de Oracle Code Assist, y es coautor de un blog conjunto de Microsoft y Oracle sobre aprendizaje profundo de alto rendimiento con ONNX Runtime. Graduado de la Alianza Singapur-MIT, donde estudió álgebra lineal con Gilbert Strang del MIT, comenzó su carrera en aprendizaje automático aplicado en NetEase, luego trabajó en Wall Street en finanzas cuantitativas —calculando el precio de bonos convertibles en Bloomberg y desarrollando estrategias de negociación algorítmica en WorldQuant— antes de unirse a Uber, donde construyó sistemas de entrenamiento distribuido en Michelangelo con Petastorm y Horovod.

Fuheng tiene experiencia práctica en PyTorch Distributed, DeepSpeed, paralelismo al estilo Megatron, clústeres de GPU de Kubernetes y servicio de LLM en producción. Ha contribuido a proyectos de código abierto como SGLang, vLLM, genai-bench, pyLLaMA, chatLLaMA e HiQ, y es autor de Mathematics for AI and Machine Learning. Enseña fundamentos de IA generativa en la Escuela de Negocios McCombs de la Universidad de Texas en Austin y asesora a estudiantes que se preparan para las Olimpiadas de IA. Escribiendo bajo el seudónimo de Xuan Xin, también es autor de las memorias poéticas Above the Clouds: From Mountain Springs to the Edge of AI in Silicon Valley y del álbum musical Let's Train the Model (2024), que convierte los conceptos de aprendizaje profundo e inteligencia artificial en música. Más allá de la tecnología, es calígrafo zen y tutor de matemáticas voluntario.

Lo que aprenderás

Capítulo 1: Introducción a la IA distribuida moderna

  • Por qué la IA moderna requiere distribución
  • El ciclo de vida del modelo de IA moderno
  • Marco de decisión: ¿cuándo se necesitan sistemas distribuidos?
  • Práctica: ejecución de entrenamiento distribuido
  • Fundamentos de IA distribuida con PyTorch

Capítulo 2: Hardware de GPU, redes y estrategias de paralelismo

  • Potencia computacional: clústeres de IA y métricas
  • CPU, GPU, TPU y NPU
  • Interconexiones de alta velocidad: la columna vertebral de la red
  • Sistemas de programación de chips: SPMD y CUDA
  • Comunicación distribuida: patrones y primitivas
  • Paralelismo: estrategias principales
  • Selección de estrategia: cómo elegir el enfoque adecuado
  • Práctica: inspección de hardware y pruebas de ancho de banda

Capítulo 3: Entrenamiento distribuido con PyTorch DDP

  • Cómo funciona DDP internamente
  • Configuración de DDP en un solo nodo
  • Configuración de DDP en múltiples nodos
  • Depuración y resolución de problemas
  • Perfilado y optimización del rendimiento de DDP
  • Checkpointing y reanudación de trabajos distribuidos
  • Paralelismo de datos elástico
  • Ejemplo completo: DDP con un transformer

Capítulo 4: Escalado con Fully Sharded Data Parallel (FSDP)

  • De DDP a FSDP
  • Por qué FSDP permite modelos más grandes que la memoria
  • FSDP2: la API de particionamiento por parámetro
  • Un ejemplo práctico completo: sumarización con T5 y FSDP
  • Checkpointing con FSDP2
  • Prefetching: optimización de la comunicación
  • Checkpointing de activaciones y offloading
  • Entrenamiento con FSDP en múltiples nodos
  • Depuración de problemas en FSDP
  • Comparación de FSDP2 con ZeRO y DDP

Capítulo 5: Más allá del particionamiento de estado con DeepSpeed y Megatron

  • ZeRO etapa 1: particionamiento del estado del optimizador
  • ZeRO etapa 2: particionamiento del estado del optimizador y de los gradientes
  • ZeRO etapa 3: particionamiento completo (como FSDP)
  • ZeRO-Offload: extensión de memoria en CPU
  • ZeRO-Infinity: offload en NVMe para modelos masivos
  • ZeRO++: ZeRO optimizado para la comunicación
  • Megatron: el paralelismo de cómputo como un segundo eje
  • El paralelismo híbrido en la práctica
  • Elección de la estrategia adecuada

Capítulo 6: Inferencia distribuida y vLLM

  • Del entrenamiento a la inferencia
  • Introducción a vLLM
  • Caché KV
  • PagedAttention: resolución de la fragmentación de la caché KV
  • El problema de out of memory
  • Arquitectura de vLLM
  • Paralelismo de tensores, datos, pipeline y expertos
  • Combinación de estrategias de paralelismo
  • Ejemplos prácticos

Capítulo 7: Optimización entre solicitudes con SGLang

  • Una filosofía diferente para la inferencia distribuida
  • Arquitectura y teoría fundamental de SGLang
  • Arquitectura distribuida basada en router
  • Desagregación de prefill/decode
  • Despliegue multinodo de SGLang
  • Expertos para modelos MoE
  • Decodificación especulativa
  • Atención con paralelismo de datos
  • Patrones de despliegue en producción

Capítulo 8: Ejecución de entrenamiento distribuido con SLURM

  • Introducción a los clústeres para HPC y entrenamiento de IA
  • Configuración de SLURM para entrenamiento multi-GPU
  • Envío de trabajos de entrenamiento distribuido
  • Ejecución interactiva con srun
  • Lanzamiento de frameworks de entrenamiento distribuido con SLURM
  • Características avanzadas de SLURM para entrenamiento
  • Monitoreo y depuración
  • Buenas prácticas
  • Resolución de problemas comunes

Capítulo 9: Pila de servicio de LLM en producción

  • Anatomía de un sistema de servicio de LLM en producción
  • Enrutamiento de solicitudes y gestión de tráfico
  • Operaciones: observabilidad, confiabilidad y costos
  • Despliegue de servicios de LLM en Kubernetes
  • Despliegue en Kubernetes con llm-d

Capítulo 10: Benchmarking distribuido y optimización del rendimiento

  • La brecha de rendimiento en sistemas distribuidos
  • Por qué importa el benchmarking
  • Fundamentos de benchmarking
  • Benchmarking de entrenamiento
  • Benchmarking de inferencia

Capítulo 11: El panorama cambiante de la IA distribuida

  • La evolución de la IA distribuida
  • Mezcla de expertos: la arquitectura dominante
  • El continuo entre el borde y la nube
  • Paralelismo a escala
  • Cuando las cosas fallan: tolerancia a fallos
  • Más allá del texto: entrenamiento distribuido multimodal
  • Aprendizaje federado: un paradigma alternativo
  • IA agéntica: la siguiente frontera
  • La economía de escala
  • Preparándose para el futuro

TRANSFORMACIÓN

Avanza, capítulo a capítulo, desde estimar GPU y memoria hasta entrenar, servir y operar IA distribuida en producción, sin depender de recursos fragmentados.

¿PARA QUIÉN ES?

Para ingenieros de ML, investigadores de IA, DevOps, plataforma, HPC y nube que necesitan entrenar o servir modelos a escala.

Habilidades:

Estimación, DDP, FSDP, vLLM, SGLang, SLURM y Kubernetes

Nivel: Intermedio

Requisitos:

Conocimientos básicos de Python y PyTorch.

IMPORTANCIA ESTRATÉGICA

Fortalece la capacidad técnica de América Latina para crear y operar infraestructura de IA propia. Ayuda a que ingenieros, investigadores y equipos de plataforma conviertan conocimiento disperso en sistemas confiables, eficientes y listos para producción, alineado con una sociedad regional más tecnológica y autónoma.

AUTORES

Fuheng Wu es líder técnico principal de ML en Oracle Generative AI, especializado en entrenamiento distribuido, inferencia y sistemas de GPU para cargas de trabajo de IA empresarial. Ha desarrollado componentes clave de los modelos de visión e IA de documentos a gran escala de Oracle y de Oracle Code Assist, y es coautor de un blog conjunto de Microsoft y Oracle sobre aprendizaje profundo de alto rendimiento con ONNX Runtime. Graduado de la Alianza Singapur-MIT, donde estudió álgebra lineal con Gilbert Strang del MIT, comenzó su carrera en aprendizaje automático aplicado en NetEase, luego trabajó en Wall Street en finanzas cuantitativas —calculando el precio de bonos convertibles en Bloomberg y desarrollando estrategias de negociación algorítmica en WorldQuant— antes de unirse a Uber, donde construyó sistemas de entrenamiento distribuido en Michelangelo con Petastorm y Horovod.

Fuheng tiene experiencia práctica en PyTorch Distributed, DeepSpeed, paralelismo al estilo Megatron, clústeres de GPU de Kubernetes y servicio de LLM en producción. Ha contribuido a proyectos de código abierto como SGLang, vLLM, genai-bench, pyLLaMA, chatLLaMA e HiQ, y es autor de Mathematics for AI and Machine Learning. Enseña fundamentos de IA generativa en la Escuela de Negocios McCombs de la Universidad de Texas en Austin y asesora a estudiantes que se preparan para las Olimpiadas de IA. Escribiendo bajo el seudónimo de Xuan Xin, también es autor de las memorias poéticas Above the Clouds: From Mountain Springs to the Edge of AI in Silicon Valley y del álbum musical Let's Train the Model (2024), que convierte los conceptos de aprendizaje profundo e inteligencia artificial en música. Más allá de la tecnología, es calígrafo zen y tutor de matemáticas voluntario.

LO QUE APRENDERÁS

Capítulo 1: Introducción a la IA distribuida moderna

  • Por qué la IA moderna requiere distribución
  • El ciclo de vida del modelo de IA moderno
  • Marco de decisión: ¿cuándo se necesitan sistemas distribuidos?
  • Práctica: ejecución de entrenamiento distribuido
  • Fundamentos de IA distribuida con PyTorch

Capítulo 2: Hardware de GPU, redes y estrategias de paralelismo

  • Potencia computacional: clústeres de IA y métricas
  • CPU, GPU, TPU y NPU
  • Interconexiones de alta velocidad: la columna vertebral de la red
  • Sistemas de programación de chips: SPMD y CUDA
  • Comunicación distribuida: patrones y primitivas
  • Paralelismo: estrategias principales
  • Selección de estrategia: cómo elegir el enfoque adecuado
  • Práctica: inspección de hardware y pruebas de ancho de banda

Capítulo 3: Entrenamiento distribuido con PyTorch DDP

  • Cómo funciona DDP internamente
  • Configuración de DDP en un solo nodo
  • Configuración de DDP en múltiples nodos
  • Depuración y resolución de problemas
  • Perfilado y optimización del rendimiento de DDP
  • Checkpointing y reanudación de trabajos distribuidos
  • Paralelismo de datos elástico
  • Ejemplo completo: DDP con un transformer

Capítulo 4: Escalado con Fully Sharded Data Parallel (FSDP)

  • De DDP a FSDP
  • Por qué FSDP permite modelos más grandes que la memoria
  • FSDP2: la API de particionamiento por parámetro
  • Un ejemplo práctico completo: sumarización con T5 y FSDP
  • Checkpointing con FSDP2
  • Prefetching: optimización de la comunicación
  • Checkpointing de activaciones y offloading
  • Entrenamiento con FSDP en múltiples nodos
  • Depuración de problemas en FSDP
  • Comparación de FSDP2 con ZeRO y DDP

Capítulo 5: Más allá del particionamiento de estado con DeepSpeed y Megatron

  • ZeRO etapa 1: particionamiento del estado del optimizador
  • ZeRO etapa 2: particionamiento del estado del optimizador y de los gradientes
  • ZeRO etapa 3: particionamiento completo (como FSDP)
  • ZeRO-Offload: extensión de memoria en CPU
  • ZeRO-Infinity: offload en NVMe para modelos masivos
  • ZeRO++: ZeRO optimizado para la comunicación
  • Megatron: el paralelismo de cómputo como un segundo eje
  • El paralelismo híbrido en la práctica
  • Elección de la estrategia adecuada

Capítulo 6: Inferencia distribuida y vLLM

  • Del entrenamiento a la inferencia
  • Introducción a vLLM
  • Caché KV
  • PagedAttention: resolución de la fragmentación de la caché KV
  • El problema de out of memory
  • Arquitectura de vLLM
  • Paralelismo de tensores, datos, pipeline y expertos
  • Combinación de estrategias de paralelismo
  • Ejemplos prácticos

Capítulo 7: Optimización entre solicitudes con SGLang

  • Una filosofía diferente para la inferencia distribuida
  • Arquitectura y teoría fundamental de SGLang
  • Arquitectura distribuida basada en router
  • Desagregación de prefill/decode
  • Despliegue multinodo de SGLang
  • Expertos para modelos MoE
  • Decodificación especulativa
  • Atención con paralelismo de datos
  • Patrones de despliegue en producción

Capítulo 8: Ejecución de entrenamiento distribuido con SLURM

  • Introducción a los clústeres para HPC y entrenamiento de IA
  • Configuración de SLURM para entrenamiento multi-GPU
  • Envío de trabajos de entrenamiento distribuido
  • Ejecución interactiva con srun
  • Lanzamiento de frameworks de entrenamiento distribuido con SLURM
  • Características avanzadas de SLURM para entrenamiento
  • Monitoreo y depuración
  • Buenas prácticas
  • Resolución de problemas comunes

Capítulo 9: Pila de servicio de LLM en producción

  • Anatomía de un sistema de servicio de LLM en producción
  • Enrutamiento de solicitudes y gestión de tráfico
  • Operaciones: observabilidad, confiabilidad y costos
  • Despliegue de servicios de LLM en Kubernetes
  • Despliegue en Kubernetes con llm-d

Capítulo 10: Benchmarking distribuido y optimización del rendimiento

  • La brecha de rendimiento en sistemas distribuidos
  • Por qué importa el benchmarking
  • Fundamentos de benchmarking
  • Benchmarking de entrenamiento
  • Benchmarking de inferencia

Capítulo 11: El panorama cambiante de la IA distribuida

  • La evolución de la IA distribuida
  • Mezcla de expertos: la arquitectura dominante
  • El continuo entre el borde y la nube
  • Paralelismo a escala
  • Cuando las cosas fallan: tolerancia a fallos
  • Más allá del texto: entrenamiento distribuido multimodal
  • Aprendizaje federado: un paradigma alternativo
  • IA agéntica: la siguiente frontera
  • La economía de escala
  • Preparándose para el futuro

¿CÓMO FUNCIONA?

⚡ Dentro de nuestra plataforma encontrarás los enlaces de descarga, te avisaremos por correo electrónico de todas las futuras actualizaciones.

Descarga el ebook y disfrútalo en las mejores plataformas como Google Play Books, Apple Books o Kindle

El formato EPUB se puede leer sin internet con estas y más plataformas. Y por supuesto, siempre puedes leer el archivo PDF (LISTO PARA IMPRIMIR), donde y como quieras.


Un solo mapa práctico para dominar entrenamiento, inferencia y servicio de IA distribuida, desde la GPU hasta producción.

Preguntas frecuentes del libro

¿Necesito un clúster para aprovechar el libro? No. Empieza con estimación y una sola GPU; después decide cuándo distribuir.

¿Qué conocimientos previos necesito? Conocimientos básicos de Python y PyTorch. Lo demás se introduce desde los fundamentos.

¿Qué hardware requieren los ejercicios? GPU con CUDA para la práctica distribuida; el libro también explica redes y otros aceleradores.

¿Enseña a estimar memoria y cómputo? Sí. Calcula requisitos de entrenamiento e inferencia antes de elegir una arquitectura.

¿Cuándo conviene DDP, FSDP, DeepSpeed o Megatron? Los compara según memoria, escala, cómputo y comunicación.

¿Incluye entrenamiento en uno y múltiples nodos? Sí. Incluye configuración, checkpointing, reanudación y entrenamiento elástico.

¿Cubre inferencia distribuida? Sí. Recorre vLLM, SGLang, caché KV, PagedAttention, batching y paralelismo.

¿Incluye despliegue en producción? Sí. Integra SLURM, Kubernetes, enrutamiento, observabilidad y planificación de GPU.

¿Trae código y ejercicios prácticos? Sí. Cada capítulo incluye código probado, guía de depuración y ejercicios.

¿Ayuda a depurar fallos de comunicación? Explica operaciones colectivas, diagnóstico de DDP y problemas de clúster.

¿Cubre checkpointing y reanudación? Sí. Trabaja con DDP, FSDP, activaciones, offloading y fallos de trabajos.

¿Aborda modelos MoE? Sí. Incluye paralelismo de expertos, Megatron, vLLM, SGLang y tendencias MoE.

¿Incluye benchmarking y perfilado? Sí. Usa métricas de entrenamiento e inferencia, PyTorch Profiler y NVIDIA Nsight Systems.

¿Sirve si solo me interesa inferencia? Sí. Los capítulos de vLLM, SGLang y servicio pueden aprovecharse de forma independiente.

¿Es útil para DevOps, nube y HPC? Sí. También está dirigido a plataforma, administración de clústeres y arquitectura de nube.

¿Qué nivel tiene el contenido? Intermedio. Parte de Python y PyTorch básicos y construye los conceptos paso a paso.

¿Seguirá siendo útil si cambian los frameworks? Sí. Prioriza patrones duraderos de memoria, comunicación, paralelismo y operación.

Ver todos los detalles

¿Necesitas factura?

Una vez realizada tu compra, obtendrás los pasos para solicitarla.


Aprende sin riesgos con nuestra garantía de satisfacción total

En Libros de Alejandría 5.0 creemos en el poder de la educación para transformar vidas. Por esta razón, no solo ofrecemos conocimiento de alto nivel en tecnología, negocios y marketing, sino que también garantizamos que cada inversión en aprendizaje sea segura.

Estamos tan convencidos del impacto y la calidad de nuestros recursos que los respaldamos con la mejor garantía:

Si un producto no cumple con tus expectativas, te devolvemos el 100% de tu dinero, sin rodeos.

Sin trámites complicados ni condiciones ocultas. Con tan solo un mensaje de texto.

Cada recurso que vendemos está diseñado para aportar valor real. Si no lo logramos contigo, no pagas. Así de simple.

Aprende con confianza. ¡Tu satisfacción es nuestra prioridad y está garantizada!


Pago seguro

Nuestra tienda online ofrece un sistema de pagos altamente seguro, utilizando plataformas de encriptación avanzada para proteger tus datos en cada transacción.

Ofrecemos las opciones de pago más seguras: Apple Pay, Visa, Mastercard, American Express, entre otras.

Comprar ahora

Resuelve tus dudas ahora...