{"product_id":"sistemas-de-ia-distribuidos","title":"Sistemas de IA distribuidos","description":"\u003ch1\u003eSistemas de IA distribuidos\u003c\/h1\u003e\u003ch2 class=\"subtitle\"\u003eUna guía práctica para construir sistemas escalables de entrenamiento, inferencia y servicio para IA en producción\u003c\/h2\u003e\u003cp class=\"author\"\u003eFuheng Wu\u003c\/p\u003e\u003cdiv class=\"description\"\u003e\n\u003cp\u003e\u003cstrong\u003eAprende IA distribuida de principio a fin\u003c\/strong\u003e con frameworks de entrenamiento, motores de inferencia y herramientas de orquestación para construir sistemas listos para producción.\u003c\/p\u003e\n\u003ch3\u003eCaracterísticas principales\u003c\/h3\u003e\n\u003cul\u003e\n\u003cli\u003eComprende el hardware de GPU, las interconexiones de alta velocidad y las estrategias de paralelismo.\u003c\/li\u003e\n\u003cli\u003ePractica con ejercicios al final de cada capítulo.\u003c\/li\u003e\n\u003cli\u003eImplementa entrenamiento distribuido con técnicas optimizadas para los recursos.\u003c\/li\u003e\n\u003cli\u003eDespliega inferencia de alto rendimiento con optimización avanzada y gestión de memoria.\u003c\/li\u003e\n\u003cli\u003eConstruye pilas de servicio con planificación, orquestación y observabilidad.\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003ch3\u003eUna ruta completa, no otro tutorial aislado\u003c\/h3\u003e\n\u003cp\u003eA medida que los modelos de IA crecen hasta miles de millones y billones de parámetros, los sistemas distribuidos se vuelven esenciales para entrenarlos y servirlos. Muchos recursos explican una pieza del problema; este libro une el recorrido completo, desde el entrenamiento distribuido hasta la inferencia y el despliegue en producción, con ejemplos prácticos y orientados al trabajo real.\u003c\/p\u003e\n\u003cp\u003eComenzarás con la \u003cstrong\u003eestimación de GPU y memoria\u003c\/strong\u003e, la preparación de datos, la arquitectura de GPU, las interconexiones y las principales estrategias de paralelismo. Después trabajarás con paralelismo de datos en uno y múltiples nodos, particionamiento de parámetros y métodos para reducir el consumo de memoria de modelos grandes.\u003c\/p\u003e\n\u003cp\u003eLuego pasarás a la \u003cstrong\u003einferencia distribuida\u003c\/strong\u003e: atención optimizada, caché KV, fusión de operadores y diseños basados en routers con vLLM y SGLang. También desplegarás cargas en SLURM y Kubernetes, con planificación de GPU, enrutamiento, confiabilidad y observabilidad.\u003c\/p\u003e\n\u003cp\u003eLa sección final aborda benchmarking, ajuste de rendimiento y tendencias como modelos MoE, coordinación entre el borde y la nube, aprendizaje federado e IA agéntica. Cada capítulo incluye \u003cstrong\u003ecódigo probado, orientación de depuración y ejercicios\u003c\/strong\u003e.\u003c\/p\u003e\n\u003cp\u003eAl finalizar, podrás construir sistemas de IA distribuidos que escalen desde una sola GPU hasta grandes clústeres.\u003c\/p\u003e\n\u003c\/div\u003e\u003ch2 class=\"about_author_title\"\u003eAcerca del autor\u003c\/h2\u003e\u003cdiv class=\"about_author\"\u003e\n\u003cp\u003eFuheng Wu es líder técnico principal de ML en Oracle Generative AI, especializado en entrenamiento distribuido, inferencia y sistemas de GPU para cargas de trabajo de IA empresarial. Ha desarrollado componentes clave de los modelos de visión e IA de documentos a gran escala de Oracle y de Oracle Code Assist, y es coautor de un blog conjunto de Microsoft y Oracle sobre aprendizaje profundo de alto rendimiento con ONNX Runtime. Graduado de la Alianza Singapur-MIT, donde estudió álgebra lineal con Gilbert Strang del MIT, comenzó su carrera en aprendizaje automático aplicado en NetEase, luego trabajó en Wall Street en finanzas cuantitativas —calculando el precio de bonos convertibles en Bloomberg y desarrollando estrategias de negociación algorítmica en WorldQuant— antes de unirse a Uber, donde construyó sistemas de entrenamiento distribuido en Michelangelo con Petastorm y Horovod.\u003c\/p\u003e\n\u003cp\u003eFuheng tiene experiencia práctica en PyTorch Distributed, DeepSpeed, paralelismo al estilo Megatron, clústeres de GPU de Kubernetes y servicio de LLM en producción. Ha contribuido a proyectos de código abierto como SGLang, vLLM, genai-bench, pyLLaMA, chatLLaMA e HiQ, y es autor de \u003cem\u003eMathematics for AI and Machine Learning\u003c\/em\u003e. Enseña fundamentos de IA generativa en la Escuela de Negocios McCombs de la Universidad de Texas en Austin y asesora a estudiantes que se preparan para las Olimpiadas de IA. Escribiendo bajo el seudónimo de Xuan Xin, también es autor de las memorias poéticas \u003cem\u003eAbove the Clouds: From Mountain Springs to the Edge of AI in Silicon Valley\u003c\/em\u003e y del álbum musical \u003cem\u003eLet's Train the Model\u003c\/em\u003e (2024), que convierte los conceptos de aprendizaje profundo e inteligencia artificial en música. Más allá de la tecnología, es calígrafo zen y tutor de matemáticas voluntario.\u003c\/p\u003e\n\u003c\/div\u003e\u003ch2 class=\"content_title\"\u003eLo que aprenderás\u003c\/h2\u003e\u003cdiv class=\"content\"\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 1: Introducción a la IA distribuida moderna\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003ePor qué la IA moderna requiere distribución\u003c\/li\u003e\n\u003cli\u003eEl ciclo de vida del modelo de IA moderno\u003c\/li\u003e\n\u003cli\u003eMarco de decisión: ¿cuándo se necesitan sistemas distribuidos?\u003c\/li\u003e\n\u003cli\u003ePráctica: ejecución de entrenamiento distribuido\u003c\/li\u003e\n\u003cli\u003eFundamentos de IA distribuida con PyTorch\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 2: Hardware de GPU, redes y estrategias de paralelismo\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003ePotencia computacional: clústeres de IA y métricas\u003c\/li\u003e\n\u003cli\u003eCPU, GPU, TPU y NPU\u003c\/li\u003e\n\u003cli\u003eInterconexiones de alta velocidad: la columna vertebral de la red\u003c\/li\u003e\n\u003cli\u003eSistemas de programación de chips: SPMD y CUDA\u003c\/li\u003e\n\u003cli\u003eComunicación distribuida: patrones y primitivas\u003c\/li\u003e\n\u003cli\u003eParalelismo: estrategias principales\u003c\/li\u003e\n\u003cli\u003eSelección de estrategia: cómo elegir el enfoque adecuado\u003c\/li\u003e\n\u003cli\u003ePráctica: inspección de hardware y pruebas de ancho de banda\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 3: Entrenamiento distribuido con PyTorch DDP\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eCómo funciona DDP internamente\u003c\/li\u003e\n\u003cli\u003eConfiguración de DDP en un solo nodo\u003c\/li\u003e\n\u003cli\u003eConfiguración de DDP en múltiples nodos\u003c\/li\u003e\n\u003cli\u003eDepuración y resolución de problemas\u003c\/li\u003e\n\u003cli\u003ePerfilado y optimización del rendimiento de DDP\u003c\/li\u003e\n\u003cli\u003eCheckpointing y reanudación de trabajos distribuidos\u003c\/li\u003e\n\u003cli\u003eParalelismo de datos elástico\u003c\/li\u003e\n\u003cli\u003eEjemplo completo: DDP con un transformer\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 4: Escalado con Fully Sharded Data Parallel (FSDP)\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eDe DDP a FSDP\u003c\/li\u003e\n\u003cli\u003ePor qué FSDP permite modelos más grandes que la memoria\u003c\/li\u003e\n\u003cli\u003eFSDP2: la API de particionamiento por parámetro\u003c\/li\u003e\n\u003cli\u003eUn ejemplo práctico completo: sumarización con T5 y FSDP\u003c\/li\u003e\n\u003cli\u003eCheckpointing con FSDP2\u003c\/li\u003e\n\u003cli\u003ePrefetching: optimización de la comunicación\u003c\/li\u003e\n\u003cli\u003eCheckpointing de activaciones y offloading\u003c\/li\u003e\n\u003cli\u003eEntrenamiento con FSDP en múltiples nodos\u003c\/li\u003e\n\u003cli\u003eDepuración de problemas en FSDP\u003c\/li\u003e\n\u003cli\u003eComparación de FSDP2 con ZeRO y DDP\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 5: Más allá del particionamiento de estado con DeepSpeed y Megatron\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eZeRO etapa 1: particionamiento del estado del optimizador\u003c\/li\u003e\n\u003cli\u003eZeRO etapa 2: particionamiento del estado del optimizador y de los gradientes\u003c\/li\u003e\n\u003cli\u003eZeRO etapa 3: particionamiento completo (como FSDP)\u003c\/li\u003e\n\u003cli\u003eZeRO-Offload: extensión de memoria en CPU\u003c\/li\u003e\n\u003cli\u003eZeRO-Infinity: offload en NVMe para modelos masivos\u003c\/li\u003e\n\u003cli\u003eZeRO++: ZeRO optimizado para la comunicación\u003c\/li\u003e\n\u003cli\u003eMegatron: el paralelismo de cómputo como un segundo eje\u003c\/li\u003e\n\u003cli\u003eEl paralelismo híbrido en la práctica\u003c\/li\u003e\n\u003cli\u003eElección de la estrategia adecuada\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 6: Inferencia distribuida y vLLM\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eDel entrenamiento a la inferencia\u003c\/li\u003e\n\u003cli\u003eIntroducción a vLLM\u003c\/li\u003e\n\u003cli\u003eCaché KV\u003c\/li\u003e\n\u003cli\u003ePagedAttention: resolución de la fragmentación de la caché KV\u003c\/li\u003e\n\u003cli\u003eEl problema de out of memory\u003c\/li\u003e\n\u003cli\u003eArquitectura de vLLM\u003c\/li\u003e\n\u003cli\u003eParalelismo de tensores, datos, pipeline y expertos\u003c\/li\u003e\n\u003cli\u003eCombinación de estrategias de paralelismo\u003c\/li\u003e\n\u003cli\u003eEjemplos prácticos\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 7: Optimización entre solicitudes con SGLang\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eUna filosofía diferente para la inferencia distribuida\u003c\/li\u003e\n\u003cli\u003eArquitectura y teoría fundamental de SGLang\u003c\/li\u003e\n\u003cli\u003eArquitectura distribuida basada en router\u003c\/li\u003e\n\u003cli\u003eDesagregación de prefill\/decode\u003c\/li\u003e\n\u003cli\u003eDespliegue multinodo de SGLang\u003c\/li\u003e\n\u003cli\u003eExpertos para modelos MoE\u003c\/li\u003e\n\u003cli\u003eDecodificación especulativa\u003c\/li\u003e\n\u003cli\u003eAtención con paralelismo de datos\u003c\/li\u003e\n\u003cli\u003ePatrones de despliegue en producción\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 8: Ejecución de entrenamiento distribuido con SLURM\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eIntroducción a los clústeres para HPC y entrenamiento de IA\u003c\/li\u003e\n\u003cli\u003eConfiguración de SLURM para entrenamiento multi-GPU\u003c\/li\u003e\n\u003cli\u003eEnvío de trabajos de entrenamiento distribuido\u003c\/li\u003e\n\u003cli\u003eEjecución interactiva con srun\u003c\/li\u003e\n\u003cli\u003eLanzamiento de frameworks de entrenamiento distribuido con SLURM\u003c\/li\u003e\n\u003cli\u003eCaracterísticas avanzadas de SLURM para entrenamiento\u003c\/li\u003e\n\u003cli\u003eMonitoreo y depuración\u003c\/li\u003e\n\u003cli\u003eBuenas prácticas\u003c\/li\u003e\n\u003cli\u003eResolución de problemas comunes\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 9: Pila de servicio de LLM en producción\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eAnatomía de un sistema de servicio de LLM en producción\u003c\/li\u003e\n\u003cli\u003eEnrutamiento de solicitudes y gestión de tráfico\u003c\/li\u003e\n\u003cli\u003eOperaciones: observabilidad, confiabilidad y costos\u003c\/li\u003e\n\u003cli\u003eDespliegue de servicios de LLM en Kubernetes\u003c\/li\u003e\n\u003cli\u003eDespliegue en Kubernetes con llm-d\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 10: Benchmarking distribuido y optimización del rendimiento\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eLa brecha de rendimiento en sistemas distribuidos\u003c\/li\u003e\n\u003cli\u003ePor qué importa el benchmarking\u003c\/li\u003e\n\u003cli\u003eFundamentos de benchmarking\u003c\/li\u003e\n\u003cli\u003eBenchmarking de entrenamiento\u003c\/li\u003e\n\u003cli\u003eBenchmarking de inferencia\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp\u003e\u003cstrong\u003eCapítulo 11: El panorama cambiante de la IA distribuida\u003c\/strong\u003e\u003c\/p\u003e\n\u003cul\u003e\n\u003cli\u003eLa evolución de la IA distribuida\u003c\/li\u003e\n\u003cli\u003eMezcla de expertos: la arquitectura dominante\u003c\/li\u003e\n\u003cli\u003eEl continuo entre el borde y la nube\u003c\/li\u003e\n\u003cli\u003eParalelismo a escala\u003c\/li\u003e\n\u003cli\u003eCuando las cosas fallan: tolerancia a fallos\u003c\/li\u003e\n\u003cli\u003eMás allá del texto: entrenamiento distribuido multimodal\u003c\/li\u003e\n\u003cli\u003eAprendizaje federado: un paradigma alternativo\u003c\/li\u003e\n\u003cli\u003eIA agéntica: la siguiente frontera\u003c\/li\u003e\n\u003cli\u003eLa economía de escala\u003c\/li\u003e\n\u003cli\u003ePreparándose para el futuro\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003c\/div\u003e","brand":"Biblioteca de Alejandría","offers":[{"title":"Default Title","offer_id":44821386362922,"sku":null,"price":296.74,"currency_code":"MXN","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/0648\/3489\/5914\/files\/Vitrina_-_Sistemas_de_IA_distribuidos.png?v=1789146907","url":"https:\/\/alejandriav5.org\/products\/sistemas-de-ia-distribuidos","provider":"Libros de Alejandría 5.0","version":"1.0","type":"link"}