Amazon SageMaker HyperPod optimiza clústeres Slurm con topologías por partición
Introducción Los equipos de ML que escalan entrenamiento distribuido en AWS enfrentaban un cuello de botella crítico: la configuración genérica de topología de red en clústeres Slurm no aprovechaba las…