Amazon SageMaker HyperPod ahora admite comprobaciones de estado exhaustivas para los clústeres de Slurm con aprovisionamiento continuo
Amazon SageMaker HyperPod ahora admite comprobaciones de estado exhaustivas para los clústeres orquestados creados con aprovisionamiento continuo, lo que le permite verificar de forma proactiva el estado del acelerador de GPU en las instancias en ejecución en cualquier momento. El aprovisionamiento continuo le permite empezar a entrenar rápidamente y escalar los grupos de instancias de forma asincrónica sin errores de tipo “todo o nada”, y ahora puede combinar esa flexibilidad con una validación integral del hardware a medida que las instancias se ponen en línea. Esta capacidad aborda un desafío crítico en el que incluso un solo nodo en mal estado puede desperdiciar horas de tiempo de procesamiento y retrasar las cargas de trabajo críticas.
Con las comprobaciones de estado exhaustivas, puede dirigirse a grupos de instancias enteros o a instancias específicas para ejecutar pruebas de estrés de hardware y de conectividad exhaustivas antes de asignar recursos informáticos a un trabajo. Como el aprovisionamiento continuo añade nodos de trabajo a su clúster de Slurm de forma asíncrona a medida que hay capacidad disponible, puede realizar comprobaciones exhaustivas del estado de cada nodo nuevo a medida que se conecta, validando el hardware antes de programar los trabajos en él y sin interrumpir las cargas de trabajo que ya se están ejecutando en los nodos en buen estado. El progreso y los resultados son visibles tanto a nivel de grupo de instancias como de instancia a través de la consola y las API de SageMaker, lo que proporciona una visibilidad completa del estado de la GPU, la conectividad de red y el rendimiento de la comunicación multinodo. Las instancias que se están comprobando se aíslan automáticamente de la programación de la carga de trabajo y se devuelven al servicio una vez aprobadas. Cuando se combina con la capacidad de recuperación automática de nodos de HyperPod, las instancias que fallan se reinician o reemplazan automáticamente, lo que garantiza el buen estado del clúster.
Esta capacidad se encuentra disponible en todas las regiones en las que se ofrece Amazon SageMaker HyperPod. Para obtener más información sobre las comprobaciones de estado exhaustivas bajo demanda y el aprovisionamiento continuo, consulte la Guía del usuario de Amazon SageMaker HyperPod.