[HPC] Ausfall des Clusters aufgrund einer Störung der Kühlanlage
Aufgrund einer Störung der Kühlanlage am Freitagnachmittag musste der HPC-Cluster ungeplant vollständig abgeschaltet werden.
Die Störung der Kühlanlage konnte inzwischen behoben werden. Der HPC-Cluster wird derzeit schrittweise wieder in Betrieb genommen.
Zum Zeitpunkt der Abschaltung laufende Jobs wurden durch den Ausfall unterbrochen. Betroffene Jobs werden, soweit möglich, von Slurm automatisch erneut gestartet (Requeue). Nutzerinnen und Nutzer werden gebeten, den Status ihrer Jobs zu überprüfen und fehlgeschlagene Jobs gegebenenfalls erneut einzureichen.
Bereits wartende (Pending) Jobs verbleiben in der Warteschlange und werden automatisch gestartet, sobald die benötigten Ressourcen wieder verfügbar sind.
Auch laufende Dateiübertragungen können durch die Störung unterbrochen worden sein. Bitte überprüfen Sie gegebenenfalls den Status und die Vollständigkeit Ihrer übertragenen Daten.
Im Falle weiterer unvorhergesehener Probleme werden wir Sie selbstverständlich wie immer umgehend informieren.