Du unterstützt den Betrieb des wissenschaftlichen Hochleistungsrechners „Lichtenberg“ am Hochschulrechenzentrum der TU Darmstadt. Gemeinsam mit unserem Systembetriebs-Team trägst du dazu bei, den zuverlässigen und stabilen Betrieb unseres HPC-Clusters sicherzustellen und die Systemüberwachung kontinuierlich weiterzuentwickeln.
Deine Aufgaben
-
Entwicklung von Scripts zur Automatisierung wiederkehrender Betriebsaufgaben
-
Implementierung von Health-Checks für Management-Nodes
-
Aufbereitung und Auswertung von Fehlermeldungen aus Logs, Cron-Jobs und Kernel-Meldungen
-
Anbindung von Status-Updates an ein Grafana-Dashboard zur Visualisierung des Systemzustands
-
Mitwirkung an der kontinuierlichen Verbesserung der Monitoring-Infrastruktur
-
Unterstützung bei der Dokumentation von Betriebsabläufen und Skripten
Dein Profil
-
Laufendes Hochschulstudium, vorzugsweise in Informatik, Computational Engineering oder einem vergleichbaren Studiengang
-
Gute Kenntnisse in Python und Scripting (z. B. Bash)
-
Erfahrung im Umgang mit Linux-Systemen, idealerweise im Server- oder Cluster-Umfeld
-
Grundkenntnisse in SQL
-
Interesse an Systemadministration, Monitoring und Automatisierung
-
Analytische und strukturierte Arbeitsweise sowie sorgfältiger Umgang mit produktionsnahen Systemen
-
Selbstständige, zuverlässige Arbeitsweise
-
Teamfähigkeit sowie Interesse an wissenschaftlichen und technischen Themen
-
Gute Deutsch- und Englischkenntnisse
Stundenumfang und Arbeitszeiten nach Absprache. Arbeit in (Teil-)Homeoffice ist möglich.
Um dich für diesen Job zu bewerben, besuche bitte www.stellenwerk.de.
