
Technical Support Engineer – Slurm
Provide end-to-end Slurm support and incident resolution for production AI/HPC clusters, diagnosing scheduler components (slurmctld, slurmd, slurmdbd), scheduling and resource-management features, and surrounding infrastructure (Linux, networking, storage, authentication, databases, GPUs). Requires 5+ years administering Slurm in production and strong Linux administration, diagnostics, and communication skills; includes creating KB articles and collaborating with engineering.






