Senior Storage Production Engineer - DGX Cloud
NVIDIA / Remote - United States
Responsible for designing, implementing, and supporting large-scale storage clusters and storage services for GPU cloud (DGX Cloud). Duties include monitoring, logging, alerting, capacity planning, performance tuning, automation, on-call support, and ensuring data security/compliance. Requires 8+ years' experience with distributed/high-performance storage, storage networking protocols (NFS, SMB, iSCSI, S3, Fibre Channel, RDMA, NVMe-oF), Linux-based systems, programming for automation (C/C++, Java, Python, Go, NodeJS, Bash), and infrastructure-as-code/observability tools (Ansible/Terraform/Chef/Puppet, Prometheus/Grafana/InfluxDB/Elastic).
Site Reliability Engineer Full-time $176K – $333.5K