
Senior ML Engineer | Kimchi (LLM Inference Optimization)
Work on inference and serving infrastructure to improve throughput, latency, and KV cache utilization across GPUs and distributed topologies. Responsibilities include kernel-level tuning, quantization without quality regression, profiling and benchmarking, batching and speculative decoding, memory and cold-start optimizations, and setting technical direction. Technology stack includes Python, vLLM, SGLang, TensorRT-LLM, PyTorch, CUDA, Kubernetes and observability/tooling such as Prometheus, Grafana, ClickHouse and GitLab CI.


