Questions in System Design
Design a distributed GPU job scheduler / model-training orchestration system; discuss throughput, resource contention, and fault recovery. Cover functional/non-functional requirements, capacity estimation, API and data model, scaling strategy, caching, and fault tolerance.