HPC/ML Infrastructure Engineer
Lead bringup, administration, and operations for a large-scale anime AI training GPU cluster. Bridge researchers and bare-metal systems using SLURM, filesystems, networking, and Linux sysadmin skills.
Salary not listed
On-siteDevOps / SRE
About the job
Responsibilities
- Lead bringup, administration, and operations on a large-scale anime AI training cluster
- Ensure SLURM jobs are running, parallel filesystems are serving, network is transmitting, and models are training
- Bridge between researchers and bare GPU machines
Requirements
- Experience with modern HPC software landscape including SLURM (Slinky on K8s), provisioning (warewulf/MAAS/ansible), filesystems (WEKA/VAST/Ceph), VPN/access (tailscale), monitoring (Grafana/Prometheus)
- Traditional Linux sysadmin skills including LDAP, dmesg triage, and directory permissions
- Comfortable with physical hardware: racking, stacking, provisioning HGX-based nodes, VLAN design, fiber routing
- Willing to work on small, fast-paced teams directly with AI researchers
- On-site collaboration preferred in Tokyo (Akihabara) or San Francisco (Dogpatch); Bay Area strongly preferred due to physical hardware presence
- Visa sponsorship available
Nice-to-Haves
- Love of anime and anime aesthetic
Skills
SlurmKubernetesAnsibleWekaCephGrafanaPrometheusLinuxLdapHpc