Skip to content
SpellbrushSpellbrushSan Francisco, CA

HPC/ML Infrastructure Engineer

Lead bringup, administration, and operations for a large-scale anime AI training GPU cluster. Bridge researchers and bare-metal systems using SLURM, filesystems, networking, and Linux sysadmin skills.

Salary not listed
On-siteDevOps / SRE

About the job

Responsibilities

  • Lead bringup, administration, and operations on a large-scale anime AI training cluster
  • Ensure SLURM jobs are running, parallel filesystems are serving, network is transmitting, and models are training
  • Bridge between researchers and bare GPU machines

Requirements

  • Experience with modern HPC software landscape including SLURM (Slinky on K8s), provisioning (warewulf/MAAS/ansible), filesystems (WEKA/VAST/Ceph), VPN/access (tailscale), monitoring (Grafana/Prometheus)
  • Traditional Linux sysadmin skills including LDAP, dmesg triage, and directory permissions
  • Comfortable with physical hardware: racking, stacking, provisioning HGX-based nodes, VLAN design, fiber routing
  • Willing to work on small, fast-paced teams directly with AI researchers
  • On-site collaboration preferred in Tokyo (Akihabara) or San Francisco (Dogpatch); Bay Area strongly preferred due to physical hardware presence
  • Visa sponsorship available

Nice-to-Haves

  • Love of anime and anime aesthetic

Skills

SlurmKubernetesAnsibleWekaCephGrafanaPrometheusLinuxLdapHpc