Jobs
ElevenLabs 로고

ElevenLabs

HPC Infrastructure Engineer - GPU Clusters

인프라·DevOps

AI 요약

ElevenLabs의 GPU 클러스터 연구 인프라 엔지니어 채용 공고입니다. NVIDIA GPU 기반 대규모 Linux 서버 환경을 운영·개선하며, 프로비저닝, 스케줄링, 모니터링, 업그레이드, 용량 계획, 자동화, 성능 튜닝, 보안, 하드웨어 진단까지 전담합니다. 원격 근무가 가능하며, 연간 교육비 성격의 지원금과 오프사이트/코워킹 지원이 제공됩니다.

주요 업무

GPU 플릿의 프로비저닝, 스케줄링, 모니터링, 업그레이드, 용량 계획 수행. 노드 헬스체크, 자동 드레이닝/복구, 신규 자원 burn-in 등 자동화 구축. OS images, NVIDIA drivers, CUDA, container runtimes, NCCL, InfiniBand/RoCE 등 하위 인프라 관리. Slurm 또는 유사 스케줄러 운영 및 튜닝. 데이터셋과 체크포인트용 고성능 스토리지 구축 및 유지. 성능 저하 원인 분석 및 개선. GPU 클라우드/임대 자원 벤치마크 및 SLA 검증. 랙킹, 케이블링, 진단 등 하드웨어 작업과 데이터센터 협업. 접근 제어, 네트워크 분리, secrets 관리로 보안 유지.

자격 요건

필수: 대규모 Linux 서버 또는 GPU 환경을 프로덕션에서 운영한 경험, NVIDIA 스택(driver, CUDA, NCCL, DCGM) 이해 또는 이를 빠르게 학습할 수 있는 시스템 경험, 베어메탈 환경·서버 하드웨어·고속 네트워킹 경험, Python 및/또는 Bash 자동화 작성 능력, Ansible 또는 Terraform 같은 IaC 도구 활용 경험, metrics/logs/PromQL 등 noisy data를 분석해 문제를 찾는 역량, end-to-end scope를 책임지는 태도, 데이터센터 현장 작업도 감수할 수 있는 자세. 우대: ML training workload 인프라 지원 경험, GPU 클라우드 공급자 평가 경험, WEKA/VAST 등 병렬 파일시스템 또는 대규모 object storage 경험, BMC/IPMI/Redfish 자동화, PXE provisioning at scale, dense GPU 배포의 전력/냉각 이해.

기술 스택

LinuxNVIDIACUDANCCLDCGMPythonBashAnsibleTerraformPromQLSlurmInfiniBandRoCEWEKAVASTBMCIPMIRedfishPXE
AI 점수 78AI 핵심 직무

ElevenLabs의 다른 공고

알림

알림이 없습니다