Ik zet je gpu-cluster en ai-infrastructuur op, valideer en los problemen op
Senior HPC en AI infrastructuur engineer, GPU SLURM Linux
Over deze dienst
Je hebt GPUs. Ze moeten zich gedragen als een betrouwbare compute-platform.
Ik bouw en beheer GPU- en HPC-infrastructuur in productie: provisioning, driver- en CUDA-stackvalidatie, planning, high-speed netwerken en monitoring. Ik werk op het infrastructuurniveau. Ik ben geen ML-engineer en doe alsof ik dat niet ben.
WAT IK DOE
GPU-node opstarten: NVIDIA driver, CUDA toolkit en runtime afstemmen, persistence mode, MIG
Gezondheidscontrole: DCGM-diagnostiek, Xid- en ECC-fouttriage, thermische en stroomcontrole
Multi-node GPU-communicatie: nccl-tests all-reduce benchmarking, NCCL-afstemming, netwerkpadvalidatie
Planning: SLURM GPU-partities en GRES, cgroups en binding, of Kubernetes met de NVIDIA device plugin en GPU Operator
Monitoring: Prometheus, DCGM exporter, Grafana dashboards
Automatisering: Ansible-rollen zodat de build herhaalbaar is
VOordat je bestelt
Stuur me een bericht met het aantal nodes, GPU-model, interconnect en wat je ziet. Als het iets is dat ik niet echt kan oplossen, zeg ik dat.
Je krijgt een werkende configuratie, benchmarkoutput die laat zien wat er is veranderd, en geschreven documentatie.
Server:
Databaseserver
Besturingssysteem:
Linux
Andere IT en ondersteuning diensten die ik aanbied
Veelgestelde vragen
Automatische vertaling
Schrijf je CUDA-kernels of train je modellen?
Nee. Ik werk aan de infrastructuur eronder: provisioning, drivers, planning, netwerken en monitoring. Modelcode en trainingscripts vallen buiten mijn scope, en ik zeg dat liever dan dat ik werk aanneem dat ik niet goed kan doen.
Welke toegang heb je nodig om te beginnen?
SSH met sudo op de nodes, en toegang tot BMC of IPMI als hardwarecontroles nodig zijn. Voor de Basic diagnose is read-only toegang meestal voldoende om mee te beginnen.
Werk je met cloud GPUs of alleen on-premise?
Beide. Bare-metal on-premise clusters en AWS GPU-instances.
Onze GPUs worden nauwelijks gebruikt. Kun je uitzoeken waarom?
Meestal wel. Laag gebruik komt meestal door planning, dataload, NUMA en affiniteit, of het interconnect. De Basic diagnose is precies voor deze vraag gemaakt, en je krijgt de metingen achter het antwoord.
Ondersteun je InfiniBand fabrics?
Mijn ervaring met high-speed netwerken is Ethernet en RoCE, niet InfiniBand. Als je fabric InfiniBand is, vertel ik dat je voordat je bestelt, in plaats van dat ik leer op je cluster.
2 reviews van deze dienst
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Specificering van de beoordeling
- Communicatieniveau van de freelancer
- Kwaliteit van de levering
- Waarde van de levering
Sorteer op
A apreda1

Verenigde Staten
I hired him again he assisted me with my project very effectively. I definitely recommend him
US$ 50-US$ 100
Prijs
1 dag
Looptijd
Nuttig?A aimen39

Algerije
Best seller + communication + skills + knowledge
US$ 50-US$ 100
Prijs
1 dag
Looptijd
H 
Reactie van de freelancer
Nuttig?
2 reviews van deze dienst
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Specificering van de beoordeling
- Communicatieniveau van de freelancer
- Kwaliteit van de levering
- Waarde van de levering
Sorteer op
A apreda1

Verenigde Staten
I hired him again he assisted me with my project very effectively. I definitely recommend him
US$ 50-US$ 100
Prijs
1 dag
Looptijd
Nuttig?A aimen39

Algerije
Best seller + communication + skills + knowledge
US$ 50-US$ 100
Prijs
1 dag
Looptijd
H 
Reactie van de freelancer
Nuttig?
