Ik rol mlops, llm en gpu-infrastructuur uit en beheer ze op aws en kubernetes
Senior AI DevOps Engineer: AWS, Kubernetes, ComfyUI API's, DevSecOps
Over deze dienst
Ik zet AI-modellen in productie en houd ze draaiende. Een training script is geen product. Een gemonitorde, versieerbare, autoscaling service wel.
Tools:
Kubernetes
•
Docker
•
Amazon EKS
Frameworks:
Terraform
•
Ansible
Programmeertaal:
Bash
•
Go
•
Python
Expertise:
Installatie
•
Migratie
•
Debuggen
Andere DevOps-techniek diensten die ik aanbied
Veelgestelde vragen
Automatische vertaling
Welke modellen kan je inzetten?
Elke open model op Hugging Face plus Llama, Mistral, Qwen, DeepSeek en jouw eigen fine tunes. Voor beeld en video verzorg ik ook Flux, SDXL en Wan. Vertel me het model en ik bevestig de GPU die het nodig heeft.
Heb ik mijn eigen cloudaccount nodig?
Ja, en dat is opzettelijk. Alles draait in jouw AWS, GCP of RunPod account zodat jij de infrastructuur bezit en de facturering controleert. Ik zet het op en draag het over.
Wat kost het om het per maand te draaien?
Hangt af van modelgrootte en verkeer. Voordat je bestelt, geef ik je een inschatting: GPU-type, verwachte benutting en een maandelijkse range. Spot instances en opschalen naar nul besparen meestal veel kosten.
Krijg ik de Terraform en Helm broncode?
Altijd. Je krijgt de volledige repository, Dockerfiles, Terraform of Helm charts en API documentatie, zodat jij of een andere engineer het later kan onderhouden.
Kun je een bestaande setup repareren in plaats van een nieuwe bouwen?
Ja. Foute deployments, OOM crashes, GPU knooppunten die niet plannen, oncontroleerbare cloudkosten en ongedocumenteerde infrastructuur behoren tot mijn belangrijkste werkzaamheden.
Doe je ook self hosted LLMs on premise?
Ja. Ollama of vLLM met Open WebUI op je eigen server of GPU werkstation, volledig offline, zonder dat data je netwerk verlaat.
Welke monitoring krijg ik?
Prometheus en Grafana met dashboards voor latency, throughput, GPU-utilisatie, foutpercentage en kosten per request, plus alerts die je bereiken voordat je gebruikers het merken.
Wat zijn je werkuren?
Ik ben 24/7 beschikbaar en werk volgens Amerikaanse uren, zodat we in jouw tijdzone kunnen praten. Ik reageer meestal binnen een uur.
