Ik zet je LL.M. voor productie in met vLLM op je cloud GPU


Over deze dienst
Automatische vertaling
Een model dat in een notebook werkt en eentje dat 1.000 gelijktijdige gebruikers aankan, zijn twee verschillende projecten. Ik doe het tweede.
Ik ben een senior ML-infrastructuur engineer, met 7 jaar ervaring in productiebetrouwbaarheid. Recent: infrastructuur die meer dan 50.000 gelijktijdige taken afhandelt in minder dan 100 ms voor meer dan 1.000 gebruikers, gebouwd op vLLM en SGLang met GPU Kubernetes node pools, met 35% lagere infra-kosten dan toen ik begon.
Wat je krijgt:
- Jouw open-weight model (Llama, Mistral, Qwen, DeepSeek) bediend met vLLM
- Gehost in JOUW cloud account: jij houdt de sleutels, data en endpoint
- GPU autoscaling en batching afgestemd op inference, niet webverkeer
- Load-testresultaten, zodat je de echte capaciteit weet voordat je gebruikers het ontdekken
- Monitoring dashboards; runbook op Standard/Premium
Als je GPU-budget en latency-doel niet overeenkomen, zeg ik dat voordat je een cent uitgeeft aan compute.
Basic: één model, één GPU node, load-tested.
Standard: voegt autoscaling, tuning, dashboards toe.
Premium: multi-model, kostenpass, overdracht.
Stuur je model- en trafficgegevens; het requirements formulier dekt de rest.
Maak kennis met Joshua
Senior Platform Engineer
- Afkomstig uitNigeria
- Lid sindsjul 2026
Talen
Engels
Automatische vertaling
Mijn portfolio
Veelgestelde vragen
Automatische vertaling
Welke modellen kan je inzetten?
Open-weight modellen: Llama, Mistral, Qwen, DeepSeek, Gemma, en bijna alles op Hugging Face dat vLLM ondersteunt. Als je OpenAI/Anthropic API's bedoelt, heb je geen hosting infrastructuur nodig, en ik zeg dat dan ook, in plaats van je deze gig te verkopen.
Heb ik mijn eigen cloud account en GPUs nodig?
Ja, alles wordt in jouw account gedeployed (AWS, Azure, GCP, of on-premises), zodat je volledige controle hebt. Als je nog geen GPU-quota hebt, vertel ik je precies wat je moet aanvragen en welke instance types passen bij jouw model en budget.
Welke latency en throughput kan ik verwachten?
Dat hangt af van modelgrootte, quantization en GPU-keuze, daarom bevat elke levering load-test cijfers voor JOUW setup in plaats van algemene beloftes. Een latency onder 100 ms voor de eerste token is haalbaar voor veel middelgrote modellen op de juiste hardware.
Zijn mijn data en model privé?
Alles draait binnen jouw account en netwerk. Ik werk via scoped toegang die jij verleent en intrekt, en er wordt niets gekopieerd. NDA's zijn prima.
Wat telt als een revisie?
Het afstemmen van wat binnen de scope valt: batchgroottes, autoscaling drempels, endpoint configuratie. Een ander model, een tweede omgeving, of nieuwe tooling is nieuwe scope, als add-on te vermelden.

