Ons bureau implementeert zelfgehoste AI met open webui en rag


Bureau
Over deze dienst
Automatische vertaling
Heb je een AI-assistent nodig die draait op je eigen infrastructuur, met je eigen documenten?
WZ-IT implementeert self-hosted LLM en RAG stacks voor bedrijven die geen interne data naar een US API kunnen sturen. Open WebUI als interface, LiteLLM als gateway, Qdrant of pgvector voor retrieval, Langfuse voor tracing en kostenbeheer.
Afhankelijk van de scope dekken we:
- Open WebUI met SSO, gebruikersgroepen en modeltoegang per team
- LiteLLM gateway: één API voor lokale en externe modellen, budgetten per team
- vLLM of Ollama inference, afgestemd op je GPU- of CPU-budget
- RAG pipeline: ingestion, chunking, embeddings, Qdrant of pgvector
- permissie-gevoelige retrieval zodat gebruikers alleen documenten zien die ze mogen zien
- Langfuse voor tracing, evaluatie en kosten per team
- implementatie op je GPU-server, Europese cloud of on-premises
Het moeilijkste is niet het chatvenster. Het is ervoor zorgen dat retrieval de permissies respecteert die je al hebt, en dat je de echte maandelijkse kosten weet.
Begin met de consultatie: een uur met beide WZ-IT oprichters, plus een schriftelijke aanbeveling die je in elk geval behoudt. Alles groter wordt geoffreerd als een maatwerkdienst, afgestemd op wat je echt nodig hebt.
Meer van ons werk: wz-it.com
Over dit bureau

Bureau
3 werknemers
- Afkomstig uitDuitsland
- Lid sindsokt 2019
- Gem. reactietijd1 uur
- Laatste levering1 jaar
Talen
Duits, Engels, Nederlands
Automatische vertaling
Portfolio
Veelgestelde vragen
Automatische vertaling
Welke model moeten we gebruiken?
Het hangt af van de taak, taal en hardware. Kleine open-weight modellen behandelen de meeste interne assistenten; een 70B-model vereist serieus GPU-budget. We bepalen de grootte op basis van je use case.
Respecteert RAG onze bestaande permissies?
Alleen als het zo is gebouwd. Filtering moet plaatsvinden vóór de vector search, niet door het model te laten gedrag vertonen. Dat is de kern van het RAG Platform pakket.
Heb je een GPU nodig?
Niet altijd. Kleine modellen en CPU inference zijn haalbaar bij lage gelijktijdigheid. We vertellen je in welk geval je zit voordat je hardware koopt.
Kun je het verbinden met Nextcloud of een bestandsdeling?
Ja, als documentbron in de ingestion pipeline, inclusief permissie mapping.
4 reviews van deze dienst
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Specificering van de beoordeling
- Communicatieniveau van de freelancer
- Aanbevelingswaardig
- Dienst zoals beschreven
Sorteer op
P pawelpavlo

Duitsland
Very well and quickly executed order :) I recommend !!!
Nuttig?D dnlnrx
Terugkerende klant

Duitsland
Exzellente Arbeit. 1A Kommunikation.
Nuttig?S sbroderman

Zweden
Perfect delivery!
Nuttig?S 
sangeorgean2
Terugkerende klant

Duitsland
Super, thank you!
Nuttig?
4 reviews van deze dienst
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Specificering van de beoordeling
- Communicatieniveau van de freelancer
- Aanbevelingswaardig
- Dienst zoals beschreven
Sorteer op
P pawelpavlo

Duitsland
Very well and quickly executed order :) I recommend !!!
Nuttig?D dnlnrx
Terugkerende klant

Duitsland
Exzellente Arbeit. 1A Kommunikation.
Nuttig?S sbroderman

Zweden
Perfect delivery!
Nuttig?S 
sangeorgean2
Terugkerende klant

Duitsland
Super, thank you!
Nuttig?
