Ik stem open source llms fijn af met lora full tuning en rl


Level 1
Over deze dienst
Automatische vertaling
Ik kan je helpen bij het ontwerpen en implementeren van geavanceerde LLM training en fijn afstem workflows voor domeinspecifieke assistenten, redeneer modellen, chatbots, instructie-volg modellen en taak-geoptimaliseerde taal systemen.
Data verzameling en dataset voorbereiding
* Web- en documentgebaseerde data verzameling
* Creatie van instructie dataset
* Generatie van prompt-respons paren
* Curatie van conversatie- en domeindatasets
* Data schoonmaak, deduplicatie, filtering en formatting
* Voorbereiding van voorkeur data voor reward modeling of RL
Supervised Fine-Tuning (SFT)
* LoRA / QLoRA fine-tuning
* Freeze fine-tuning
* Volledige fine-tuning
* Instructie tuning
* Chat model tuning
* Domeinadaptatie voor financiën, crypto, juridisch, support, technisch en privé datasets
Reinforcement Learning methoden
* RLHF-stijl pipeline ontwerp
* Reward modeling
* Voorkeur optimalisatie
* DPO / ORPO / PPO-stijl trainingsworkflows
* Afstemming tuning voor respons kwaliteit, formaat en taak gedrag
Training framework opzet
* Hugging Face Transformers
* TRL
* PEFT
* DeepSpeed
* Accelerate
* PyTorch
* bitsandbytes
* vLLM inference integratie
* Multi-GPU en gedistribueerde training setup
Maak kennis met Djordje S
Level 1
- Afkomstig uitServië
- Lid sindsjul 2024
- Gem. reactietijd1 uur
- Laatste levering1 maand
Talen
Servisch, Engels
Automatische vertaling
