Je vais affiner des LLM open source avec LoRA en tuning complet et RL


Level 1
À propos de ce service
Traduction automatique
Je peux vous aider à concevoir et à mettre en œuvre des workflows avancés de formation et de fine-tuning de LLM pour des assistants spécifiques à un domaine, des modèles de raisonnement, des chatbots, des modèles suivant des instructions et des systèmes linguistiques optimisés pour des tâches.
Collecte de données et préparation de datasets
* Collecte de données sur le web et à partir de documents
* Création de datasets d'instructions
* Génération de paires prompt-réponse
* Curation de conversations et de datasets de domaine
* Nettoyage, déduplication, filtrage et mise en forme des données
* Préparation de données de préférence pour la modélisation de récompenses ou RL
Fine-tuning supervisé (SFT)
* Fine-tuning LoRA / QLoRA
* Fine-tuning en freeze
* Fine-tuning complet
* Tuning d'instructions
* Tuning de modèles de chat
* Adaptation de domaine pour la finance, la crypto, le juridique, le support, la technique et les datasets privés
Méthodes d'apprentissage par renforcement
* Conception de pipeline de RLHF
* Modélisation de récompenses
* Optimisation des préférences
* Workflow d'entraînement DPO / ORPO / PPO
* Ajustement de l'alignement pour la qualité des réponses, le format et le comportement des tâches
Configuration du cadre d'entraînement
* Hugging Face Transformers
* TRL
* PEFT
* DeepSpeed
* Accelerate
* PyTorch
* bitsandbytes
* Intégration de l'inférence vLLM
* Configuration d'entraînement multi-GPU et distribué
Découvrez Djordje S
Level 1
- DeSerbie
- Membre depuisjuil. 2024
- Temps de réponse moy.1 heure
- Dernière commande1 mois
Langues
Serbe, Anglais
Traduction automatique
