Je vais construire des modèles NLP pour la classification de texte et l'extraction de documents
Ingénieur en apprentissage automatique, agents AI, MCP et vision par ordinateur
À propos de ce service
Je crée des pipelines NLP et de traitement de documents pour la classification de texte, l'extraction structurée et l'automatisation des flux de travail.
Selon votre tâche, je prépare et étiquette les données, ajuste un modèle transformer ou utilise un pipeline d'extraction LLM, valide les champs, et livre du code Python ou un service FastAPI.
Mon travail en procurement inclut une classification d'éligibilité avec Macro F1 0.9639 et une précision de 96,4 %, ainsi que des pipelines d'extraction de documents traitant environ 2000 notices par jour. Ces résultats proviennent de projets spécifiques, et ne garantissent pas de performances pour de nouvelles données.
Le périmètre peut inclure le traitement de PDF, HWP/HWPX ou de texte, des sorties JSON ou CSV, la validation des champs, l’évaluation et les instructions de déploiement. La reconnaissance optique de caractères (OCR) et les mises en page inhabituelles doivent être discutées avant la commande.
Veuillez envoyer des fichiers représentatifs, les champs ou étiquettes requis, le volume de données et votre environnement cible. Nous conviendrons des livrables et des critères d'acceptation avant le début du travail.
Mon portfolio
Autres services de Data science et machine learning I Offre
FAQ
Traduction automatique
Quelle expérience pertinente en NLP avez-vous ?
J'ai construit des classificateurs d'éligibilité en procurement utilisant RoBERTa et LoRA, des pipelines d'extraction de documents, et des modèles ONNX INT8 servis via FastAPI. Mon travail couvre la préparation des données, l’évaluation et le déploiement, avec des résultats mesurés séparément pour chaque tâche.
Et si je dispose de très peu de données étiquetées ?
Nous pouvons envisager le transfert d'apprentissage, la supervision faible ou une baseline LLM, selon la tâche. J'examinerai des exemples représentatifs et évaluerai sur des données réservées. Un seul échantillon ne garantit pas une précision fiable.
Pouvez-vous aussi gérer la collecte de données ?
La préparation ou la collecte de données peut être incluse si les sources, l'accès autorisé et les champs requis sont convenus à l'avance. Les formats de documents et les besoins en OCR doivent être examinés à l’aide d’échantillons avant que je confirme le périmètre.
Quelle précision peuvent atteindre les modèles ?
La précision dépend de la tâche, des étiquettes, de la qualité des données et de la division d’évaluation. Nous établissons une ligne de base et mesurons sur des échantillons réservés en utilisant des métriques appropriées telles que la précision, le rappel et le F1. Les résultats de projets passés ne garantissent pas la performance sur un nouveau jeu de données.
