Je vais former un modèle vision-langage pour toute tâche de grounding

O
osmen_zahid
O
osmen_zahid
Osmen
Certaines informations ont été traduites automatiquement.

À propos de ce service

Traduction automatique

Avez-vous besoin d’un modèle Vision-Language qui fonctionne 

sur VOS données et non sur des benchmarks génériques ?


Les VLM sont puissants. Mais dès leur sortie de l’emballage, ils échouent 

sur des domaines personnalisés. Le grounding linguistique se brise 

et l’attention visuelle se disperse. La performance 

peut parfois chuter à des niveaux proches du hasard.


Je fine-tune des modèles vision-langage pour des 

tâches de tracking, grounding, détection et récupération 

dans le domaine que vous utilisez.


Ce sur quoi j’ai travaillé :


  • - Tracking multi-objets guidé par le langage en surveillance et environnements urbains
  • - Adaptation de domaine de jeux de données de trafic à des scénarios réels avec caméras fixes
  • - Réduction du travail manuel d’annotations jusqu’à 70 % grâce à des pipelines automatisés
  • - Création de benchmarks pour des cas d’usage spécifiques


Ce que je fournis :

- Modèle fine-tuné entraîné sur votre dataset

- Évaluation des performances et rapport de métriques

- Résultats d’explicabilité sur demande

- Code propre, documenté et entièrement à vous


Je travaille avec des architectures basées sur transformer,

fusion de modalités dans les VLM, et pipelines d’annotation personnalisés. Je comprends où ces modèles 

échouent et comment y remédier.


Contactez-moi d’abord avec votre cas d’usage et 

dataset, je vous dirai exactement ce qui 

est réalisable avant que vous vous engagiez.

Découvrez Osmen

Osmen

AI Engineer : Computer Vision and VLM Specialist

  • DePakistan
  • Membre depuismai 2026
  • Temps de réponse moy.1 heure
  • Langues

    Ourdou, Anglais, Punjabi
I'm an AI Engineer specializing in Computer Vision and Vision-Language Models (VLMs). I build deep learning pipelines that solve real problems — from language guided and intelligent tracking to medical image analysis , explainable AI and OCR based systems . What I work with: - Object detection and segmentation - Language-guided Multi-object tracking - Vision-Language Models - Explainable AI for medical imaging analysis - OCR and document understanding - PyTorch, OpenCV, Python etc I deliver clean, documented, production-ready code. If you have a computer vision problem, let's solve it.

Traduction automatique

Mon portfolio