Je vais évaluer et comparer votre système LLM et vos sorties d'IA

S
samanazharr
S
samanazharr
Saman A.
Certaines informations ont été traduites automatiquement.

À propos de ce service

Traduction automatique

En tant qu'ingénieur en apprentissage automatique spécialisé en NLP et IA symbolique, je propose une évaluation complète, un benchmarking et un red-teaming pour vos Large Language Models (LLMs) et pipelines RAG. J'aide les équipes d'ingénierie à identifier les échecs en cas de cas extrêmes, à éliminer les hallucinations et à appliquer des mesures de sécurité strictes.


Ce que je propose :

  • Audit de benchmarking et de performance des LLM : Évaluation de la précision du modèle, de la latence, de l'utilisation du contexte et des capacités de raisonnement selon des critères de test personnalisés.
  • Détection d'hallucinations et de cas extrêmes : Tests de résistance des invites, précision de la récupération RAG et cohérence factuelle en conditions adverses.
  • Red Teaming et tests de sécurité : Identification des vulnérabilités telles que les attaques par injection d'invites, les jailbreaks et les fuites d'invites système.
  • Validation du schéma et des sorties : Vérification de la conformité stricte à la structure JSON/Pydantic, de l'exécution des appels de fonction et de la fiabilité de l'intégration API.
  • Rapport d'audit détaillé et plan d'action : Analyse complète des échecs avec des solutions concrètes pour l'ingénierie des prompts et des recommandations de mesures de sécurité.

Découvrez Saman A.

Saman A.

Data Annotation and LLM QA Expert

  • DePakistan
  • Membre depuisfévr. 2026
  • Temps de réponse moy.1 heure
  • Langues

    Anglais, Ourdou
I am a Machine Learning Engineer specializing in NLP, with hands-on experience building, evaluating, and deploying production-grade LLM systems. My background spans the full pipeline: from dataset curation and prompt engineering to security auditing, hallucination mitigation, and containerized deployment. Recently, my work focuses on LLM Evaluation & Alignment: refining model outputs through rigorous fact-checking, benchmark testing, prompt injection defense, and human-in-the-loop quality control.

Traduction automatique

Mon portfolio