En tant qu'ingénieur en apprentissage automatique spécialisé en NLP et IA symbolique, je propose une évaluation complète, un benchmarking et un red-teaming pour vos Large Language Models (LLMs) et pipelines RAG. J'aide les équipes d'ingénierie à identifier les échecs en cas de cas extrêmes, à éliminer les hallucinations et à appliquer des mesures de sécurité strictes.
Ce que je propose :
- Audit de benchmarking et de performance des LLM : Évaluation de la précision du modèle, de la latence, de l'utilisation du contexte et des capacités de raisonnement selon des critères de test personnalisés.
- Détection d'hallucinations et de cas extrêmes : Tests de résistance des invites, précision de la récupération RAG et cohérence factuelle en conditions adverses.
- Red Teaming et tests de sécurité : Identification des vulnérabilités telles que les attaques par injection d'invites, les jailbreaks et les fuites d'invites système.
- Validation du schéma et des sorties : Vérification de la conformité stricte à la structure JSON/Pydantic, de l'exécution des appels de fonction et de la fiabilité de l'intégration API.
- Rapport d'audit détaillé et plan d'action : Analyse complète des échecs avec des solutions concrètes pour l'ingénierie des prompts et des recommandations de mesures de sécurité.