Je vais effectuer un jailbreak de modèle d'IA, tester l'injection de prompt et analyser la sécurité des LLM


commande 1 en file d'attente
À propos de ce service
Traduction automatique
Je réaliserai une évaluation complète de la sécurité des modèles d'IA, incluant des tests de jailbreak, l'analyse d'injection de prompt, des tentatives de contournement des filtres de sécurité et la détection de vulnérabilités pour les LLM et chatbots.
Je me spécialise dans l'identification des faiblesses des systèmes d'IA et la mise en évidence de la manière dont des attaquants peuvent manipuler votre modèle pour produire des réponses non sécurisées, nuisibles, biaisées ou non autorisées.
CE QUE JE VAIS TESTER
1. Attaques de jailbreak
- Jailbreak de style DAN
- Contournement du prompt système
- Attaques de changement de personnalité
- Fuite de rôle et activation forcée du mode interne
2. Attaques d'injection de prompt
- Manipulation directe du prompt
- Injection indirecte de prompt (instructions cachées)
- Injection HTML/Markdown dans le prompt
- Attaques de poisoning du contexte
3. Contournement du filtre de sécurité
- Contournement des garde-fous de sécurité
- Obtenir du modèle qu'il produise du contenu restreint
- Contournement des limites éthiques
- Conflits de politique cachés
4. Attaques adversariales multi-étapes
- Manipulation de la chaîne de pensée
- Attaques contextuelles multi-couches
- Fuites d'instructions récursives
5. Tests de hallucination et de biais
- Conditions déclencheuses d'hallucination
- Vérifications de l'amplification des biais
- Réponses contradictoires <li Pièges de raisonnement incorrect
Découvrez Manjeet
- DeInde
- Membre depuisavr. 2025
- Temps de réponse moy.1 heure
- Dernière commande1 mois
Langues
Anglais
Traduction automatique

