Je vais mettre votre agent LLM à l’épreuve pour injection de prompt et attaques par mémoire


À propos de ce service
Traduction automatique
Votre agent LLM est-il sécurisé face à de vrais utilisateurs ? Je le testerai comme le ferait un adversaire réel et vous indiquerai précisément ce qui ne va pas et comment le réparer.
Je suis chercheur en sécurité de l’IA, avec des publications à ICML et IJCNLP, et des travaux sur arXiv concernant les attaques par mémoire contre les agents LLM. J’ai aussi créé des benchmarks d’évaluation LLM-judge, pour que mes tests soient systématiques et reproductibles, pas basés sur quelques prompts astucieux.
Ce que je teste :
- Injection de prompt (directe et via documents, pages web ou sorties d’outils)
- Jailbreaks et contournement de politiques
- Mauvaise utilisation d’outils et d’appels de fonctions
- Poisoning de mémoire et de contexte dans des agents avec mémoire à long terme
- Fuite de prompt système et de données
Ce que vous obtenez :
Un rapport écrit clair avec chaque découverte, un exemple reproductible, une évaluation de gravité et une solution concrète. Les packages supérieurs incluent la suite d’attaques sous forme de code pour que vous puissiez la relancer, ainsi qu’un nouveau test après correction.
Compatible avec OpenAI, Anthropic, modèles open-source, LangChain, LlamaIndex et stacks d’agents personnalisés. Contactez-moi d’abord avec une brève description de votre agent, je confirmerai la portée. Je ne teste que des systèmes que vous possédez ou pour lesquels vous avez l’autorisation.
Découvrez Sidharth P
AI Safety Researcher and LLM Fine Tuning Expert
- DeInde
- Membre depuisavr. 2017
Langues
Telugu, Anglais, Hindi
Traduction automatique
Mon portfolio
Autres services de Développement IA I Offre
FAQ
Traduction automatique
Avez-vous besoin d’accéder à mon système de production ?
Non. Je peux tester une copie de staging, un endpoint API avec une clé de test, ou un prompt et une spécification d’outil que vous partagez. Je ne teste que des systèmes que vous possédez ou pour lesquels vous avez l’autorisation, et je n’ai jamais besoin de données utilisateur réelles.
Que dois-je partager pour commencer ?
Un endpoint de test ou une version de staging de votre agent, son prompt système, les outils qu’il peut appeler et ce qu’il ne doit jamais faire. Si il possède une mémoire à long terme ou lit des documents ou pages web, indiquez-le, car ce sont des voies d’attaque courantes.
Allez-vous garder confidentielles mes systèmes et découvertes ?
Oui. Vos prompts, code, données et résultats ne sont utilisés que pour votre projet et ne sont partagés qu’avec vous. Je ne publie ni ne réutilise rien de spécifique à votre système.
Quels modèles et frameworks supportez-vous ?
Agents construits sur OpenAI, Anthropic, Gemini ou modèles open-source (Llama, Qwen, Mistral et autres), utilisant LangChain, LlamaIndex, CrewAI, MCP ou une stack personnalisée. Si cela prend du texte en entrée, je peux le tester.

