Je vais construire un pipeline RAG de production sur votre connaissance métier


À propos de ce service
Traduction automatique
Les démos RAG sont faciles. RAG qui résiste aux vraies questions ne l’est pas toujours.
Je crée des pipelines de récupération qui tiennent lorsqu’un utilisateur pose une question difficile : récupération hybride (vectorielle plus mot-clé), une étape de reranking, découpage conçu selon la forme de votre document plutôt qu’un nombre fixe de tokens, et un ensemble d’évaluation pour prouver la précision plutôt que d’espérer qu’elle soit là.
Ce que vous obtenez :
- Ingestion de vos sources réelles : PDFs, documents, feuilles, sites web, tables de bases de données, tickets de support
- Nettoyage et une représentation canonique du document, l’étape que la plupart des pipelines sautent
- Récupération hybride plus reranking avec cross-encoder, ajusté à vos questions
- Un ensemble de questions d’or avec des résultats notés, pour voir une régression avant que vos utilisateurs ne la découvrent
- Génération ancrée avec citations renvoyant au fragment source
- Déployé sous forme d’API que vous possédez, ou directement dans votre application existante
Je gère cela sur un système multi-tenant en production, y compris les parties peu glamour : réindexation lors de changements de contenu, coût par requête, budgets de latence et voies de secours.
Dites-moi quels sont vos documents et ce que les gens doivent leur demander.
Découvrez Ehsan
AI Agent and RAG Engineer
- DeInde
- Membre depuisjuin 2024
- Temps de réponse moy.1 heure
Langues
Anglais
Traduction automatique
FAQ
Traduction automatique
Quelle base de données vectorielle utilisez-vous ?
Postgres avec pgvector par défaut : économique, et un système en moins à gérer. Pinecone, Qdrant ou Weaviate si vous les utilisez déjà ou si vous les préférez.
Sur quel LLM cela va-t-il fonctionner ?
Le vôtre ou le mien. OpenAI, Anthropic, Gemini, ou modèles open-weight que vous hébergez. L’auto-hébergement devient vraiment moins cher au-delà d’un certain volume, et je vous dirai honnêtement où cette limite se situe pour votre usage.
Peut-il fonctionner entièrement sur notre infrastructure ?
Oui, y compris avec des modèles auto-hébergés, sans que le contenu des documents quitte votre environnement. Indiquez-moi vos contraintes de résidence des données dès le départ, et je m’adapterai.
Comment puis-je être sûr que la récupération est réellement précise ?
Vous obtenez un ensemble de questions d’or avec des résultats de récupération notés sur vos propres données. La précision est indiquée par des chiffres, pas par des affirmations. Sur Standard et Premium, vous avez aussi les scores avant et après.
Pouvez-vous travailler avec des documents ou images scannés ?
Oui, avec OCR. Signalez-le lorsque vous me contactez pour que je puisse l’intégrer correctement, car les sources scannées modifient considérablement le travail d’ingestion.

