Bases de connaissances
Une base de connaissances (KB) est un index recherchable de vos documents. Quand un agent est configuré pour utiliser une KB, il récupère les passages pertinents au runtime et ancre ses réponses dans votre contenu, réduisant les hallucinations et gardant les réponses factuelles.
Fonctionnement du RAG
Chaque requête pendant un appel passe par une pipeline Retrieval-Augmented Generation (RAG) :
- Embed, la requête de l'appelant est convertie en vecteur dense par le même modèle d'embeddings utilisé lors de l'indexation (
BAAI/bge-m3par défaut) - Retrieve, une recherche par similarité sémantique retourne les top-K chunks de documents les plus pertinents depuis l'index vectoriel
- Inject, les chunks récupérés sont préfixés au contexte du LLM comme un bloc « Context: » avant l'historique de conversation
- Generate, le LLM produit une réponse ancrée à la fois dans le contexte récupéré et la conversation
L'étape de récupération ajoute environ 20–60 ms à la latence LLM selon la taille de la KB et la complexité de la requête. C'est dans le budget de latence acceptable pour la voix temps réel.
Statut de la base de connaissances
Le statut est suivi au niveau de la base de connaissances, et non par document. Chaque base affiche l'un des quatre statuts dans la liste des bases de connaissances. Le cycle de vie normal est queued → ingesting → active (ou error en cas d'échec) :
queued, le téléversement a été accepté et attend d'être traité, par exemple lorsque l'ingestion est limitée (throttling). La base passe àingestingdès qu'un créneau de traitement se libère.ingesting, un téléversement de document ou une ré-ingestion est en cours pour la base.active, la base est prête à être interrogée, les agents peuvent y effectuer des recherches.error, la dernière ingestion a échoué. Vérifiez les documents et relancez le téléversement.
Types de KB
| Type | Description | Quand l'utiliser |
|---|---|---|
| Local | Les documents sont stockés et indexés sur l'infrastructure Manivox.ai avec les embeddings BAAI/bge-m3, avec un chunking et une récupération gérés par la plateforme. À la création, vous choisissez la langue du document et la lecture des images ; tout le reste est géré pour vous. |
Choix par défaut. Idéal pour la plupart des cas d'usage, téléversez des fichiers ou fournissez des URLs à crawler. |
| External | Connectez votre propre fournisseur RAG via une configuration de fournisseur mise en place par votre administrateur. Manivox.ai l'interroge au runtime mais ne stocke pas vos documents. Voir créer une KB External ci-dessous. | Quand vous avez déjà une infrastructure de recherche vectorielle à réutiliser (Pinecone, Weaviate, OpenSearch, etc.). |
Créer une base de connaissances External
Un administrateur de l'organisation doit d'abord ajouter une connexion de fournisseur de type RAG dans Paramètres → Fournisseurs (l'onglet Fournisseurs est réservé aux administrateurs de l'organisation) : une URL de recherche pour le point de terminaison du RAG distant et, en option, une URL qui liste ses collections existantes. Une fois cette connexion en place, depuis la liste des bases de connaissances :
- Cliquez sur Nouvelle base de connaissances et choisissez la connexion dans le menu déroulant Source de connaissances (par défaut, il pointe vers le Manifone RAG intégré, qui crée une KB Local à la place).
- Si la connexion dispose d'une URL de collections, cliquez sur Lister les KBs pour afficher les bases de connaissances distantes du fournisseur et en sélectionner une, sinon saisissez l'ID de la base distante manuellement.
- Nommez la KB et créez-la. Il n'y a ni langue ni modèle d'embeddings à choisir, ces réglages vivent chez le fournisseur distant.
Les KBs External n'ont pas de flux de téléversement, la gestion des documents (téléversement de fichiers, crawl d'URL, description d'images) ne s'applique qu'aux KBs Local, voir Téléverser des documents. Le format de réponse renvoyé par le RAG distant, et le seuil de pertinence qui lui est appliqué, sont configurés une seule fois par connexion, voir Configuration RAG → Seuil de pertinence.
Métriques de KB
Chaque base de connaissances expose trois compteurs, visibles dans le dashboard et dans la réponse de l'API :
| Champ | Type | Description |
|---|---|---|
document_count | integer | Nombre de documents indexés (fichiers téléversés ou URLs crawlées) |
chunk_count | integer | Nombre total de chunks vectoriels dans l'index |
storage_bytes | integer | Stockage estimé utilisé par les documents bruts + embeddings |
Partage entre agents
Une base de connaissances appartient à votre organisation, elle peut être attachée à autant d'agents que vous voulez dans la même organisation. Les modifications du contenu de la KB (nouveaux documents, suppressions) sont reflétées immédiatement pour tous les agents qui l'utilisent.
Pour attacher une KB à un agent : ouvrez l'éditeur d'agent et allez dans Paramètres → Base de connaissances, puis ajoutez des KBs depuis le menu déroulant. Un agent peut avoir plusieurs KBs attachées, toutes sont interrogées en parallèle à chaque requête de récupération.
Guides
- Téléverser des documents, formats supportés, OCR d'images, suivi de statut
- Accès aux données, synchroniser Google Drive & OneDrive dans une KB
- Configuration RAG, top-K, seuil de pertinence, prompt d'injection
Vous cherchez Google Drive ou OneDrive ? Le panneau Data sources d'une base de connaissances permet de connecter les deux comme source cloud, les fichiers que vous sélectionnez sont importés, découpés en chunks et indexés au même titre que ce qui est téléversé directement. Voir Accès aux données.
Quotas de stockage
Deux jauges en haut de l'espace Bases de connaissances indiquent l'espace de stockage que vous utilisez : une pour l'ensemble de l'organisation et une pour le compte courant. Chacune affiche l'espace utilisé par rapport à sa limite. Lorsqu'un quota est atteint, tout nouveau téléversement est bloqué jusqu'à ce que vous libériez de l'espace en supprimant des documents ou une base de connaissances. Les limites par compte et par organisation sont des valeurs par défaut de la plateforme.