Téléverser des documents
========================

Les documents sont la matière première de votre base de connaissances. Téléversez des fichiers directement ou fournissez des URLs à crawler. Une fois traités, les documents sont découpés en chunks et indexés pour la recherche sémantique pendant les appels.

![Document upload and data sources in a knowledge base](/docs/knowledge-bases-upload-dark.gif)

Formats supportés
-----------------

FormatExtensionsNotes   PDF`.pdf`Texte extrait page par page. Les images et graphiques peuvent être décrits si `enable_image_description` est activé. Word`.docx`Extraction complète du texte y compris tables et listes. Excel`.xlsx`Données du tableur extraites en texte. PowerPoint`.pptx`Texte des diapositives extrait. Texte brut`.txt`, `.md`, `.csv`, `.json`Importé tel quel. Le formatage Markdown et JSON est supprimé avant le chunking. HTML`.html`Les balises sont supprimées ; le texte lisible est extrait. URLs-Les pages sont récupérées et le texte extrait par scraping web. Le contenu rendu en JavaScript peut ne pas être capturé. **Limite de taille de fichier :** 50 Mo par fichier. Pour les PDF plus grands, découpez par chapitre ou section avant le téléversement.

Téléverser des fichiers
-----------------------

1. Ouvrez la base de connaissances et cliquez sur **Upload documents**
2. Glissez-déposez les fichiers ou cliquez pour parcourir. Plusieurs fichiers peuvent être sélectionnés à la fois.
3. Cliquez sur **Upload**. Les fichiers sont mis en file pour traitement immédiatement.

Ajouter une URL
---------------

Pour indexer une page web ou un ensemble de pages :

1. Cliquez sur **Add URL**
2. Saisissez l'URL de la page (ex : `https://help.yourcompany.com/faq`)
3. Cliquez sur **Import**. La page est récupérée et indexée.

Pour scraper un centre d'aide complet, activez le toggle **Crawl** au moment d'ajouter l'URL, le crawler suit les liens internes jusqu'à la profondeur configurée (défaut 2, max 10) et la limite de pages (défaut 100).

Modèle d'embeddings
-------------------

Toute base de connaissances locale est embeddée avec le même modèle géré par la plateforme, appliqué automatiquement. Il n'y a rien à choisir ni à régler ici :

ChampValeurDescription    `embedding_model` `BAAI/bge-m3` Modèle d'embeddings dense multilingue utilisé pour toute KB locale. Supporte 100+ langues avec une forte récupération cross-linguale, bien adapté aux agents multilingues où la langue des documents et de l'appelant peuvent différer.  Le modèle d'embeddings, le découpage (chunking) et la métrique de similarité sont des réglages plateforme fixes, ils ne sont pas configurables par base de connaissances. À la création d'une KB locale, les seuls choix sont la **langue du document** et la **lecture des images** (ci-dessous) ; tout le reste est géré pour vous afin que la récupération reste cohérente et fiable sur toutes les KB.

Description d'images (OCR pour graphiques et images)
----------------------------------------------------

Quand `enable_image_description` est activé sur la base de connaissances, les images intégrées dans les PDF et documents Word sont traitées par un modèle vision et décrites en texte. La description est incluse comme un chunk séparé, permettant à l'agent de répondre à des questions sur le contenu visuel, graphiques, diagrammes, captures d'écran, et tableaux rendus comme images.

RéglageTypeDéfautDescription    `enable_image_description` boolean `false` Quand activé, les images dans les documents téléversés sont décrites par un modèle vision et ajoutées comme chunks de texte à l'index.  Activez ce réglage quand vos documents contiennent des graphiques, captures d'écran ou diagrammes qui portent de l'information non disponible dans le texte environnant. Cela augmente le temps de traitement de 3 à 10× pour les PDF riches en images.

Statut de traitement
--------------------

Le statut d'indexation est suivi au **niveau de la base de connaissances**, et non par document. Après un téléversement ou une ré-ingestion, le statut de la base affiché dans la liste des bases de connaissances reflète la pipeline d'indexation. Un document passe par l'un des quatre statuts, dans l'ordre `queued` → `ingesting` → `active` (ou `error` en cas d'échec) :

StatutDescription   `queued`Le téléversement a été accepté et attend d'être traité, par exemple lorsque l'ingestion est limitée (throttling). Le document n'a pas encore commencé l'indexation, il passe à `ingesting` dès qu'un créneau de traitement se libère. `ingesting`Un téléversement de document ou une ré-ingestion est en cours : extraction de texte, chunking et embeddings sont en cours d'exécution. `active`Indexée et recherchable. La base est prête et les agents peuvent l'interroger. `error`L'ingestion a échoué : fichier corrompu, format non supporté, ou erreur d'extraction. Vérifiez les documents et essayez de re-téléverser. Le traitement se complète typiquement en 10–60 secondes pour des documents standards. Les grands PDF (100+ pages) avec description d'images activée peuvent prendre plusieurs minutes. Pendant que la base est en statut `ingesting`, les agents qui y sont attachés continuent de fonctionner et peuvent renvoyer des résultats obsolètes jusqu'au retour au statut `active`.

Supprimer des documents
-----------------------

Cliquez sur l'icône poubelle sur n'importe quel document pour le retirer de la KB. Les chunks correspondants sont supprimés de l'index vectoriel immédiatement. Cette opération ne peut pas être annulée, vous devez re-téléverser pour restaurer le document.

Réglages de crawl avancés
-------------------------

Lors de l'ajout de contenu par URL, vous pouvez affiner le crawl au-delà de la profondeur et du nombre de pages :

RéglageRôle  **Filtre d'URL**Un motif restreignant quelles URLs découvertes sont crawlées. **Délai de crawl**Pause entre les requêtes (défaut 1 seconde) pour ménager le site cible. **Respecter robots.txt**Activé par défaut — le crawler obéit aux règles robots du site. **Utiliser le sitemap**Activé par défaut — le crawler utilise le sitemap du site pour trouver les pages. **Synchronisation planifiée**Re-crawler une source URL automatiquement : manuel, toutes les heures, toutes les 6 heures, quotidien ou hebdomadaire. Voir et télécharger les documents
---------------------------------

Chaque document d'une base de connaissances dispose d'actions pour le **consulter** dans le navigateur ou **télécharger** le fichier original, afin que vous puissiez vérifier exactement ce que l'agent va récupérer.