Zum Hauptinhalt springen

Dokumente

PDF-, Word- und PowerPoint-Dokumente können als Wissensquellen verwendet und für Antworten des Chatbots indexiert werden.

Dokumente hinzufügen

Dokumente können manuell über das CMS, über den Import mit der REST API oder automatisch über den Website-Crawler hinzugefügt werden. Im CMS lassen sich mehrere Dokumente gleichzeitig per Drag-and-Drop oder über die Dateiauswahl hochladen – auch wenn die Dateien unterschiedliche Formate haben.

Unterstützt werden folgende Formate:

  • PDF (.pdf)
  • Word (.docx)
  • PowerPoint (.pptx)

Bei Webseiten können zusätzlich verlinkte PDF-, Word- und PowerPoint-Dokumente automatisch erkannt und indexiert werden. Weitere Informationen dazu findest du im Kapitel Webseiten.

Der Dateiname wird automatisch als Name der Wissensquelle übernommen. Bei PDF-Dokumenten wird nach dem Upload eine Vorschau der ersten Seite angezeigt.

Indexierung

Nach dem Hinzufügen wird der Textinhalt automatisch extrahiert und in der Wissensdatenbank indexiert. Der Chatbot kann die darin enthaltenen Informationen anschliessend für seine Antworten verwenden.

info

Bilder in Dokumenten werden bei der Indexierung ignoriert. Nur der Textinhalt wird extrahiert.


Häufig gestellte Fragen

Werden gescannte PDF-Dokumente unterstützt?

Die Verarbeitung von gescannten PDFs mittels OCR (Optical Character Recognition) ist technisch möglich, aber keine Standardfunktion. Bei Bedarf kann diese Funktionalität für dein Projekt aktiviert werden. Kontaktiere uns, um die OCR-Unterstützung für gescannte Dokumente einzurichten.

Werden Bilder in PDF-Dokumenten verarbeitet?

Nein, Bilder in PDF-Dokumenten werden bei der Indexierung nicht verarbeitet. Nur der Textinhalt des PDFs wird extrahiert und in die Wissensdatenbank übernommen. Bildseiten oder Seiten mit ausschliesslich grafischem Inhalt werden als 'Kein Inhalt' markiert.