Darstellung
Dokumentation für Version
1.1aktuellStand 1.1.1 · 25.09.2026Beim Wechsel bleiben Sie auf derselben Seite, sofern es sie in der anderen Version gibt.
Darstellung
Jedes Dokument wird beim Aufnehmen in reinen Text umgewandelt, damit es durchsuchbar ist. Das gilt für hochgeladene Dateien ebenso wie für Dokumente, die aus einer angebundenen Quelle abgeglichen werden.
| Gruppe | Formate |
|---|---|
| Dokumente | PDF, DOCX, PPTX, XLSX |
| Text | TXT, MD, HTML, CSV, XML, AsciiDoc, LaTeX |
| Bilder (mit Texterkennung) | PNG, JPG, TIFF, WEBP |
Alte Office-Formate: Die Binärformate
.doc,.xlsund.pptaus der Zeit vor Office 2007 werden abgewiesen. Öffnen Sie die Datei und speichern Sie sie als.docx,.xlsxbeziehungsweise.pptx.
Es gibt zwei Wege, und das System wählt selbst:
Die Texterkennung braucht spürbar länger als das direkte Auslesen. Bei vielen umfangreichen Scans kann sich die Verarbeitung deshalb hinziehen.
Laufende Kopf- und Fußzeilen — der Dokumenttitel oben auf jeder Seite, die Seitenzahl unten — werden beim Auslesen weggelassen. Sie gehören zur Seitengestaltung, nicht zum Inhalt: mitgenommen würden sie den Text auf jeder Seitengrenze unterbrechen und in einer Übersetzung oder Zusammenfassung mitten im Satz auftauchen.
Das System erkennt sie auf zwei Wegen. Meist ergibt sich die Zuordnung schon aus dem Seitenaufbau. Wo das Layout ungewöhnlich ist, hilft die Wiederholung: Eine kurze Zeile, die auf den meisten Seiten an derselben Stelle am Rand steht, wird als Seitengestaltung behandelt.
Überschriften und Tabellenzeilen sind davon ausgenommen — sie bleiben immer erhalten, auch wenn sie sich ähneln.
Ein Inhaltsverzeichnis wird derzeit nicht entfernt. Es zählt als Inhalt der Seite und wird deshalb mitgelesen.
Tabellen werden in einem auf Durchsatz ausgelegten Modus erkannt. Bei sehr komplexen Tabellen — stark verschachtelt, viele verbundene Zellen, ungewöhnliche Layouts — kann die Zuordnung einzelner Zellen abweichen. Der Inhalt bleibt dabei vollständig erhalten.
Fällt Ihnen ein Dokument auf, dessen Tabellen erkennbar falsch übernommen wurden, melden Sie es: Für solche Fälle lässt sich ein genauerer Modus einschalten.
Angebundene Quellen werden regelmäßig automatisch abgeglichen. Vor der Verarbeitung wird geprüft, ob sich ein Dokument seit dem letzten Mal geändert hat. Unveränderte Dokumente werden übersprungen — keine erneute Texterkennung, keine erneute Aufbereitung.
Ändert sich der Inhalt, wird das Dokument automatisch neu eingelesen. Für Sie ändert sich am Ergebnis nichts; der Abgleich läuft nur schneller.
| Grenze | Standardwert |
|---|---|
| Dateigröße beim Hochladen | 20 MB pro Datei |
| Berücksichtigte Textlänge je Dokument | 100 000 Zeichen |
Ist ein Dokument länger, wird es an dieser Grenze abgeschnitten. Ein entsprechender Hinweis erscheint am Dokument. Sehr umfangreiche Werke teilen Sie deshalb besser in mehrere Dateien auf — etwa nach Kapiteln —, damit der gesamte Inhalt auffindbar bleibt.
Ihre Organisation kann abweichende Werte eingestellt haben.