DOI: 10.1515/abitech-2026-0036 ISSN: 2191-4664
Data Engineering und Daten-Pipelines für die automatische Erschließung
Nico WagnerZusammenfassung
Der Artikel beschreibt den Aufbau reproduzierbarer Daten-Pipelines zur Bereitstellung von Daten für KI-Verfahren, insbesondere für Verfahren des maschinellen Lernens, im Kontext der automatischen Inhaltserschließung an der Deutschen Nationalbibliothek. Im Mittelpunkt stehen die automatisierte Aufbereitung extrahierter Texte, die Auswahl relevanter Publikationen für Training, Optimierung und Evaluation sowie die Transformation kontrollierter Vokabulare für die automatische Inhaltserschließung. Ergänzend wird das Tool datashed vorgestellt, das weiterführende Analysen, Bereinigung und Nachnutzung großer textueller Datenbestände ermöglicht.