Conference Agenda
Overview and details of the sessions of this conference. Please select a date or location to show only sessions at that day or location. Please select a single session for detailed view (with abstracts and downloads if available).
|
Daily Overview |
| Session | |
|
Mittwoch, 2:3: Mittwoch, 2:3 – Named Entities Location: Hörsaal 2 lecture hall Session Chair: Jonas Müller-Laackman, Staats- und Universitätsbibliothek Hamburg | |
| Presentation 3 | |
Skalierbare Erfassung buchbezogener Entitäten in Zeitungsinseraten des 18. Jahrhunderts: Das Basler ›Avisblatt‹ als Spiegel des vormodernen Buchmarkts 1: Universität Basel, Switzerland; 2: Technische Universität Darmstadt, Germany; 3: Akademie der Wissenschaften und der Literatur Mainz, Germany Unser Vortrag stellt einen Ansatz zur Erfassung buchbezogener Entitäten in frühneuzeitlichen Zeitungsanzeigen im Basler ›Avisblatt‹ vor. Diese etwa 22000 Anzeigen enthalten häufig mehrere Buchtitel ohne standardisierte Separatoren. Um computergestützte Analysen für Einblicke in den lokalen Buchmarkt, Lesepraktiken und -interessen und Wissenszirkulation erst zu ermöglichen, ist eine strukturierte Extraktion der Buchtitel aus dem Anzeigentext essentiell. Erprobte Named-Entity-Regognition-Ansätze (NER) stoßen hierbei aufgrund von OCR-Fehlern und hoher orthographischer, stilistischer und formaler Varianz an ihre Grenzen. Zur automatischen XML-Annotation relevanter Entitäten (AUTHOR, TITLE, YEAR, ...) schlagen wir die Anwendung von Large Language Models vor, die eine gewisse Toleranz gegenüber historischen Sprachvarianten aufweisen. Die Nutzung eines lokalen, offenen Modells soll dabei möglichst viel Transparenz garantieren. Gleichzeitig werden durch die Annotation Trainingsdaten für die Entwicklung spezialisierter historischer NER-Verfahren generiert. Der resultierende strukturierte Datensatz von 20000 annotierten Anzeigen ermöglicht systematische Analysen frühneuzeitlicher Buchzirkulation und zeigt eine skalierbare Strategie für die systematische Öffnung historischer Textdaten für Analyse- und Trainingsverfahren. | |
