Arabographische Texterkennung von Referenzwerken. Herausforderungen beim Einsatz Deep-Learning-basierter Anwendungen
Vortrag auf dem Digital Humanities Day #7, Ruhr-Universität Bochum, Panel DH @ MENA (Lib.) (Chairs: Vivian Strotmann, Volker Adam)
Abstract: Wie lassen sich aus gedruckten Quellen in komplexen Rechts-nach-links-Sprachen wie Arabisch und Persisch ressourceneffizient Volltexte extrahieren? Seit der Umstellung von OCR-Anwendungen auf Deep-Learning-basierte Ansätze sowie der Veröffentlichung von Open-Source-Anwendungen wie kraken und OCR-Plattformen mit integrierter Weboberfläche wie eScriptorium ist dies prinzipiell mit einer character accuracy von über 97% möglich. Bei der Nachnutzung und Implementierung innerhalb kleinerer Projekte oder Institutionen mit limitierten Ressourcen zeigen sich jedoch einige Herausforderungen. Praxisbeispiele im Umgang damit sollen im Folgenden anhand eines konkreten Anwendungsszenarios dargelegt werden.
weitere Vorträge/Papers des Panels: RUB-Repository