Key points are not available for this paper at this time.
Eine Methode zur Extraktion alternierender horizontaler und vertikaler Projektionsprofile aus geschachtelten Unterblöcken gescannter Seitenbilder technischer Dokumente wird erörtert. Die geschwellten Profilstrings werden mithilfe der Compiler-Utilities Lex und Yacc analysiert. Die signifikanten Dokumentenbestandteile werden durch die rekursive Anwendung von Blockgrammatiken abgegrenzt und identifiziert. Backtracking zur Fehlerwiederherstellung und Branch-and-Bound für die maximale Flächenkennzeichnung werden mit Unix-Shell-Programmen implementiert. Die Ergebnisse des Segmentierungs- und Kennzeichnungsprozesses werden in einem gekennzeichneten x-y-Baum gespeichert. Es wird gezeigt, dass Familien technischer Dokumente, die die gleichen Layout-Konventionen teilen, problemlos analysiert werden können. Ergebnisse aus Experimenten, bei denen mehr als 20 Arten von Dokumenteneinheiten in Stichprobenseiten aus zwei Zeitschriften identifiziert wurden, werden präsentiert.
Krishnamoorthy et al. (Donnerstag) haben diese Frage untersucht.