1 Repo
Utilities for dumping and analyzing raw sequence-labeling outputs to debug model performance.
Distinct from Sequence Labeling: Focuses on the inspection and debugging of labels produced by a model, rather than the general task of sequence labeling.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Label Inspection Tools. Refine with filters or upvote what's useful.
Grobid ist ein Machine-Learning-System, das darauf ausgelegt ist, akademische und wissenschaftliche PDF-Publikationen in strukturiertes XML umzuwandeln. Es fungiert als PDF-zu-XML-Parser und Extraktor für wissenschaftliche Metadaten, der Titel, Autoren, Zugehörigkeiten und bibliografische Referenzen aus Forschungspapieren identifiziert und normalisiert. Das System nutzt einen Deep-Learning-Dokumentensegmentierer, um rohe PDFs in funktionale Regionen zu unterteilen, und verwendet einen bibliografischen Referenz-Resolver, um Zitate mit externen Registern für die Metadatenanreicherung und DOI-Auflösung abzugleichen. Es unterstützt eine vollständige Machine-Learning-Modell-Trainingspipeline, die die Generierung annotierter Trainingskorpora, das Nachtrainieren von Modellen und den Export von Modell-Binärdateien ermöglicht. Das Projekt deckt ein breites Spektrum an Extraktionsfunktionen ab, einschließlich Dokument-Header-Parsing, Strukturierung des Volltextkörpers und Identifizierung domänenspezifischer Entitäten wie Finanzierungsinformationen und Patentzitate. Es bietet zudem räumliche Analysetools für die Extraktion von Bounding-Boxen und Koordinaten-Mapping, um semantische Labels mit dem ursprünglichen PDF-Layout zu synchronisieren. Die Anwendung kann über containerisierte Images bereitgestellt werden und enthält Kommandozeilen-Utilities für das Multi-Threaded-Batch-Processing großer Dokumentensammlungen.
Dumps raw sequence-labeling output from internal models to debug the extraction and segmentation pipeline.