2 dépôts
Freely available document parsers that extract text, tables, and layout from PDFs and office files into structured formats.
Distinct from Documentation Parsers: Distinct from Documentation Parsers: focuses on parsing document files (PDFs, office docs) for content extraction, not source code documentation extraction.
Explore 2 awesome GitHub repositories matching programming languages & runtimes · Open-Source Document Parsers. Refine with filters or upvote what's useful.
A fast, helpful, and open-source document parser
An open-source document parser that extracts text, tables, and layout from PDFs and office files into Markdown or JSON.
Textract est un outil d'extraction et un parseur de texte multi-format. Il fournit une interface unifiée pour extraire du texte brut à partir d'une variété de sources, y compris des documents, des images et des fichiers audio. Le système fonctionne comme un parseur de contenu de documents pour les PDF et les feuilles de calcul, un extracteur de texte d'image utilisant la reconnaissance optique de caractères (OCR), et un transcripteur parole-texte pour les enregistrements audio.
Maps PDFs and spreadsheets to a common internal representation for consistent text retrieval.