2 مستودعات
Freely available document parsers that extract text, tables, and layout from PDFs and office files into structured formats.
Distinct from Documentation Parsers: Distinct from Documentation Parsers: focuses on parsing document files (PDFs, office docs) for content extraction, not source code documentation extraction.
Explore 2 awesome GitHub repositories matching programming languages & runtimes · Open-Source Document Parsers. Refine with filters or upvote what's useful.
A fast, helpful, and open-source document parser
An open-source document parser that extracts text, tables, and layout from PDFs and office files into Markdown or JSON.
Textract هو أداة لاستخراج النصوص من تنسيقات متعددة ومحلل بيانات. يوفر واجهة موحدة لاستخراج النصوص العادية من مجموعة متنوعة من المصادر، بما في ذلك المستندات والصور والملفات الصوتية. يعمل النظام كمحلل لمحتوى المستندات لملفات PDF وجداول البيانات، ومستخرج للنصوص من الصور باستخدام التعرف الضوئي على الحروف (OCR)، ومحول للكلام إلى نص للتسجيلات الصوتية.
Maps PDFs and spreadsheets to a common internal representation for consistent text retrieval.