awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repositorios

Awesome GitHub RepositoriesDocument-to-Text Conversions

Pipelines that transform complex or legacy document formats into clean, standardized text for machine learning.

Distinct from Multimedia-to-Text Conversions: Distinct from Multimedia-to-Text: focuses on document structure and legacy formats rather than visual pixels/geometry.

Explore 3 awesome GitHub repositories matching graphics & multimedia · Document-to-Text Conversions. Refine with filters or upvote what's useful.

Awesome Document-to-Text Conversions GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • madawei2699/mygptreaderAvatar de madawei2699

    madawei2699/myGPTReader

    4,418Ver en GitHub↗

    myGPTReader es una suite de aplicaciones de modelos de lenguaje grandes que incluye una interfaz de chat, una herramienta de análisis de documentos y un agregador de noticias. El sistema se centra en extraer información de archivos digitales y contenido web para permitir el análisis conversacional y la condensación automatizada de contenido. El proyecto cuenta con un gestor de plantillas de prompts para estructurar flujos de conversación y aumentar la precisión de las respuestas. También incluye un cliente de chat de voz multilingüe que integra voz a texto y texto a voz para tutoría interactiva en tiempo real y práctica de idiomas. La plataforma cubre capacidades más amplias en conversación aumentada por recuperación (RAG), entrega diaria automatizada de noticias y el resumen de sitios web y contenido de video.

    Provides pipelines to transform digital files and web pages into standardized text for conversational analysis.

    Python
    Ver en GitHub↗4,418
  • kevin2li/pdf-guruAvatar de kevin2li

    kevin2li/PDF-Guru

    4,113Ver en GitHub↗

    PDF-Guru es un procesador de documentos y convertidor de material de estudio impulsado por IA, diseñado para transformar libros de texto, artículos de investigación y contenido multimedia en flashcards estructuradas para sistemas de repetición espaciada como Anki. Funciona como un pipeline de contenido que utiliza modelos de lenguaje para extraer conceptos clave y hechos de documentos no estructurados para generar pares de pregunta-respuesta, cloze deletions y tarjetas de opción múltiple. El sistema se distingue por una suite completa de gestión de PDF y análisis de múltiples formatos. Proporciona utilidades avanzadas de documentos, incluyendo reconocimiento óptico de caracteres (OCR) para crear PDFs buscables, anotación por lotes y manipulación de páginas de bajo nivel como fusión, división, recorte y rotación. También admite la conversión de diversas entradas, incluyendo hojas de cálculo, mapas mentales, libros electrónicos y videos —completos con capturas de fotogramas con marca de tiempo— en activos de estudio. Más allá de la generación de contenido, el proyecto incluye herramientas para la gestión de tarjetas y mazos, como edición masiva de campos y configuración de plantillas. Admite la sincronización de datos entre dispositivos a través de redes locales, servidores remotos o backends autohospedados, e integra bibliotecas de investigación Zotero. La plataforma también maneja la optimización de activos reemplazando imágenes incrustadas con enlaces en la nube para reducir el tiempo de almacenamiento y sincronización. Los usuarios pueden exportar sus notas de lectura y mazos de tarjetas en múltiples formatos, incluyendo Markdown, TXT, XLSX y PDF.

    Transforms PDFs, Word documents, Excel files, and mind maps into structured study flashcards.

    Vueai-flashcardsanki-flashcardsanki-to-pdf
    Ver en GitHub↗4,113
  • esbatmop/mnbvcAvatar de esbatmop

    esbatmop/MNBVC

    4,123Ver en GitHub↗

    MNBVC is a dataset pipeline and toolkit designed for the collection, cleaning, and normalization of massive text and code corpora used to train large language models. It provides specialized tools for harvesting source code, commit histories, and repository metadata from version control platforms, alongside a multilingual text corpus collector for gathering parallel text and academic papers. The project distinguishes itself through comprehensive capabilities for processing diverse document types, including a PDF-to-text converter that transforms complex layouts and formulas into structured JS

    Transforms legacy document formats into clean text through intermediate conversion and processing steps.

    chinesechinese-languagechinese-nlp
    Ver en GitHub↗4,123
  1. Home
  2. Graphics & Multimedia
  3. Document-to-Text Conversions

Explorar subetiquetas

  • Study Card Conversions1 sub-etiquetaTransformation of structured documents into active recall flashcards with source referencing. **Distinct from Document-to-Text Conversions:** Distinct from Document-to-Text: transforms documents into structured Q&A pairs for study, not just clean text for ML.