3 repositorios
Pipelines that transform complex or legacy document formats into clean, standardized text for machine learning.
Distinct from Multimedia-to-Text Conversions: Distinct from Multimedia-to-Text: focuses on document structure and legacy formats rather than visual pixels/geometry.
Explore 3 awesome GitHub repositories matching graphics & multimedia · Document-to-Text Conversions. Refine with filters or upvote what's useful.
myGPTReader es una suite de aplicaciones de modelos de lenguaje grandes que incluye una interfaz de chat, una herramienta de análisis de documentos y un agregador de noticias. El sistema se centra en extraer información de archivos digitales y contenido web para permitir el análisis conversacional y la condensación automatizada de contenido. El proyecto cuenta con un gestor de plantillas de prompts para estructurar flujos de conversación y aumentar la precisión de las respuestas. También incluye un cliente de chat de voz multilingüe que integra voz a texto y texto a voz para tutoría interactiva en tiempo real y práctica de idiomas. La plataforma cubre capacidades más amplias en conversación aumentada por recuperación (RAG), entrega diaria automatizada de noticias y el resumen de sitios web y contenido de video.
Provides pipelines to transform digital files and web pages into standardized text for conversational analysis.
PDF-Guru es un procesador de documentos y convertidor de material de estudio impulsado por IA, diseñado para transformar libros de texto, artículos de investigación y contenido multimedia en flashcards estructuradas para sistemas de repetición espaciada como Anki. Funciona como un pipeline de contenido que utiliza modelos de lenguaje para extraer conceptos clave y hechos de documentos no estructurados para generar pares de pregunta-respuesta, cloze deletions y tarjetas de opción múltiple. El sistema se distingue por una suite completa de gestión de PDF y análisis de múltiples formatos. Proporciona utilidades avanzadas de documentos, incluyendo reconocimiento óptico de caracteres (OCR) para crear PDFs buscables, anotación por lotes y manipulación de páginas de bajo nivel como fusión, división, recorte y rotación. También admite la conversión de diversas entradas, incluyendo hojas de cálculo, mapas mentales, libros electrónicos y videos —completos con capturas de fotogramas con marca de tiempo— en activos de estudio. Más allá de la generación de contenido, el proyecto incluye herramientas para la gestión de tarjetas y mazos, como edición masiva de campos y configuración de plantillas. Admite la sincronización de datos entre dispositivos a través de redes locales, servidores remotos o backends autohospedados, e integra bibliotecas de investigación Zotero. La plataforma también maneja la optimización de activos reemplazando imágenes incrustadas con enlaces en la nube para reducir el tiempo de almacenamiento y sincronización. Los usuarios pueden exportar sus notas de lectura y mazos de tarjetas en múltiples formatos, incluyendo Markdown, TXT, XLSX y PDF.
Transforms PDFs, Word documents, Excel files, and mind maps into structured study flashcards.
MNBVC is a dataset pipeline and toolkit designed for the collection, cleaning, and normalization of massive text and code corpora used to train large language models. It provides specialized tools for harvesting source code, commit histories, and repository metadata from version control platforms, alongside a multilingual text corpus collector for gathering parallel text and academic papers. The project distinguishes itself through comprehensive capabilities for processing diverse document types, including a PDF-to-text converter that transforms complex layouts and formulas into structured JS
Transforms legacy document formats into clean text through intermediate conversion and processing steps.