awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repositorios

Awesome GitHub RepositoriesContent Processing Pipelines

Pipelines that fetch raw web content and process it through a parser for application use.

Distinct from Web Content Fetching: Focuses on the full pipeline from fetch to parser, whereas Web Content Fetching focus on the retrieval aspect.

Explore 3 awesome GitHub repositories matching data & databases · Content Processing Pipelines. Refine with filters or upvote what's useful.

Awesome Content Processing Pipelines GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • thysrael/horizonAvatar de Thysrael

    Thysrael/Horizon

    7,357Ver en GitHub↗

    Horizon es un sistema de agregación de noticias impulsado por IA diseñado para construir tuberías personalizadas que obtienen, filtran y enriquecen información de diversas fuentes web. Utiliza modelos de lenguaje de gran tamaño para automatizar el filtrado de información, puntuando el contenido para eliminar el ruido y resaltar historias de alto valor. El sistema integra el Protocolo de Contexto de Modelo (Model Context Protocol) para exponer las etapas de la tubería como herramientas para asistentes de IA externos. Emplea un adaptador unificado para estandarizar diversos proveedores de modelos de IA para tareas consistentes de puntuación y resumen de contenido. La tubería agrega datos de feeds RSS, plataformas sociales, kits de herramientas financieras y repositorios de código. Gestiona el contenido mediante deduplicación, filtrado de categorías basado en cuotas y enriquecimiento contextual antes de entregar resúmenes multilingües por correo electrónico, webhooks o despliegue de sitio estático. Los flujos de trabajo se orquestan a través de automatización en la nube recurrente para gestionar la recolección y entrega programada de información procesada.

    Builds custom workflows to fetch, deduplicate, and enrich data from diverse web sources before final delivery.

    Python
    Ver en GitHub↗7,357
  • kanasimi/work_crawlerAvatar de kanasimi

    kanasimi/work_crawler

    4,073Ver en GitHub↗

    This project is a web-based manga and novel downloader and multi-site web scraper designed to extract images and text from diverse media platforms. It functions as a digital media archiver and EPUB e-book generator, using a plugin-based crawler architecture with site-specific scripts to define how content is extracted from various international websites. The system distinguishes itself through authenticated web crawling, using browser cookie simulation to access restricted or member-only content. It includes specialized capabilities for digital comic archiving, which organizes image sequences

    Implements a sequential workflow that fetches raw web content and processes it into structured archives and e-books.

    JavaScriptcejscomic-downloadercomics
    Ver en GitHub↗4,073
  • haleydu/cimocAvatar de Haleydu

    Haleydu/Cimoc

    3,633Ver en GitHub↗

    Cimoc is a manga reader application and cross-platform ebook viewer designed for reading digital comics and image-based documents. It functions as both an online content aggregator and an offline media library, supporting the display of media from local files and remote web sources. The application integrates various web providers through a custom parser system to fetch and display online content. It includes a synchronization system to save application settings and reading progress to a remote server, maintaining consistency across different devices. Users can customize their reading experi

    Implements a pipeline that fetches remote data and processes it through parsers before passing it to the viewer.

    Javaandroidandroid-comic-readerapk
    Ver en GitHub↗3,633
  1. Home
  2. Data & Databases
  3. Remote Data Fetching
  4. CMS Content Fetching
  5. Web Content Fetching
  6. Content Processing Pipelines