awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repository-uri

Awesome GitHub RepositoriesContent Processing Pipelines

Pipelines that fetch raw web content and process it through a parser for application use.

Distinct from Web Content Fetching: Focuses on the full pipeline from fetch to parser, whereas Web Content Fetching focus on the retrieval aspect.

Explore 3 awesome GitHub repositories matching data & databases · Content Processing Pipelines. Refine with filters or upvote what's useful.

Awesome Content Processing Pipelines GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • thysrael/horizonAvatar Thysrael

    Thysrael/Horizon

    7,357Vezi pe GitHub↗

    Horizon este un sistem de agregare de știri bazat pe AI, conceput pentru a construi pipeline-uri personalizate care preiau, filtrează și îmbogățesc informații din diverse surse web. Utilizează modele de limbaj mari pentru a automatiza filtrarea informațiilor, punctând conținutul pentru a elimina zgomotul și a evidenția știrile de mare valoare. Sistemul integrează Model Context Protocol pentru a expune etapele pipeline-ului ca instrumente pentru asistenții AI externi. Utilizează un adaptor unificat pentru a standardiza diverși furnizori de modele AI pentru sarcini consistente de punctare și sumarizare a conținutului. Pipeline-ul agregă date din fluxuri RSS, platforme sociale, seturi de instrumente financiare și depozite de cod. Gestionează conținutul prin deduplicare, filtrare pe categorii bazată pe cote și îmbogățire contextuală înainte de a livra briefing-uri multilingve prin e-mail, webhook-uri sau implementare pe site-uri statice. Fluxurile de lucru sunt orchestrate prin automatizare cloud recurentă pentru a gestiona colectarea și livrarea programată a informațiilor procesate.

    Builds custom workflows to fetch, deduplicate, and enrich data from diverse web sources before final delivery.

    Python
    Vezi pe GitHub↗7,357
  • kanasimi/work_crawlerAvatar kanasimi

    kanasimi/work_crawler

    4,073Vezi pe GitHub↗

    Acest proiect este un downloader de manga și romane bazat pe web, precum și un scraper multi-site conceput pentru a extrage imagini și text de pe diverse platforme media. Funcționează ca un arhivator de conținut media digital și generator de e-book-uri EPUB, folosind o arhitectură de crawler bazată pe plugin-uri cu scripturi specifice fiecărui site pentru a defini modul în care este extras conținutul. Sistemul se distinge prin crawling-ul web autentificat, folosind simularea cookie-urilor de browser pentru a accesa conținut restricționat sau destinat membrilor. Include capabilități specializate pentru arhivarea benzilor desenate digitale, care organizează secvențele de imagini în arhive comprimate, și un pipeline de conversie care împachetează textul și imaginile romanelor web în fișiere EPUB standardizate. Software-ul oferă procesare completă a conținutului, inclusiv verificarea integrității imaginilor pentru a asigura o calitate maximă și middleware pentru standardizarea scripturilor chinezești simplificate și tradiționale. Gestionează descărcările printr-un sistem de urmărire a stării care permite reluarea sarcinilor și oferă mai multe modalități de a iniția crawling-ul prin interfață grafică, linie de comandă sau API.

    Implements a sequential workflow that fetches raw web content and processes it into structured archives and e-books.

    JavaScriptcejscomic-downloadercomics
    Vezi pe GitHub↗4,073
  • haleydu/cimocAvatar Haleydu

    Haleydu/Cimoc

    3,633Vezi pe GitHub↗

    Cimoc is a manga reader application and cross-platform ebook viewer designed for reading digital comics and image-based documents. It functions as both an online content aggregator and an offline media library, supporting the display of media from local files and remote web sources. The application integrates various web providers through a custom parser system to fetch and display online content. It includes a synchronization system to save application settings and reading progress to a remote server, maintaining consistency across different devices. Users can customize their reading experi

    Implements a pipeline that fetches remote data and processes it through parsers before passing it to the viewer.

    Javaandroidandroid-comic-readerapk
    Vezi pe GitHub↗3,633
  1. Home
  2. Data & Databases
  3. Remote Data Fetching
  4. CMS Content Fetching
  5. Web Content Fetching
  6. Content Processing Pipelines