awesome-repositories.com
Blog
MCP
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektMCP-ServerÜber unsRanking-MethodikPresse
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 Repos

Awesome GitHub RepositoriesContent Processing Pipelines

Pipelines that fetch raw web content and process it through a parser for application use.

Distinct from Web Content Fetching: Focuses on the full pipeline from fetch to parser, whereas Web Content Fetching focus on the retrieval aspect.

Explore 3 awesome GitHub repositories matching data & databases · Content Processing Pipelines. Refine with filters or upvote what's useful.

Awesome Content Processing Pipelines GitHub Repositories

Finde die besten Repos mit KI.Wir suchen mit KI nach den am besten passenden Repositories.
  • thysrael/horizonAvatar von Thysrael

    Thysrael/Horizon

    7,357Auf GitHub ansehen↗

    Horizon ist ein KI-gestütztes Nachrichtenaggregationssystem, das darauf ausgelegt ist, benutzerdefinierte Pipelines zu erstellen, die Informationen aus verschiedenen Webquellen abrufen, filtern und anreichern. Es nutzt Large Language Models, um die Informationsfilterung zu automatisieren und Inhalte zu bewerten, um Rauschen zu entfernen und hochwertige Geschichten hervorzuheben. Das System integriert das Model Context Protocol, um Pipeline-Stufen als Tools für externe KI-Assistenten bereitzustellen. Es verwendet einen einheitlichen Adapter, um verschiedene KI-Modellanbieter für konsistente Inhaltsbewertungs- und Zusammenfassungsaufgaben zu standardisieren. Die Pipeline aggregiert Daten aus RSS-Feeds, sozialen Plattformen, Finanz-Toolkits und Code-Repositories. Sie verwaltet Inhalte durch Deduplizierung, kontingentbasierte Kategoriefilterung und kontextuelle Anreicherung, bevor sie mehrsprachige Briefings per E-Mail, Webhooks oder statischer Website-Bereitstellung liefert. Workflows werden durch wiederkehrende Cloud-Automatisierung orchestriert, um die geplante Sammlung und Bereitstellung verarbeiteter Informationen zu verwalten.

    Builds custom workflows to fetch, deduplicate, and enrich data from diverse web sources before final delivery.

    Python
    Auf GitHub ansehen↗7,357
  • kanasimi/work_crawlerAvatar von kanasimi

    kanasimi/work_crawler

    4,073Auf GitHub ansehen↗

    Dieses Projekt ist ein webbasierter Manga- und Roman-Downloader sowie ein Multi-Site-Web-Scraper, der darauf ausgelegt ist, Bilder und Texte von verschiedenen Medienplattformen zu extrahieren. Es fungiert als digitaler Medienarchivar und EPUB-Generator und nutzt eine Plugin-basierte Crawler-Architektur mit standortspezifischen Skripten, um die Extraktion von Inhalten von verschiedenen internationalen Websites zu definieren. Das System zeichnet sich durch authentifiziertes Web-Crawling aus, wobei Browser-Cookie-Simulation verwendet wird, um auf eingeschränkte oder nur für Mitglieder zugängliche Inhalte zuzugreifen. Es enthält spezialisierte Funktionen für die Archivierung digitaler Comics, die Bildsequenzen in komprimierte Archive organisieren, sowie eine Konvertierungspipeline, die Web-Roman-Texte und Bilder in standardisierte EPUB-Dateien verpackt. Die Software bietet eine umfassende Inhaltsverarbeitung, einschließlich der Überprüfung der Bildintegrität zur Sicherstellung maximaler Qualität sowie Middleware zur Standardisierung von vereinfachtem und traditionellem Chinesisch. Es verwaltet Downloads über ein State-Tracking-System, das die Wiederaufnahme von Aufgaben ermöglicht, und bietet mehrere Möglichkeiten, Crawls über ein grafisches Interface, ein CLI oder eine API zu starten.

    Implements a sequential workflow that fetches raw web content and processes it into structured archives and e-books.

    JavaScriptcejscomic-downloadercomics
    Auf GitHub ansehen↗4,073
  • haleydu/cimocAvatar von Haleydu

    Haleydu/Cimoc

    3,633Auf GitHub ansehen↗

    Cimoc is a manga reader application and cross-platform ebook viewer designed for reading digital comics and image-based documents. It functions as both an online content aggregator and an offline media library, supporting the display of media from local files and remote web sources. The application integrates various web providers through a custom parser system to fetch and display online content. It includes a synchronization system to save application settings and reading progress to a remote server, maintaining consistency across different devices. Users can customize their reading experi

    Implements a pipeline that fetches remote data and processes it through parsers before passing it to the viewer.

    Javaandroidandroid-comic-readerapk
    Auf GitHub ansehen↗3,633
  1. Home
  2. Data & Databases
  3. Remote Data Fetching
  4. CMS Content Fetching
  5. Web Content Fetching
  6. Content Processing Pipelines