awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 dépôts

Awesome GitHub RepositoriesHTTP Control Interfaces

RESTful interfaces used to trigger and monitor the status of crawler tasks.

Distinct from Distributed Crawler Orchestrators: Focuses on the control interface for a single crawler instance rather than distributed coordination across environments.

Explore 3 awesome GitHub repositories matching web development · HTTP Control Interfaces. Refine with filters or upvote what's useful.

Awesome HTTP Control Interfaces GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • builderio/gpt-crawlerAvatar de BuilderIO

    BuilderIO/gpt-crawler

    22,248Voir sur GitHub↗

    gpt-crawler is a web scraping utility designed to extract website content and convert it into structured text files for use as AI model knowledge bases. It functions as a data generator that crawls specified web addresses to produce the knowledge files required for building custom GPTs, grounding large language models, and providing context to AI agents. The system transforms raw HTML into clean Markdown text to reduce token usage and improve readability for AI models. It utilizes token-aware content chunking and output file size limitations to ensure generated datasets remain compatible with

    Exposes a REST interface to remotely trigger and monitor scraping tasks.

    TypeScript
    Voir sur GitHub↗22,248
  • dataabc/weibo-crawlerAvatar de dataabc

    dataabc/weibo-crawler

    4,541Voir sur GitHub↗

    Ce projet est un scraper web pour Sina Weibo et un pipeline de données de réseaux sociaux conçu pour extraire les profils d'utilisateurs, les publications, les commentaires et les ressources multimédias. Il fonctionne comme un crawler de données conteneurisé qui automatise la collecte et le stockage local de contenu de réseaux sociaux et de métriques d'engagement. Le système inclut une couche de traitement qui utilise des modèles de langage étendus (LLM) pour analyser le texte extrait, générant des résumés et une analyse de sentiment. Il se distingue par un modèle de déploiement prêt à l'emploi sous forme de conteneur, doté d'une interface HTTP pour gérer les tâches d'extraction et surveiller la progression des travaux. Le crawler couvre un large éventail de capacités, incluant la surveillance des réseaux sociaux via des mises à jour incrémentales planifiées, l'archivage des ressources multimédias sur disques locaux et l'exportation de données multi-formats vers des fichiers plats ou des bases de données. Il capture également des interactions sociales détaillées, telles que les commentaires de premier niveau et les reposts.

    Ships a RESTful interface used to trigger crawling jobs and monitor their execution progress.

    Pythoncrawlerweiboweibo-spider
    Voir sur GitHub↗4,541
  • automatic-ripping-machine/automatic-ripping-machineAvatar de automatic-ripping-machine

    automatic-ripping-machine/automatic-ripping-machine

    4,595Voir sur GitHub↗

    Automatic Optical Disc Ripping Server is a headless system that detects inserted CDs, DVDs, and Blu-rays to automatically extract media, transcode video, and eject discs. It functions as a multi-drive media digitizer using a concurrent processing pipeline to rip and transcode media from several optical drives simultaneously without queuing. The system includes an asynchronous video transcoding pipeline that batches conversion tasks to run during scheduled off-peak hours. It also serves as a media server automation tool, fetching metadata from online APIs to name folders and trigger library re

    Exposes an HTTP API for monitoring and controlling rip jobs, logs, and configuration on a headless server.

    Pythonautomaticblu-raycd
    Voir sur GitHub↗4,595
  1. Home
  2. Web Development
  3. Distributed Crawler Orchestrators
  4. HTTP Control Interfaces