awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repositorios

Awesome GitHub RepositoriesHTTP Control Interfaces

RESTful interfaces used to trigger and monitor the status of crawler tasks.

Distinct from Distributed Crawler Orchestrators: Focuses on the control interface for a single crawler instance rather than distributed coordination across environments.

Explore 3 awesome GitHub repositories matching web development · HTTP Control Interfaces. Refine with filters or upvote what's useful.

Awesome HTTP Control Interfaces GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • builderio/gpt-crawlerAvatar de BuilderIO

    BuilderIO/gpt-crawler

    22,248Ver en GitHub↗

    gpt-crawler is a web scraping utility designed to extract website content and convert it into structured text files for use as AI model knowledge bases. It functions as a data generator that crawls specified web addresses to produce the knowledge files required for building custom GPTs, grounding large language models, and providing context to AI agents. The system transforms raw HTML into clean Markdown text to reduce token usage and improve readability for AI models. It utilizes token-aware content chunking and output file size limitations to ensure generated datasets remain compatible with

    Exposes a REST interface to remotely trigger and monitor scraping tasks.

    TypeScript
    Ver en GitHub↗22,248
  • dataabc/weibo-crawlerAvatar de dataabc

    dataabc/weibo-crawler

    4,541Ver en GitHub↗

    Este proyecto es un scraper web de Sina Weibo y una tubería de datos de redes sociales diseñada para extraer perfiles de usuario, publicaciones, comentarios y activos multimedia. Funciona como un crawler de datos contenedorizado que automatiza la recopilación y el almacenamiento local de contenido de redes sociales y métricas de interacción. El sistema incluye una capa de procesamiento que utiliza modelos de lenguaje de gran tamaño (LLM) para analizar el texto extraído, generando resúmenes y análisis de sentimiento. Se diferencia por un modelo de contenedor listo para el despliegue que cuenta con una interfaz HTTP para gestionar tareas de extracción y monitorear el progreso de los trabajos. El crawler cubre una amplia gama de capacidades, incluyendo el monitoreo de redes sociales mediante actualizaciones incrementales programadas, el archivo de activos multimedia en discos locales y la exportación de datos en múltiples formatos a archivos planos o bases de datos. También captura interacciones sociales detalladas, como comentarios de primer nivel y republicaciones.

    Ships a RESTful interface used to trigger crawling jobs and monitor their execution progress.

    Pythoncrawlerweiboweibo-spider
    Ver en GitHub↗4,541
  • automatic-ripping-machine/automatic-ripping-machineAvatar de automatic-ripping-machine

    automatic-ripping-machine/automatic-ripping-machine

    4,595Ver en GitHub↗

    Automatic Optical Disc Ripping Server is a headless system that detects inserted CDs, DVDs, and Blu-rays to automatically extract media, transcode video, and eject discs. It functions as a multi-drive media digitizer using a concurrent processing pipeline to rip and transcode media from several optical drives simultaneously without queuing. The system includes an asynchronous video transcoding pipeline that batches conversion tasks to run during scheduled off-peak hours. It also serves as a media server automation tool, fetching metadata from online APIs to name folders and trigger library re

    Exposes an HTTP API for monitoring and controlling rip jobs, logs, and configuration on a headless server.

    Pythonautomaticblu-raycd
    Ver en GitHub↗4,595
  1. Home
  2. Web Development
  3. Distributed Crawler Orchestrators
  4. HTTP Control Interfaces