awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetÀ proposNotre méthodologiePresseServeur MCP
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 dépôts

Awesome GitHub RepositoriesCrawler Identity Masking

Randomization of fingerprints and headers to simulate human behavior during scraping.

Distinct from Crawler Configuration Managers: Focuses on masking crawler identity, distinct from general crawler configuration.

Explore 3 awesome GitHub repositories matching web development · Crawler Identity Masking. Refine with filters or upvote what's useful.

Awesome Crawler Identity Masking GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • apify/crawleeAvatar de apify

    apify/crawlee

    24,002Voir sur GitHub↗

    Crawlee is a web scraping framework designed for building scalable, reliable, and distributed data extraction pipelines. It provides a unified interface for managing headless browser automation and lightweight HTTP requests, allowing developers to handle complex web navigation, dynamic content rendering, and large-scale data collection within a single, modular architecture. The project distinguishes itself through its resource-aware concurrency controller, which dynamically scales task execution based on real-time CPU and memory usage to prevent host machine exhaustion. It also features a rob

    Randomizes browser fingerprints and HTTP headers to simulate human behavior and bypass anti-bot detection mechanisms during web scraping sessions.

    TypeScriptapifyautomationcrawler
    Voir sur GitHub↗24,002
  • nanmicoder/crawlertutorialAvatar de NanmiCoder

    NanmiCoder/CrawlerTutorial

    4,262Voir sur GitHub↗

    CrawlerTutorial est un tutoriel complet de web scraping en Python et un framework conçu pour extraire des données de sites web statiques et dynamiques. Il fonctionne comme un pipeline d'extraction de données web et un orchestrateur de requêtes HTTP, couvrant tout le cycle de vie des applications de scraping, de la récupération initiale au stockage final des données. Le projet fournit des conseils spécialisés sur les techniques de contournement anti-bot et l'ingénierie inverse d'API web. Il inclut des méthodes pour échapper à la détection par navigateur via le masquage d'identité et la rotation de proxies, ainsi que des techniques pour identifier les points de terminaison d'API cachés en analysant le trafic réseau et les signatures de requêtes. Le framework englobe un large ensemble de capacités, incluant l'automatisation de navigateur pour les pages riches en JavaScript, l'authentification utilisateur automatisée via codes QR ou SMS, et la gestion de la persistance de session. Il dispose également d'outils de prétraitement de données pour nettoyer le texte brut, supprimer les enregistrements en double et persister les informations recueillies dans des fichiers plats ou des bases de données relationnelles.

    Configures HTTP headers and TLS fingerprints to simulate real browser behavior and evade detection.

    Python
    Voir sur GitHub↗4,262
  • coder-hxl/x-crawlAvatar de coder-hxl

    coder-hxl/x-crawl

    1,872Voir sur GitHub↗

    X-crawl est un framework de web scraping basé sur Node.js, conçu pour automatiser la collecte de données sur des sites web statiques et dynamiques. Il intègre l'intelligence artificielle pour effectuer une analyse sémantique, permettant de transformer du HTML non structuré en données structurées, tout en restant précis même lorsque la mise en page ou les noms de classes des sites changent. Le projet se distingue par une suite complète de fonctionnalités de furtivité et de fiabilité. Il gère l'identité du crawler en randomisant les empreintes numériques des appareils et en faisant tourner des serveurs proxy pour contourner les restrictions d'accès. Pour gérer les interfaces complexes riches en JavaScript, il utilise l'automatisation de navigateurs headless afin de simuler des comportements humains comme le clic et la saisie, garantissant ainsi l'accès au contenu masqué lors du processus d'extraction. Le framework offre un contrôle étendu sur les flux de travail de crawling grâce à la planification des tâches, la priorisation des requêtes et la gestion de la concurrence. Il inclut des mécanismes de résilience intégrés, tels qu'une logique de réessai automatique et une gestion des erreurs, pour maintenir des performances constantes dans des conditions réseau variables. De plus, il prend en charge des hooks de cycle de vie pour gérer les téléchargements de fichiers et le suivi programmatique de la progression afin de surveiller l'exécution des tâches et leurs résultats.

    Masks crawler identity by randomizing device fingerprints and rotating proxies to bypass access restrictions.

    TypeScriptaiai-crawlchromium
    Voir sur GitHub↗1,872
  1. Home
  2. Web Development
  3. Web Automation and Scraping
  4. Web Scraping and Automation
  5. Web Scraping
  6. Web Crawlers
  7. Crawler Configuration Managers
  8. Crawler Identity Masking

Explorer les sous-tags

  • Request ProxyingRouting network requests through intermediate servers to hide the origin IP address. **Distinct from Crawler Identity Masking:** Focuses on the routing mechanism via proxies to hide origin, whereas Crawler Identity Masking focuses on header/fingerprint randomization.