awesome-repositories.com
Blog
awesome-repositories.com

Entdecke die besten Open-Source-Repositories mit KI-gestützter Suche.

EntdeckenKuratierte SuchenOpen-Source-AlternativenSelf-hosted SoftwareBlogSitemap
ProjektÜber unsRanking-MethodikPresseMCP-Server
RechtlichesDatenschutzAGB
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
CrawlScript avatar

CrawlScript/WebCollector

0
View on GitHub↗
3,091 Stars·1,435 Forks·Java·GPL-3.0·3 Aufrufegithub.com/CrawlScript/WebCollector↗

WebCollector

WebCollector is an open source web crawler framework based on Java.It provides some simple interfaces for crawling the Web,you can setup a multi-threaded web crawler in less than 5 minutes.

Features

  • Java Crawling Frameworks - Multi-threaded crawler with simple interfaces.

Star-Verlauf

Star-Verlauf für crawlscript/webcollectorStar-Verlauf für crawlscript/webcollector

KI-Suche

Entdecke weitere awesome Repositories

Beschreibe in einfachen Worten, was du brauchst — die KI bewertet tausende kuratierte Open-Source-Projekte nach Relevanz.

Start searching with AI

Open-Source-Alternativen zu WebCollector

Ähnliche Open-Source-Projekte, sortiert nach der Anzahl der gemeinsamen Funktionen mit WebCollector.
  • digitalpebble/storm-crawlerAvatar von DigitalPebble

    DigitalPebble/storm-crawler

    980Auf GitHub ansehen↗

    A scalable, mature and versatile web crawler based on Apache Storm

    Java
    Auf GitHub ansehen↗980
  • internetarchive/heritrix3Avatar von internetarchive

    internetarchive/heritrix3

    3,246Auf GitHub ansehen↗

    Heritrix is the Internet Archive's open-source, extensible, web-scale, archival-quality web crawler project. Heritrix (sometimes spelled heretrix, or misspelled or missaid as heratrix/heritix/heretix/heratix) is an archaic word for heiress (woman who inherits). Since our crawler seeks to collect…

    Java
    Auf GitHub ansehen↗3,246
  • norconex/collector-httpAvatar von Norconex

    Norconex/collector-http

    202Auf GitHub ansehen↗

    Norconex HTTP Collector

    Java
    Auf GitHub ansehen↗202
  • code4craft/webmagicAvatar von code4craft

    code4craft/webmagic

    11,680Auf GitHub ansehen↗

    Webmagic is a Java web crawling framework designed for building scalable automated crawlers to download and process large volumes of web pages. It functions as a distributed web crawler and dynamic content crawler, utilizing an XPath HTML parser to locate and extract specific data points from page structures. The framework distinguishes itself through its ability to handle dynamic content by rendering JavaScript and executing asynchronous requests to extract data from non-static pages. It also allows users to define and execute crawler logic via scripting languages, enabling the update of col

    Javacrawlerframeworkjava
    Auf GitHub ansehen↗11,680
Alle 12 Alternativen zu WebCollector anzeigen→

Häufig gestellte Fragen

Was macht crawlscript/webcollector?

WebCollector is an open source web crawler framework based on Java.It provides some simple interfaces for crawling the Web,you can setup a multi-threaded web crawler in less than 5 minutes.

Was sind die Hauptfunktionen von crawlscript/webcollector?

Die Hauptfunktionen von crawlscript/webcollector sind: Java Crawling Frameworks.

Welche Open-Source-Alternativen gibt es zu crawlscript/webcollector?

Open-Source-Alternativen zu crawlscript/webcollector sind unter anderem: code4craft/webmagic — Webmagic is a Java web crawling framework designed for building scalable automated crawlers to download and process… digitalpebble/storm-crawler — A scalable, mature and versatile web crawler based on Apache Storm. internetarchive/heritrix3 — Heritrix is the Internet Archive's open-source, extensible, web-scale, archival-quality web crawler project. Heritrix… norconex/collector-http — Norconex HTTP Collector. pkwenda/webbee — 🐝 Web vertical crawler framework for fun. ssssssss-team/spider-flow — Spider-flow is a Java-based web crawling and data extraction platform that provides a centralized environment for…