awesome-repositories.com
المدونة
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعحولكيفية ترتيب النتائجالصحافةخادم MCP
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
USCDataScience avatar

USCDataScience/sparkler

0
View on GitHub↗
422 نجوم·135 تفرعات·Java·Apache-2.0·2 مشاهداتirds.usc.edu/sparkler↗

Sparkler

A web crawler is a bot program that fetches resources from the web for the sake of building applications like search engines, knowledge bases, etc. Sparkler (contraction of Spark-Crawler) is a new web crawler that makes use of recent advancements in distributed computing and information…

Features

  • Java Crawling Frameworks - Apache Nutch implementation running on Spark.

سجل النجوم

مخطط تاريخ النجوم لـ uscdatascience/sparklerمخطط تاريخ النجوم لـ uscdatascience/sparkler

بحث بالذكاء الاصطناعي

استكشف المزيد من المستودعات الرائعة

صف ما تحتاجه بلغة بسيطة — وسيقوم الذكاء الاصطناعي بترتيب آلاف المشاريع مفتوحة المصدر المنسقة حسب الصلة.

Start searching with AI

الأسئلة الشائعة

ما هي وظيفة uscdatascience/sparkler؟

A web crawler is a bot program that fetches resources from the web for the sake of building applications like search engines, knowledge bases, etc. Sparkler (contraction of Spark-Crawler) is a new web crawler that makes use of recent advancements in distributed computing and information…

ما هي الميزات الرئيسية لـ uscdatascience/sparkler؟

الميزات الرئيسية لـ uscdatascience/sparkler هي: Java Crawling Frameworks.

ما هي البدائل مفتوحة المصدر لـ uscdatascience/sparkler؟

تشمل البدائل مفتوحة المصدر لـ uscdatascience/sparkler: code4craft/webmagic — Webmagic is a Java web crawling framework designed for building scalable automated crawlers to download and process… crawlscript/webcollector — WebCollector is an open source web crawler framework based on Java.It provides some simple interfaces for crawling the… digitalpebble/storm-crawler — A scalable, mature and versatile web crawler based on Apache Storm. internetarchive/heritrix3 — Heritrix is the Internet Archive's open-source, extensible, web-scale, archival-quality web crawler project. Heritrix… norconex/collector-http — Norconex HTTP Collector. pkwenda/webbee — 🐝 Web vertical crawler framework for fun.

بدائل مفتوحة المصدر لـ Sparkler

مشاريع مفتوحة المصدر مشابهة، مرتبة حسب عدد الميزات المشتركة مع Sparkler.
  • crawlscript/webcollectorالصورة الرمزية لـ CrawlScript

    CrawlScript/WebCollector

    3,091عرض على GitHub↗

    WebCollector is an open source web crawler framework based on Java.It provides some simple interfaces for crawling the Web,you can setup a multi-threaded web crawler in less than 5 minutes.

    Java
    عرض على GitHub↗3,091
  • digitalpebble/storm-crawlerالصورة الرمزية لـ DigitalPebble

    DigitalPebble/storm-crawler

    980عرض على GitHub↗

    A scalable, mature and versatile web crawler based on Apache Storm

    Java
    عرض على GitHub↗980
  • internetarchive/heritrix3الصورة الرمزية لـ internetarchive

    internetarchive/heritrix3

    3,246عرض على GitHub↗

    Heritrix is the Internet Archive's open-source, extensible, web-scale, archival-quality web crawler project. Heritrix (sometimes spelled heretrix, or misspelled or missaid as heratrix/heritix/heretix/heratix) is an archaic word for heiress (woman who inherits). Since our crawler seeks to collect…

    Java
    عرض على GitHub↗3,246
  • code4craft/webmagicالصورة الرمزية لـ code4craft

    code4craft/webmagic

    11,680عرض على GitHub↗

    Webmagic is a Java web crawling framework designed for building scalable automated crawlers to download and process large volumes of web pages. It functions as a distributed web crawler and dynamic content crawler, utilizing an XPath HTML parser to locate and extract specific data points from page structures. The framework distinguishes itself through its ability to handle dynamic content by rendering JavaScript and executing asynchronous requests to extract data from non-static pages. It also allows users to define and execute crawler logic via scripting languages, enabling the update of col

    Javacrawlerframeworkjava
    عرض على GitHub↗11,680
عرض جميع البدائل الـ 12 لـ Sparkler→