awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

3 repository-uri

Awesome GitHub RepositoriesBig Data Workflow Management

Orchestration systems specifically designed for executing scripts and managing workflows on Hadoop clusters.

Distinct from Big Data Runtimes: Candidates focus on cluster deployment or runtime optimization; this is about the management and orchestration of the workflows themselves.

Explore 3 awesome GitHub repositories matching data & databases · Big Data Workflow Management. Refine with filters or upvote what's useful.

Awesome Big Data Workflow Management GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • azkaban/azkabanAvatar azkaban

    azkaban/azkaban

    4,504Vezi pe GitHub↗

    Azkaban este un manager de fluxuri de lucru distribuit și un orchestrator de job-uri bazat pe DAG, conceput ca un procesor batch enterprise. Servește ca un motor de flux de lucru bazat pe Java care programează și execută secvențe complexe de job-uri într-un cluster de servere executor, cu funcționalitate specifică pentru gestionarea workload-urilor big data pe clustere Hadoop. Sistemul se distinge printr-un model de executor distribuit care coordonează starea printr-o bază de date partajată pentru a asigura disponibilitatea ridicată. Utilizează o arhitectură bazată pe plugin-uri care permite tipuri de job-uri personalizate și extensii de funcționalitate a sistemului, inclusiv capacitatea de a reîncărca plugin-urile fără a reporni serverele executor. Platforma acoperă o gamă largă de capabilități, inclusiv orchestrarea pipeline-urilor de date cu logică condițională, programare periodică și bazată pe evenimente, și monitorizare enterprise cu urmărire SLA. Oferă control granular al accesului și impersonarea utilizatorului pentru execuție securizată, alături de instrumente de gestionare a traficului pentru load balancing-ul executorilor și cote de resurse. Utilizatorii pot gestiona fluxurile de lucru printr-o interfață bazată pe web sau programatic printr-un API de execuție a fluxurilor de lucru.

    Manages the execution of Java or Shell scripts on Hadoop clusters with secure authentication and HDFS integration.

    Java
    Vezi pe GitHub↗4,504
  • aws/aws-sdk-pandasAvatar aws

    aws/aws-sdk-pandas

    4,107Vezi pe GitHub↗

    aws-sdk-pandas este o bibliotecă Python care integrează dataframe-urile pandas cu serviciile AWS, acționând ca un instrument ETL de date cloud și conector de data lake. Oferă o interfață unificată pentru a muta și transforma datele între dataframe-urile din memorie și stocarea cloud, bazele de date și depozitele de date. Proiectul se distinge ca un orchestrator de calcul distribuit capabil să trimită sarcini de lucru bazate pe pandas către clustere EMR și medii de procesare serverless. Se specializează în continuare în coordonarea procesării distribuite a datelor prin inițializarea clusterelor Ray pentru a gestiona seturi de date care depășesc memoria unei singure mașini. Biblioteca acoperă o gamă largă de capabilități, inclusiv gestionarea stocării obiectelor pentru S3, execuția interogărilor SQL pentru Athena și Redshift și integrarea cu baze de date NoSQL, graf și serii temporale. Include, de asemenea, utilitare pentru gestionarea metadatelor prin catalogul Glue, indexarea datelor OpenSearch și gestionarea activelor de business intelligence în QuickSight. Funcționalitatea suplimentară include recuperarea secretelor, analizarea log-urilor CloudWatch și gestionarea seturilor de reguli de calitate a datelor.

    Facilitates workflows for querying Athena, Redshift, or OpenSearch and loading results into dataframes for analysis.

    Pythonamazon-athenaamazon-sagemaker-notebookapache-arrow
    Vezi pe GitHub↗4,107
  • mrsuichuan/data-warehouse-learningAvatar MrSuiChuan

    MrSuiChuan/data-warehouse-learning

    1,154Vezi pe GitHub↗

    Data warehouse learning is a reference implementation of a real-time stream processing system and open-source data lakehouse architecture. It combines stream processing engines, open lakehouse formats, and analytical data warehouses into a complete e-commerce data warehouse system built for both offline and real-time analytics pipelines. The project implements hybrid data warehouse architectures utilizing multi-layer storage models and stream-batch processing pipelines. It features change data capture pipelines that stream database transaction logs into messaging systems, progressive data tra

    Schedules and monitors complex multi-stage data transformation dependencies across distributed computing clusters.

    Javadatartdinkydolphinscheduler
    Vezi pe GitHub↗1,154
  1. Home
  2. Data & Databases
  3. Big Data Workflow Management

Explorează sub-etichetele

  • Analytical Query WorkflowsOrchestrating the flow of data from cloud query services into analytical dataframes. **Distinct from Big Data Workflow Management:** Distinct from Big Data Workflow Management: focuses on the specific analytical pattern of querying and loading into dataframes, not Hadoop cluster management.