1 रिपॉजिटरी
Orchestrating the flow of data from cloud query services into analytical dataframes.
Distinct from Big Data Workflow Management: Distinct from Big Data Workflow Management: focuses on the specific analytical pattern of querying and loading into dataframes, not Hadoop cluster management.
Explore 1 awesome GitHub repository matching data & databases · Analytical Query Workflows. Refine with filters or upvote what's useful.
aws-sdk-pandas एक Python लाइब्रेरी है जो pandas डेटाफ्रेम्स को AWS सेवाओं के साथ एकीकृत करती है, जो एक क्लाउड डेटा ETL टूल और डेटा लेक कनेक्टर के रूप में कार्य करती है। यह इन-मेमोरी डेटाफ्रेम्स और क्लाउड स्टोरेज, डेटाबेस और डेटा वेयरहाउस के बीच डेटा को स्थानांतरित और बदलने के लिए एक एकीकृत इंटरफेस प्रदान करती है। प्रोजेक्ट एक डिस्ट्रीब्यूटेड कंप्यूट ऑर्केस्ट्रेटर के रूप में खुद को अलग करता है जो एक मशीन की मेमोरी से अधिक डेटासेट्स को संभालने के लिए EMR क्लस्टर्स और सर्वरलेस प्रोसेसिंग वातावरण में pandas-आधारित वर्कफ़्लो सबमिट करने में सक्षम है। यह एक मशीन की मेमोरी से अधिक डेटासेट्स को संभालने के लिए Ray क्लस्टर इनिशियलाइज़ेशन के माध्यम से डिस्ट्रीब्यूटेड डेटा प्रोसेसिंग के समन्वय में और विशेषज्ञता रखता है। लाइब्रेरी क्षमताओं की एक विस्तृत श्रृंखला को कवर करती है, जिसमें S3 के लिए ऑब्जेक्ट स्टोरेज प्रबंधन, Athena और Redshift के लिए SQL क्वेरी निष्पादन, और NoSQL, ग्राफ और टाइम-सीरीज डेटाबेस के साथ एकीकरण शामिल है। इसमें Glue कैटलॉग के माध्यम से मेटाडेटा प्रबंधन, OpenSearch डेटा इंडेक्सिंग, और QuickSight में बिजनेस इंटेलिजेंस एसेट्स का प्रबंधन करने के लिए यूटिलिटीज भी शामिल हैं। अतिरिक्त कार्यक्षमता में सीक्रेट्स प्राप्त करना, CloudWatch लॉग्स का विश्लेषण करना और डेटा गुणवत्ता नियम सेट प्रबंधित करना शामिल है।
Facilitates workflows for querying Athena, Redshift, or OpenSearch and loading results into dataframes for analysis.