awesome-repositories.com
المدونة
awesome-repositories.com

اكتشف أفضل مستودعات المصادر المفتوحة باستخدام بحث مدعوم بالذكاء الاصطناعي.

استكشفعمليات بحث منسقةبدائل مفتوحة المصدربرمجيات ذاتية الاستضافةالمدونةخريطة الموقع
المشروعحولكيفية ترتيب النتائجالصحافةخادم MCP
قانونيالخصوصيةالشروط
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
aws avatar

aws/aws-sdk-pandas

0
View on GitHub↗
4,107 نجوم·732 تفرعات·Python·Apache-2.0·7 مشاهداتaws-sdk-pandas.readthedocs.io↗

Aws Sdk Pandas

aws-sdk-pandas هي مكتبة Python تدمج إطارات بيانات pandas مع خدمات AWS، وتعمل كأداة ETL لبيانات السحابة وموصل لمستودع البيانات. توفر واجهة موحدة لنقل وتحويل البيانات بين إطارات البيانات في الذاكرة والتخزين السحابي وقواعد البيانات ومستودعات البيانات.

يتميز المشروع كمنسق حوسبة موزع قادر على إرسال أعباء العمل القائمة على pandas إلى مجموعات EMR وبيئات المعالجة بدون خادم. كما يتخصص في تنسيق معالجة البيانات الموزعة عبر تهيئة مجموعة Ray للتعامل مع مجموعات البيانات التي تتجاوز ذاكرة جهاز واحد.

تغطي المكتبة مجموعة واسعة من القدرات، بما في ذلك إدارة تخزين الكائنات لـ S3، وتنفيذ استعلام SQL لـ Athena وRedshift، والتكامل مع قواعد بيانات NoSQL، والرسم البياني، والسلاسل الزمنية. كما تتضمن أدوات لإدارة البيانات الوصفية من خلال كتالوج Glue، وفهرسة بيانات OpenSearch، وإدارة أصول ذكاء الأعمال في QuickSight.

تشمل الوظائف الإضافية استرداد الأسرار، وتحليل سجلات CloudWatch، وإدارة قواعد جودة البيانات.

Features

  • AWS Pandas Integration Libraries - Provides a comprehensive library connecting pandas dataframes to AWS services like S3, Athena, and Redshift for cloud analysis.
  • Cloud Data Lake Integrations - Synchronizes data between in-memory dataframes and cloud data lakes, warehouses, or databases.
  • Data Processing and ETL - Provides a toolkit for extracting, transforming, and loading data between in-memory dataframes and cloud storage services.
  • Analytical Data Loads from Object Storage - Provides capabilities to load various file formats from S3 object storage directly into pandas dataframes for analysis.
  • Compute Cluster Orchestration - Manages the lifecycle of EMR clusters and submits custom steps for distributed data processing.
  • Data Lake Orchestrators - Orchestrates the movement and transformation of data between pandas dataframes and AWS cloud data lakes and warehouses.
  • Pandas - Acts as a bridge for reading and writing Parquet, CSV, and JSON files from S3 object storage directly into pandas.
  • Redshift Connectors - Reads and writes dataframes to Redshift data warehouses using managed connectors and APIs.
  • Cloud Object Storage - Manages the reading and writing of various file formats like Parquet, CSV, and JSON directly to S3 buckets.
  • Relational Database Integrations - Provides a consistent interface for reading and writing dataframes across multiple relational database engines.
  • SQL Query Execution - Executes SQL queries against data lakes via Athena and returns results as structured dataframes.
  • Unified Cloud Database Interfaces - Provides a unified interface for reading and writing pandas dataframes to AWS relational, NoSQL, and graph databases.
  • Unified Database Interfaces - Offers a unified API to execute SQL queries and synchronize pandas dataframes across RDS, Redshift, and DynamoDB.
  • Data API Integrations - Provides a secure interface to execute SQL queries and insert data into relational databases using the RDS Data API.
  • DataFrame to S3 Synchronization - Transfers data between pandas dataframes and S3 buckets using columnar formats to build and maintain data lakes.
  • Analytical Data Sinks - Saves pandas dataframes to object storage using formats such as Parquet, CSV, JSON, and DeltaLake.
  • Serverless Orchestration - Creates applications and triggers serverless tasks on EMR to process large-scale datasets.
  • Analytical Query Workflows - Facilitates workflows for querying Athena, Redshift, or OpenSearch and loading results into dataframes for analysis.
  • Data Catalogs - Executes SQL queries against the data catalog to discover and load organizational data assets into dataframes.
  • Data Quality Monitors - Creates and evaluates data quality rulesets to monitor information integrity within Glue data pipelines.
  • Data Serialization Formats - Serializes in-memory dataframes into columnar formats like Parquet and ORC for efficient cloud storage transport.
  • Database and Table Management - Manages Glue databases and tables, including the creation and modification of partition and column metadata.
  • Remote API Wrappers - Wraps multiple cloud service APIs to convert remote query results directly into Pandas dataframes.
  • Distributed Data Processing - Spreads pandas dataframe operations across a cluster of workers to accelerate large-scale data processing.
  • DynamoDB Integration - Reads and writes dataframes to DynamoDB NoSQL tables using structured query interfaces.
  • Graph Querying - Executes graph traversals and writes dataframes to property or RDF graphs in Amazon Neptune.
  • Search Indexing - Indexes pandas dataframes or files into OpenSearch and retrieves results using search query languages.
  • Catalog-Based Table Resolution - Translates logical table names into physical S3 storage locations using the Glue data catalog.
  • Open Table Formats - Enables reading and writing pandas dataframes using open table formats for transactional consistency in data lakes.
  • Time Series Databases - Writes time-series records and manages data storage within Amazon Timestream.
  • Time-Series SQL Querying - Retrieves time-stamped data from Timestream tables using optimized SQL queries.
  • Vector Embedding Indexes - Creates vector indexes and performs approximate-nearest-neighbor similarity searches on embeddings stored in S3.
  • Remote Task Orchestration - Triggers serverless jobs and cluster tasks by sending configuration payloads to remote orchestration services.
  • Ray Cluster Integrations - Connects to and initializes Ray clusters to coordinate distributed computing tasks across multiple nodes.
  • Distributed Data Workload Scaling - Distributes processing tasks across multi-node environments to handle datasets that exceed single-machine memory.
  • Driver-Based Service Abstractions - Standardizes disparate database and storage API calls into a consistent set of methods for data movement.
  • Driver Plugin Systems - Coordinates various database drivers and SDKs to manage connections between local memory and remote clusters.
  • Data Analysis - Pandas integration for AWS.
  • Database Clients - Pandas integration with AWS services.

سجل النجوم

مخطط تاريخ النجوم لـ aws/aws-sdk-pandasمخطط تاريخ النجوم لـ aws/aws-sdk-pandas

بحث بالذكاء الاصطناعي

استكشف المزيد من المستودعات الرائعة

صف ما تحتاجه بلغة بسيطة — وسيقوم الذكاء الاصطناعي بترتيب آلاف المشاريع مفتوحة المصدر المنسقة حسب الصلة.

Start searching with AI

بدائل مفتوحة المصدر لـ Aws Sdk Pandas

مشاريع مفتوحة المصدر مشابهة، مرتبة حسب عدد الميزات المشتركة مع Aws Sdk Pandas.
  • awslabs/aws-data-wranglerالصورة الرمزية لـ awslabs

    awslabs/aws-data-wrangler

    4,107عرض على GitHub↗

    This project is an AWS pandas integration library and data pipeline framework designed to simplify the movement and transformation of data between local memory and AWS storage and analytics services. It functions as a cloud data lake toolkit and storage file manager, allowing users to read, write, and transform structured data across various cloud environments. The library distinguishes itself as a distributed compute orchestrator capable of managing clusters in environments such as EMR to process datasets that exceed the memory limits of a single machine. It also provides specialized capabil

    Python
    عرض على GitHub↗4,107
  • datlechin/tableproالصورة الرمزية لـ datlechin

    datlechin/TablePro

    4,471عرض على GitHub↗

    TablePro is a cross-platform database management client designed for browsing, querying, and administering both SQL and NoSQL databases. It functions as a unified workspace that integrates a code-centric SQL editor with schema visualization tools, allowing developers to manage complex data models and execute queries across diverse database engines. The application distinguishes itself through an agentic AI integration layer that connects language models directly to database tools, enabling automated query generation, optimization, and error fixing with configurable approval gates. It features

    Swift
    عرض على GitHub↗4,471
  • greptimeteam/greptimedbالصورة الرمزية لـ GreptimeTeam

    GreptimeTeam/greptimedb

    5,968عرض على GitHub↗

    GreptimeDB is a distributed, open-source time-series database built for unified observability. It stores and queries metrics, logs, and traces together in a single columnar engine, supporting both SQL and PromQL for analysis. The database is designed as a Kubernetes-native operator with a decoupled compute and storage architecture, enabling horizontal scaling and multi-region deployment. What distinguishes GreptimeDB is its role as a multi-protocol ingestion gateway, accepting data through OpenTelemetry, Prometheus Remote Write, InfluxDB, Loki, Elasticsearch, Kafka, and MQTT protocols without

    Rustanalyticscloud-nativedatabase
    عرض على GitHub↗5,968
  • ravendb/ravendbالصورة الرمزية لـ ravendb

    ravendb/ravendb

    3,961عرض على GitHub↗

    RavenDB is a multi-model NoSQL document database designed for high-performance, ACID-compliant data storage. It persists structured information as schema-flexible JSON documents and utilizes a unit-of-work session pattern to track entity changes and batch modifications into atomic transactions. The platform is built on a distributed architecture that supports horizontal scaling through sharding and ensures high availability via multi-node, master-to-master cluster replication. The database distinguishes itself through a self-optimizing query engine that automatically creates and maintains ind

    C#csharpdatabasedocument-database
    عرض على GitHub↗3,961
عرض جميع البدائل الـ 30 لـ Aws Sdk Pandas→

الأسئلة الشائعة

ما هي وظيفة aws/aws-sdk-pandas؟

aws-sdk-pandas هي مكتبة Python تدمج إطارات بيانات pandas مع خدمات AWS، وتعمل كأداة ETL لبيانات السحابة وموصل لمستودع البيانات. توفر واجهة موحدة لنقل وتحويل البيانات بين إطارات البيانات في الذاكرة والتخزين السحابي وقواعد البيانات ومستودعات البيانات.

ما هي الميزات الرئيسية لـ aws/aws-sdk-pandas؟

الميزات الرئيسية لـ aws/aws-sdk-pandas هي: AWS Pandas Integration Libraries, Cloud Data Lake Integrations, Data Processing and ETL, Analytical Data Loads from Object Storage, Compute Cluster Orchestration, Data Lake Orchestrators, Pandas, Redshift Connectors.

ما هي البدائل مفتوحة المصدر لـ aws/aws-sdk-pandas؟

تشمل البدائل مفتوحة المصدر لـ aws/aws-sdk-pandas: awslabs/aws-data-wrangler — This project is an AWS pandas integration library and data pipeline framework designed to simplify the movement and… datlechin/tablepro — TablePro is a cross-platform database management client designed for browsing, querying, and administering both SQL… ravendb/ravendb — RavenDB is a multi-model NoSQL document database designed for high-performance, ACID-compliant data storage. It… greptimeteam/greptimedb — GreptimeDB is a distributed, open-source time-series database built for unified observability. It stores and queries… delta-io/delta — Delta is a lakehouse table format that brings ACID transactions and data warehouse consistency to large scale data… apache/pinot — Pinot is a distributed, columnar analytical database designed for high-concurrency, low-latency query processing. It…