1 repositorio
Orchestrating the flow of data from cloud query services into analytical dataframes.
Distinct from Big Data Workflow Management: Distinct from Big Data Workflow Management: focuses on the specific analytical pattern of querying and loading into dataframes, not Hadoop cluster management.
Explore 1 awesome GitHub repository matching data & databases · Analytical Query Workflows. Refine with filters or upvote what's useful.
aws-sdk-pandas es una librería de Python que integra dataframes de pandas con servicios de AWS, actuando como una herramienta ETL de datos en la nube y conector de data lake. Proporciona una interfaz unificada para mover y transformar datos entre dataframes en memoria y almacenamiento en la nube, bases de datos y almacenes de datos. El proyecto se distingue como un orquestador de cómputo distribuido capaz de enviar cargas de trabajo basadas en pandas a clusters EMR y entornos de procesamiento sin servidor. Se especializa además en coordinar el procesamiento de datos distribuido mediante la inicialización de clusters Ray para manejar datasets que exceden la memoria de una sola máquina. La librería cubre una amplia gama de capacidades, incluyendo gestión de almacenamiento de objetos para S3, ejecución de consultas SQL para Athena y Redshift, e integración con bases de datos NoSQL, de grafos y de series temporales. También incluye utilidades para la gestión de metadatos a través del catálogo Glue, indexación de datos en OpenSearch y la gestión de activos de inteligencia de negocios en QuickSight. La funcionalidad adicional incluye la recuperación de secretos, el análisis de registros de CloudWatch y la gestión de conjuntos de reglas de calidad de datos.
Facilitates workflows for querying Athena, Redshift, or OpenSearch and loading results into dataframes for analysis.