2 repositorios
Storage standards specifically leveraging the Apache Arrow memory layout for disk persistence.
Distinct from Columnar Formats: More specific than general columnar formats, focusing on the Arrow-based interoperability standard.
Explore 2 awesome GitHub repositories matching data & databases · Apache Arrow-Based Formats. Refine with filters or upvote what's useful.
Lance is a columnar data format and storage layer designed for high-performance random access and the persistence of multimodal data. It functions as a vector database storage system, a multimodal data store, and a versioned dataset manager. The project distinguishes itself as a hybrid search engine that combines vector similarity search and full-text indexing on a single dataset. It provides unified storage for diverse data types including images, audio, and video, utilizing a system that lazy-loads large binary objects only when requested. The system manages dataset evolution through schem
Provides a storage standard based on Apache Arrow for high-performance random access.
GluonTS es una librería de series temporales probabilísticas y framework de pronóstico de aprendizaje profundo. Proporciona un kit de herramientas para construir, entrenar y evaluar arquitecturas de redes neuronales que predicen valores futuros como distribuciones de probabilidad para cuantificar la incertidumbre. El proyecto se distingue por soportar el pronóstico zero-shot e integrar diversos enfoques de modelado, incluyendo redes neuronales probabilísticas profundas y envoltorios para librerías estadísticas externas como Prophet y R forecast. Implementa primitivas arquitectónicas especializadas como convoluciones causales y redes residuales invertibles para prevenir la fuga de información y mapear representaciones latentes en distribuciones de probabilidad válidas. El framework cubre una superficie de ingeniería de datos integral, incluyendo escalado de series temporales, transformaciones biyectivas y modelado jerárquico. Utiliza Apache Arrow y Parquet para el streaming de conjuntos de datos de alto rendimiento y la gestión de acceso aleatorio. Para la evaluación de modelos, incluye una suite de evaluación para medir la precisión del pronóstico y la cobertura probabilística utilizando métricas como la pérdida de cuantiles y puntuaciones de probabilidad de rango continuo. La librería soporta el despliegue de modelos a través de la integración con Amazon SageMaker.
Converts encoded Apache Arrow data batches into time series formats using predefined schemas.