1 dépôt
Utilities to evaluate how text analyzers break down raw text into tokens before indexing.
Distinct from Tokenization Pipelines: Focuses on testing the analyzer's output for correctness, while the parent refers to the operational pipelines themselves.
Explore 1 awesome GitHub repository matching artificial intelligence & ml · Tokenization Testing. Refine with filters or upvote what's useful.
Zombodb est une extension de base de données et un indexeur de données relationnelles qui intègre PostgreSQL avec Elasticsearch. Il fournit une interface de recherche SQL, permettant aux utilisateurs d'exécuter des requêtes de recherche complexes et des agrégations en utilisant des fonctions et une syntaxe SQL standard au lieu d'API JSON natives. Le projet synchronise les données relationnelles de PostgreSQL vers un moteur de recherche distant pour permettre une recherche plein texte et des analyses haute performance. Le système se distingue en reliant les structures relationnelles aux capacités des moteurs de recherche, spécifiquement via l'intégration de recherche géospatiale pour les types géométriques et géographiques. Il implémente une couche de mappage de requête SQL-vers-JSON qui permet une analyse de texte avancée — incluant la correspondance floue, les recherches de proximité et le scoring de pertinence — directement dans un environnement relationnel. Le projet couvre de larges domaines de capacités incluant la gestion du cycle de vie des index, la synchronisation automatisée des données relationnelles et des agrégations analytiques complexes. Il prend en charge l'indexation spatiale pour les requêtes basées sur la localisation, des pipelines d'analyse de texte personnalisés et des outils de surveillance pour auditer les statistiques d'index et la santé du cluster. La sécurité est gérée via des connexions chiffrées entre la base de données et le moteur de recherche utilisant TLS.
Evaluates how custom analysis pipelines and tokenizers process text before it is applied to a search index.