13 dépôts
Processes for identifying named entities and determining the specific relationships between them within text.
Distinct from Named Entity Recognition: Extends beyond simple recognition to extract the relationships between identified entities.
Explore 13 awesome GitHub repositories matching artificial intelligence & ml · Entity and Relation Extraction. Refine with filters or upvote what's useful.
DeepPavlov is a conversational AI framework and deep learning NLP library designed for building end-to-end dialogue systems and chatbots. It functions as an NLP pipeline orchestrator that allows users to compose pre-trained models and text processing components into sequential data flows for complex linguistic tasks. The system is distinguished by its ability to act as a chatbot deployment server, exposing trained conversational models as web services via REST and Socket APIs. It utilizes JSON-based pipeline configurations and dynamic variable interpolation to decouple model logic from infras
Identifies named entities and extracts the specific relationships between them within unstructured text.
bert4keras est une réimplémentation légère de l'architecture transformer BERT pour le framework de deep learning Keras. Il sert de boîte à outils de traitement du langage naturel et de bibliothèque de modèles transformer utilisée pour la classification de texte, l'étiquetage de séquences et l'extraction d'embeddings sémantiques. Le framework inclut un système de modèle sequence-to-sequence pour la réponse aux questions et la génération de texte, ainsi qu'un serveur d'inférence de modèle pour déployer des transformers entraînés en tant qu'API web pour des prédictions en temps réel. Les capacités couvrent un large éventail de tâches de compréhension du langage naturel, incluant la compréhension de lecture, l'extraction de relations et le traitement de textes longs. La bibliothèque fournit des outils pour le pré-entraînement et le fine-tuning de modèles de langage, aux côtés de techniques d'optimisation telles que la réduction de paramètres, l'entraînement contradictoire pour la robustesse et la configuration du taux d'apprentissage par couche. Le projet inclut un chargeur de conversion de poids pour transformer les poids pré-entraînés depuis des formats externes en structures Keras compatibles.
Identifies and categorizes connections between distinct entities using pointer and tagging structures.
Knwl.js est une bibliothèque JavaScript de reconnaissance d'entités nommées et un analyseur de texte basé sur des règles. Il sert d'outil d'extraction d'informations extensible conçu pour identifier et extraire des entités structurées, telles que des dates, des heures et des lieux, à partir de chaînes de texte non structurées. La bibliothèque permet la définition de règles spécialisées et de plugins personnalisés pour identifier et extraire des éléments d'information uniques. Cette extensibilité permet l'automatisation de la récupération d'informations en convertissant du texte lisible par l'homme en formats structurés pour les applications et les bases de données. Le système utilise la correspondance d'expressions régulières et l'extraction basée sur des règles pour traiter des blocs de texte bruts. Des résolveurs d'entités modulaires gèrent la transformation des segments de texte correspondants en formats standardisés.
Identifies and extracts structured entities such as dates, phone numbers, and locations from unstructured text.
KnowledgeGraphData est une collection de jeux de données structurés et de corpus conçus pour fournir une couche fondamentale pour les systèmes d'intelligence cognitive et d'intelligence artificielle. Il se compose principalement de jeux de données de graphes de connaissances chinois à grande échelle, y compris des données entité-relation et des jeux d'entraînement NLP utilisés pour piloter la compréhension sémantique et la réponse automatique aux questions. Le projet se concentre sur la construction et l'exportation de graphes entité-attribut-valeur massifs, organisant les connaissances dans des formats portables. Il fournit un partitionnement de domaine spécialisé pour adapter la récupération d'informations à des domaines professionnels tels que la santé, l'armée et la sécurité publique. Le dépôt couvre un large éventail de capacités, notamment le traitement du langage naturel chinois, la recherche sémantique et les systèmes de dialogue cognitif. Sa boîte à outils englobe l'analyse linguistique, l'extraction d'entités, la détection de sentiment et la synthèse de texte, ainsi que l'analyse de contenu visuel pour l'audit de sites web et la conversion parole-texte.
Provides an organized dataset of entities and attributes in a format suitable for automated question answering.
Promptify est une suite d'outils conçue pour l'évaluation de modèles, la gestion de prompts, le suivi des coûts de jetons (tokens), l'extraction structurée et l'accès via une passerelle API unifiée. Elle fournit une interface standardisée pour gérer les requêtes et les réponses à travers plusieurs fournisseurs de grands modèles de langage. Le projet propose une plateforme de gestion de prompts pour l'ingénierie et le versionnage de prompts avec validation de sortie structurée. Il inclut un framework d'évaluation dédié pour mesurer la performance du modèle en utilisant les scores de précision, de rappel et F1 par rapport à des jeux de données étiquetés, ainsi qu'un suivi des coûts de jetons pour surveiller les dépenses financières des requêtes de modèle. La bibliothèque couvre de larges capacités pour le traitement du langage naturel, incluant l'extraction d'entités nommées, la classification de texte et la réponse aux questions. Elle prend en charge les workflows à haut volume via le traitement par lots asynchrone et assure la cohérence des données en convertissant le texte non structuré en structures de données typées via la validation de schéma.
Identifies and labels specific spans of text as entities based on the provided domain.
OpenNRE est une bibliothèque de traitement du langage naturel et un framework d'extraction de relations neuronales conçu pour transformer du texte non structuré en données relationnelles structurées. Il sert de boîte à outils pour identifier les types de relations entre les entités et générer des triplets entité-relation-entité pour peupler et étendre les bases de connaissances. Le framework fournit des outils pour l'extraction de relations supervisée et distamment supervisée, permettant aux modèles neuronaux d'être entraînés sur des jeux de données étiquetés ou via des pipelines automatisés qui alignent les triplets de base de connaissances avec du texte brut. Le projet couvre un pipeline complet d'extraction d'informations, y compris l'encodage de texte basé sur transformer, l'inférence de relation et la sortie de triplets structurés pour la construction de graphes de connaissances.
Identifies relational facts between entities in plain text to produce structured knowledge triples.
DeepKE est une boîte à outils et un framework d'extraction de connaissances conçu pour transformer du texte non structuré en graphes de connaissances structurés. Il fournit un pipeline pour identifier et classer les entités nommées, les relations sémantiques et les événements, convertissant des jeux de données bruts en triplets structurés. Le projet utilise de grands modèles de langage comme appelants d'outils via un protocole de contexte standardisé pour piloter des processus d'extraction de données automatisés. Il prend en charge l'extraction pilotée par schéma à travers de multiples domaines et le texte bilingue, employant une extraction conjointe d'entités et de relations pour identifier les composants dans une sortie structurée unique. La boîte à outils inclut des capacités pour l'entraînement et le réglage fin de modèles, l'optimisation des hyperparamètres et la préparation des données via une supervision distante et l'étiquetage automatique des relations. Elle dispose également d'un entraînement GPU distribué, d'une optimisation de la mémoire des modèles via la quantification, et de la capacité de déployer des modèles entraînés en tant que services d'inférence via des endpoints API.
Detects and categorizes semantic relationships between entities to transform raw text into structured triples.
Agriculture Knowledge Graph est un système de triple-store structuré et une plateforme d'aide à la décision conçue pour transformer des documents agricoles bruts en un graphe lisible par machine. Il fonctionne comme un système de récupération d'informations de domaine qui extrait et interroge des données agricoles pour fournir des réponses intelligentes et un support de planification. Le projet implémente un pipeline complet pour la construction de graphes de connaissances, comprenant un framework d'extraction de relations et des outils de reconnaissance d'entités nommées. Il utilise la supervision distante et l'apprentissage automatique pour identifier et classer les relations entre les entités, convertissant le texte non structuré en un réseau de faits et de dépendances. Le système fournit des capacités pour la récupération d'informations dans le domaine agricole via l'analyse de chemin basée sur le graphe et le mappage de taxonomie hiérarchique. Il permet aux utilisateurs d'identifier des entités spécifiques au sujet, d'extraire des relations de domaine et d'interroger le graphe de connaissances pour découvrir des connexions entre les nœuds.
Identifies and labels specific agricultural entities within unstructured text.
Duckling est un reconnaisseur d'entités nommées déterministe et un extracteur d'entités en langage naturel. Il transforme du texte non structuré en données lisibles par machine en mappant des chaînes d'entrée spécifiques à la langue vers des formats structurés universels. Le système utilise un moteur basé sur des règles et des règles linguistiques composables pour résoudre les entités sans dépendre de modèles probabilistes. Il prend en charge l'analyse de texte multilingue à travers diverses locales régionales, employant une approche basée sur la logique pour normaliser diverses expressions en langage naturel en valeurs numériques standardisées. Le projet couvre l'extraction et la normalisation des dates, heures, durées, distances, valeurs monétaires, températures et quantités. Il reconnaît également les informations de contact telles que les adresses e-mail, les numéros de téléphone, les URL et les numéros de carte de crédit. Les utilisateurs peuvent étendre le système en définissant des dimensions personnalisées et des règles d'extraction pour identifier des informations spécifiques au domaine.
Provides a deterministic system for identifying and extracting named entities from unstructured text.
nano-graphrag est un système de récupération qui utilise des graphes de connaissances pour fournir un contexte structuré aux réponses des grands modèles de langage (LLM). Il fonctionne comme un indexeur de graphe de connaissances qui transforme le texte non structuré en un réseau d'entités et de relations, ainsi qu'un système de récupération de graphe hybride. Le projet se différencie en combinant des recherches de voisinage local avec des résumés de communautés globales pour répondre à des questions complexes en langage naturel. Il inclut un visualiseur de graphe de connaissances qui génère des représentations HTML des entités et de leurs relations pour cartographier les connaissances indexées. Le framework couvre un large ensemble de capacités, y compris l'extraction d'entités-relations, le clustering de graphes basé sur la communauté et l'indexation incrémentale basée sur le hachage. Il fournit une couche d'intégration pour connecter des modèles open source et des fournisseurs d'embedding locaux, pris en charge par des backends de stockage enfichables pour les données clé-valeur, vectorielles et de graphe. Une utilité supplémentaire est fournie via la mise en cache des réponses basée sur les arguments et des fonctions de post-traitement pour réparer les sorties JSON instables des modèles de langage.
Extracts named entities and their interconnections from text to build a structured knowledge graph.
mini-graph-card is a customizable dashboard card and sensor widget for Home Assistant designed to visualize historical telemetry and sensor data. It functions as a time-series data visualizer that renders historical numeric and binary sensor data as line or bar graphs using an SVG graphing component. The project differentiates itself through the ability to extract specific nested attributes from entities and map non-numeric states into numeric values for visualization. It supports dynamic visual styling via color thresholds, logarithmic scales, and filling effects, alongside a multi-axis coor
Retrieves specific sensor attributes for visualization instead of relying on the primary entity state value.
Entity-Relation-Extraction est un framework de machine learning conçu pour identifier des entités et leurs connexions logiques au sein de textes non structurés. Il fonctionne comme un pipeline qui transforme des documents bruts en graphes de connaissances structurés en utilisant des modèles de deep learning et des architectures de type transformer. Le projet se distingue par une approche basée sur des schémas, qui mappe les informations extraites vers des modèles relationnels prédéfinis pour assurer la cohérence des résultats. Il emploie un processus multi-étapes combinant l'étiquetage de séquences (token classification) et l'encodage contextuel pour délimiter les frontières des entités et classifier les relations entre elles. La boîte à outils fournit des composants pour le fine-tuning de modèles de langage pré-entraînés et l'orchestration de données via des graphes de calcul. Elle inclut des utilitaires pour évaluer les performances du modèle par rapport à des jeux de données de référence afin de vérifier la précision du processus d'extraction.
Identifies specific entities and determines logical connections between them using a multi-stage classification pipeline.
Spider est une plateforme basée sur le web conçue pour l'extraction automatisée de données, fournissant un framework centralisé pour collecter, traiter et router des informations structurées à partir de sites web. Elle fonctionne comme un pipeline complet qui gère l'ensemble du cycle de vie de la collecte de données, de la configuration initiale au stockage final dans des bases de données externes ou des files d'attente de messages. La plateforme se distingue par une interface de configuration visuelle qui permet aux utilisateurs de définir des règles d'extraction et de gérer des modèles de scraping sans écrire de code personnalisé. Elle prend en charge la récupération de contenu statique et dynamique en intégrant l'automatisation de navigateur headless, qui exécute du JavaScript côté client pour capturer des données à partir de sites web modernes et interactifs. Les utilisateurs peuvent également utiliser l'extraction heuristique pour extraire automatiquement le texte principal des articles et les métadonnées sans configuration manuelle de sélecteurs. Au-delà de la simple collecte, le système inclut des outils pour l'analyse de contenu structuré et le mappage de relations. Il identifie les mots-clés, détecte les entités et visualise les connexions entre les personnes, les lieux et les articles pour fournir un contexte plus profond aux informations recueillies. La plateforme dispose également de capacités intégrées de recherche et d'indexation, permettant aux utilisateurs d'interroger les enregistrements stockés et de gérer le flux de données via un tableau de bord unifié.
Identifies keywords and detects entities within extracted text to provide deeper context for gathered information.