2 dépôts
Uses vision-language models as an OCR backend and for extracting structured JSON from documents using a schema.
Distinct from Structured Document Extraction: Distinct from Structured Document Extraction: focuses on using VLM backends for extraction, not general layout-to-text conversion.
Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Vision-Language Model Backends. Refine with filters or upvote what's useful.
Kreuzberg is a document extraction engine that converts PDFs, Office files, images, and over 90 other formats into clean, structured text and metadata. It is built around a compiled Rust core that can be used as a native library, a command-line tool, a REST API server, or a WebAssembly module for browser-based processing. The system is designed to run entirely on self-hosted infrastructure, with no data leaving the user's environment. What distinguishes Kreuzberg is its breadth of integration surfaces and its pipeline architecture. It exposes extraction capabilities through native bindings fo
Leverages vision language models as an OCR backend and extracts structured JSON from documents using a schema, supporting 146 LLM providers.
Sparrow est une plateforme d'extraction de documents par LLM et un moteur d'inférence basé sur la vision, conçu pour convertir des images et des PDF en données structurées validées. Il fonctionne comme un orchestrateur de workflow agentique qui enchaîne des tâches de classification, d'extraction et de validation dans des pipelines multi-étapes. Le système se distingue par une couche d'inférence agnostique au backend qui gère les modèles sur des GPU locaux, Apple Silicon et des fournisseurs cloud. Il utilise le "visual grounding" basé sur les coordonnées pour mapper le texte extrait à des boîtes englobantes précises et utilise un guidage par indices pour orienter l'attention et normaliser les formats de données. La plateforme couvre les workflows d'intelligence documentaire, incluant le traitement spécialisé d'images de tableaux pour maintenir l'intégrité structurelle et une validation basée sur des schémas pour vérifier l'exactitude des champs extraits. Elle fournit également un tableau de bord d'analyse documentaire pour surveiller les performances de l'API, les statistiques d'utilisation et l'état du système. L'architecture inclut un système d'extension par plugins pour intégrer des bibliothèques tierces utilisées dans l'indexation et l'orchestration.
Uses vision-capable language models to parse document layouts and convert visual content into structured data.