awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 dépôts

Awesome GitHub RepositoriesVision-Language Model Backends

Uses vision-language models as an OCR backend and for extracting structured JSON from documents using a schema.

Distinct from Structured Document Extraction: Distinct from Structured Document Extraction: focuses on using VLM backends for extraction, not general layout-to-text conversion.

Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Vision-Language Model Backends. Refine with filters or upvote what's useful.

Awesome Vision-Language Model Backends GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • kreuzberg-dev/kreuzbergAvatar de kreuzberg-dev

    kreuzberg-dev/kreuzberg

    8,527Voir sur GitHub↗

    Kreuzberg is a document extraction engine that converts PDFs, Office files, images, and over 90 other formats into clean, structured text and metadata. It is built around a compiled Rust core that can be used as a native library, a command-line tool, a REST API server, or a WebAssembly module for browser-based processing. The system is designed to run entirely on self-hosted infrastructure, with no data leaving the user's environment. What distinguishes Kreuzberg is its breadth of integration surfaces and its pipeline architecture. It exposes extraction capabilities through native bindings fo

    Leverages vision language models as an OCR backend and extracts structured JSON from documents using a schema, supporting 146 LLM providers.

    Rustdocument-intelligenceelixirffi
    Voir sur GitHub↗8,527
  • katanaml/sparrowAvatar de katanaml

    katanaml/sparrow

    5,162Voir sur GitHub↗

    Sparrow est une plateforme d'extraction de documents par LLM et un moteur d'inférence basé sur la vision, conçu pour convertir des images et des PDF en données structurées validées. Il fonctionne comme un orchestrateur de workflow agentique qui enchaîne des tâches de classification, d'extraction et de validation dans des pipelines multi-étapes. Le système se distingue par une couche d'inférence agnostique au backend qui gère les modèles sur des GPU locaux, Apple Silicon et des fournisseurs cloud. Il utilise le "visual grounding" basé sur les coordonnées pour mapper le texte extrait à des boîtes englobantes précises et utilise un guidage par indices pour orienter l'attention et normaliser les formats de données. La plateforme couvre les workflows d'intelligence documentaire, incluant le traitement spécialisé d'images de tableaux pour maintenir l'intégrité structurelle et une validation basée sur des schémas pour vérifier l'exactitude des champs extraits. Elle fournit également un tableau de bord d'analyse documentaire pour surveiller les performances de l'API, les statistiques d'utilisation et l'état du système. L'architecture inclut un système d'extension par plugins pour intégrer des bibliothèques tierces utilisées dans l'indexation et l'orchestration.

    Uses vision-capable language models to parse document layouts and convert visual content into structured data.

    Pythonagentic-aicomputer-visiondocumentai
    Voir sur GitHub↗5,162
  1. Home
  2. Artificial Intelligence & ML
  3. Natural Language Processing
  4. Structured Document Extraction
  5. Vision-Language Model Backends