awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repositorios

Awesome GitHub RepositoriesVision-Language Model Backends

Uses vision-language models as an OCR backend and for extracting structured JSON from documents using a schema.

Distinct from Structured Document Extraction: Distinct from Structured Document Extraction: focuses on using VLM backends for extraction, not general layout-to-text conversion.

Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Vision-Language Model Backends. Refine with filters or upvote what's useful.

Awesome Vision-Language Model Backends GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • kreuzberg-dev/kreuzbergAvatar de kreuzberg-dev

    kreuzberg-dev/kreuzberg

    8,527Ver en GitHub↗

    Kreuzberg is a document extraction engine that converts PDFs, Office files, images, and over 90 other formats into clean, structured text and metadata. It is built around a compiled Rust core that can be used as a native library, a command-line tool, a REST API server, or a WebAssembly module for browser-based processing. The system is designed to run entirely on self-hosted infrastructure, with no data leaving the user's environment. What distinguishes Kreuzberg is its breadth of integration surfaces and its pipeline architecture. It exposes extraction capabilities through native bindings fo

    Leverages vision language models as an OCR backend and extracts structured JSON from documents using a schema, supporting 146 LLM providers.

    Rustdocument-intelligenceelixirffi
    Ver en GitHub↗8,527
  • katanaml/sparrowAvatar de katanaml

    katanaml/sparrow

    5,162Ver en GitHub↗

    Sparrow es una plataforma de extracción de documentos basada en LLM y un motor de inferencia visual diseñado para convertir imágenes y PDFs en datos estructurados validados. Funciona como un orquestador de flujos de trabajo agenticos que encadena tareas de clasificación, extracción y validación en pipelines de múltiples pasos. El sistema se distingue por una capa de inferencia agnóstica al backend que gestiona modelos en GPUs locales, Apple Silicon y proveedores en la nube. Emplea grounding visual basado en coordenadas para mapear el texto extraído a coordenadas precisas de cuadros delimitadores y utiliza dirección de modelos basada en pistas para guiar la atención y normalizar formatos de datos. La plataforma cubre flujos de trabajo de inteligencia documental, incluyendo procesamiento especializado de tablas basadas en imágenes para mantener la integridad estructural y validación basada en esquemas para verificar la exactitud de los campos extraídos. También proporciona un panel de análisis documental para monitorear el rendimiento de la API, analíticas de uso y el estado del sistema. La arquitectura incluye un sistema de extensión basado en plugins para integrar librerías de terceros utilizadas en indexación y orquestación.

    Uses vision-capable language models to parse document layouts and convert visual content into structured data.

    Pythonagentic-aicomputer-visiondocumentai
    Ver en GitHub↗5,162
  1. Home
  2. Artificial Intelligence & ML
  3. Natural Language Processing
  4. Structured Document Extraction
  5. Vision-Language Model Backends