awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repositorios

Awesome GitHub RepositoriesAudio-Visual Semantic Alignment

Matching sounds to corresponding images or videos by mapping both to a shared mathematical space.

Distinct from Audio-Visual Signal Alignment: Distinct from temporal signal alignment as it focuses on semantic meaning rather than clock synchronization

Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Audio-Visual Semantic Alignment. Refine with filters or upvote what's useful.

Awesome Audio-Visual Semantic Alignment GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • facebookresearch/imagebindAvatar de facebookresearch

    facebookresearch/ImageBind

    9,036Ver en GitHub↗

    ImageBind is a multi-modal embedding model and joint representation learner that maps images, text, audio, and other modalities into a single shared vector space. It functions as a cross-modal retrieval framework designed to bind multiple sensory inputs into one cohesive mathematical embedding. The system uses a contrastive learning architecture to align disparate data types by maximizing the similarity between related samples. This allows the model to perform zero-shot multimodal classification and execute cross-modal data retrieval, such as locating visual content via natural language descr

    Matches specific sounds to corresponding images by mapping both to a common semantic space.

    Python
    Ver en GitHub↗9,036
  • bytedance/latentsyncAvatar de bytedance

    bytedance/LatentSync

    5,806Ver en GitHub↗

    LatentSync es un generador de video impulsado por audio y modelo de difusión latente de sincronización labial diseñado para sincronizar los movimientos labiales de un hablante en un video con una pista de audio objetivo. Proporciona un framework de entrenamiento de sincronización labial para desarrollar redes de sincronización en datasets personalizados de video y audio. El sistema utiliza un pipeline de preprocesamiento de video para limpiar, segmentar y alinear datos faciales. Incluye una herramienta de evaluación de sincronización visual que calcula puntuaciones de confianza para medir la precisión de la alineación de audio y video en los videos generados. El proyecto cubre capacidades para el desarrollo de redes de sincronización personalizadas, gestión de configuración de entrenamiento para memoria de hardware y resolución, y evaluación de video sintético.

    Processes video and audio data to ensure facial movements match the timing and patterns of speech.

    Python
    Ver en GitHub↗5,806
  1. Home
  2. Artificial Intelligence & ML
  3. Audio-Visual Semantic Alignment