awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descoperă cele mai bune repository-uri open source cu căutare AI.

ExploreazăCăutări recomandateAlternative open-sourceSoftware self-hostedBlogHartă site
ProiectServer MCPDespreCum realizăm clasamentulPresă
LegalConfidențialitateTermeni
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 repository-uri

Awesome GitHub RepositoriesMultilingual Image-Text Alignment

Training processes that map images and text across multiple languages into a shared vector space.

Distinct from Caption-Based Training: Extends caption-based training to include shared latent spaces for multilingual alignment, not just image-text association.

Explore 2 awesome GitHub repositories matching artificial intelligence & ml · Multilingual Image-Text Alignment. Refine with filters or upvote what's useful.

Awesome Multilingual Image-Text Alignment GitHub Repositories

Găsește cele mai bune repo-uri cu AI.Vom căuta cele mai potrivite repository-uri folosind AI.
  • kwai-kolors/kolorsAvatar Kwai-Kolors

    Kwai-Kolors/Kolors

    4,607Vezi pe GitHub↗

    Kolors este o implementare de model generativ pentru sintetizarea imaginilor fotorealiste din descrieri în limbaj natural și referințe vizuale. Utilizează un framework de tip latent diffusion model pentru a produce imagini de înaltă fidelitate, operând într-un spațiu latent comprimat pentru a îmbunătăți eficiența și calitatea generării. Sistemul funcționează ca un generator de imagini multilingv, interpretând prompt-uri text în mai multe limbi pentru a produce rezultate vizuale corecte din punct de vedere semantic. Include un pipeline personalizat de antrenare a modelelor care utilizează adaptarea low-rank (LoRA) pentru a învăța modelul subiecte specifice sau stiluri artistice dintr-un set mic de imagini. Proiectul acoperă o gamă largă de capabilități de sinteză și editare a imaginilor, inclusiv transformări text-to-image și image-to-image. Oferă instrumente pentru controlul layout-ului spațial prin hărți de adâncime sau de postură, injectarea identității vizuale pentru consistență estetică și inpainting bazat pe măști pentru a reconstrui sau modifica regiuni specifice ale imaginii. Implementarea include utilitare pentru evaluarea calității imaginilor, punctând imaginile generate pe baza metricilor de preferință umană pentru calitatea estetică și semantică.

    Provides the ability to interpret text prompts in multiple languages to produce semantically accurate visual outputs.

    Python
    Vezi pe GitHub↗4,607
  • google-research/big_visionAvatar google-research

    google-research/big_vision

    3,363Vezi pe GitHub↗

    This project is a research framework and toolkit designed for training large-scale vision transformers and multimodal language models. It provides a comprehensive suite for vision-language pretraining, enabling the development of models that map images and text into shared latent spaces. The framework is distinguished by its capabilities in high-fidelity image generation and multimodal research, utilizing normalizing flows and variational autoencoders to produce images from text prompts or class labels. It supports the development of both generative and contrastive models, allowing for a wide

    Maps images and text into a shared space using captioning-based pretraining and self-supervised losses.

    Jupyter Notebook
    Vezi pe GitHub↗3,363
  1. Home
  2. Artificial Intelligence & ML
  3. Text Model Training
  4. Caption-Based Training
  5. Multilingual Image-Text Alignment