3 repository-uri
Layers that perform affine transformations via matrix multiplication and bias addition.
Distinct from Linear Mixing Layers: Distinct from Linear Mixing Layers by focusing on general size transformation (input to output) rather than mixing dimensions
Explore 3 awesome GitHub repositories matching artificial intelligence & ml · Linear Transformation Layers. Refine with filters or upvote what's useful.
Flashlight este o bibliotecă C++ standalone de machine learning și tensori, utilizată pentru construirea și antrenarea rețelelor neuronale. Aceasta funcționează ca un framework cuprinzător de rețele neuronale și motor de diferențiere automată, oferind instrumentele necesare pentru a construi grafuri de calcul și a calcula gradienții prin backpropagation. Proiectul servește drept framework de antrenare distribuită, utilizând operațiuni all-reduce pentru a sincroniza gradienții și parametrii pe mai multe noduri de calcul și dispozitive. Se distinge prin integrarea profundă a manipulării de înaltă performanță a tensorilor, interoperabilitatea nativă a memoriei dispozitivului și un sistem pentru sincronizarea ponderilor între workerii distribuiți pentru a accelera antrenarea modelelor la scară largă. Framework-ul acoperă o gamă largă de capabilități de deep learning, inclusiv compoziția modulară a straturilor pentru proiectarea arhitecturilor complexe precum blocuri reziduale și celule recurente. Oferă utilitare extinse de gestionare a datelor pentru ingestie și prefetching, alături de sisteme de serializare pentru persistența stărilor modelelor. În plus, include o suită de instrumente de monitorizare și observabilitate pentru urmărirea metricilor de antrenare și măsurarea erorilor de secvență. Biblioteca este implementată în C++.
Implements linear transformation layers that use matrix multiplication and optional bias to transform input tensor sizes.
PerceptualSimilarity este un framework de deep learning conceput pentru a cuantifica și evalua distanța perceptivă dintre imagini. Oferă un sistem pentru măsurarea modului în care două imagini sau patch-uri de imagine par similare vederii umane, folosind reprezentări de caracteristici profunde în loc de diferențe la nivel de pixel. Proiectul implementează o metrică de distanță diferențiabilă care funcționează ca o funcție de pierdere (loss function), permițând optimizarea pixelilor imaginii prin backpropagation pentru a atinge un aspect vizual țintă. Include un strat liniar antrenabil care poate fi aplicat caracteristicilor profunde înghețate pentru a învăța metrici de distanță ponderate aliniate cu percepția umană. Framework-ul acoperă capabilități largi în evaluarea calității imaginii, antrenarea metricilor de similaritate și benchmarking-ul computer vision. Acuratețea modelului este evaluată prin compararea scorurilor de distanță prezise cu seturile de date de judecată umană folosind framework-uri precum testele de tip two-alternative forced choice.
Uses a trainable linear layer on top of frozen features to learn weighted human-perceptual distances.
DeepSeek-VL este un model de limbaj mare multimodal și un motor de raționament imagine-la-text. Funcționează ca un model vision-language și un sistem de răspuns vizual la întrebări care integrează percepția vizuală cu raționamentul lingvistic pentru a înțelege și descrie imaginile. Proiectul permite înțelegerea multimodală a imaginilor și analiza imaginilor de documente, procesând în mod specific capturi de ecran ale paginilor web și diagrame tehnice. Oferă capabilități pentru AI conversațional vizual, permițând utilizatorilor să interacționeze cu datele vizuale pentru a extrage perspective și a efectua raționamente complexe pe diferite tipuri de informații vizuale. Sistemul utilizează o arhitectură de tip transformer vision-language care combină un Vision Transformer pentru codificarea vizuală cu un model de limbaj mare. Utilizează reglarea fină (fine-tuning) multimodală bazată pe instrucțiuni și un strat de proiecție pentru a alinia vectorii de caracteristici vizuale cu spațiul de embedding al modelului de limbaj pentru generarea autoregresivă de text.
Employs a learnable projection layer to align visual feature vectors with the language model's embedding space.