4 Repos
Generating predictions from models without requiring task-specific training data.
Distinct from Model Predictions: Focuses on general zero-shot inference across tasks, unlike the specific image segmentation or identity synthesis candidates.
Explore 4 awesome GitHub repositories matching artificial intelligence & ml · Zero-Shot Predictions. Refine with filters or upvote what's useful.
This project is a comprehensive collection of practical code examples and implementation libraries for machine learning. It provides a wide array of reference materials for building supervised, unsupervised, and reinforcement learning algorithms. The repository serves as a multi-domain resource, featuring specific implementation suites for financial AI, Bayesian statistical modeling, and deep learning architectures. It includes a framework for training intelligent agents using policy gradients and actor-critic models, as well as practical guides for fine-tuning transformers and utilizing larg
Enables the generation of predictions using large language models without the need for specific training datasets.
mmaction2 ist eine PyTorch-Toolbox für das Videoverständnis, die für das Training und die Evaluierung von Deep-Learning-Modellen entwickelt wurde. Sie dient als Framework für Aktionserkennung, zeitliche Lokalisierung und räumlich-zeitliche Aktionserkennung und bietet spezialisierte Tools sowohl für pixelbasierte Videoanalyse als auch für skelettbasierte Aktionserkennung. Das Projekt zeichnet sich durch eine modulare Architektur mit registerbasierter Komponentenerkennung und hierarchischem, konfigurationsgesteuertem Modell-Assembly aus. Es unterstützt multimodale Feature-Fusion, integriert RGB-Frames, optischen Fluss und Audio und enthält Funktionen für Text-zu-Video-Clip-Retrieval und Zero-Shot-Videovorhersage. Das Framework deckt breit gefächert das Video-Dataset-Engineering ab, einschließlich Annotationsstandardisierung und Frame-Sampling, sowie umfassendes Modelltraining und -evaluierung. Es bietet Dienstprogramme für verteiltes Training, Knowledge Distillation und Inferenzoptimierung durch Modell-Reparametrisierung. Die Codebasis unterstützt den ONNX-Modell-Export und die Containerisierung der Umgebung für das Deployment über verschiedene Rechenknoten hinweg.
Predicts actions by comparing video features against text-based label templates without requiring class-specific training.
Dieses Projekt ist eine PyTorch-Implementierung von 3D-Residual-Netzwerken, die für die Video-Aktionserkennung konzipiert sind. Es bietet eine spatiotemporale Architektur, die sowohl räumliche Frames als auch zeitliche Bewegungen analysiert, um menschliche Aktivitäten innerhalb von Videoclips zu klassifizieren. Das System enthält ein Framework für verteiltes Modelltraining, um das Lernen über mehrere Rechenknoten hinweg zu beschleunigen. Es unterstützt das Deployment und Fine-Tuning vortrainierter Modellgewichte, was die Anpassung bestehender Netzwerke an spezifische neue Datensätze ermöglicht. Die Codebasis deckt die gesamte Pipeline für spatiotemporales Lernen ab, einschließlich Tools zur Vorverarbeitung von Videodatensätzen für die Konvertierung von Rohdateien in Bildsequenzen, Funktionen zur Aktionsinferenz und Metriken zur Berechnung der Erkennungsgenauigkeit.
Provides video action inference capabilities to predict activity class probabilities from trained models.
Video-Pre-Training ist ein Machine-Learning-Framework, das darauf ausgelegt ist, autonome Agenten durch Beobachtung und Nachahmung menschlichen Verhaltens aus Videoaufzeichnungen zu trainieren. Es bietet ein umfassendes Toolkit für Imitation Learning und Reinforcement Learning, das die Entwicklung von Agenten ermöglicht, die menschliche Handlungen in simulierten digitalen Umgebungen replizieren können. Das Framework zeichnet sich durch seine Fähigkeit aus, große, unbeschriftete Video-Datensätze zu verarbeiten, um die Fähigkeiten der Agenten zu initialisieren. Es nutzt Inverse-Dynamics-Modellierung, um Steuerungseingaben aus Frame-Übergängen abzuleiten, wodurch das System visuelle Beobachtungen spezifischen Aktionssequenzen zuordnen kann, selbst wenn explizite Aktionslabels fehlen. Dieser Prozess wird durch zeitliche Sequenzmodellierung und latente Merkmalsrepräsentation unterstützt, die die kausalen Zusammenhänge und langfristigen Abhängigkeiten erfassen, die für die Ausführung mehrstufiger Aufgaben erforderlich sind. Über das anfängliche Imitation Learning hinaus enthält die Plattform Pipelines für Behavioral Cloning und Reinforcement-Learning-Optimierung. Diese Tools ermöglichen es Forschern, vortrainierte Modelle durch iterative Interaktion mit der Umgebung und belohnungsbasiertes Feedback zu verfeinern. Das Framework bietet zudem Dienstprogramme zur Erfassung menschlicher Demonstrationen und zur Standardisierung roher Videosegmente und Aktionsprotokolle in strukturierte Datensätze, die für das Modell-Ingestion geeignet sind.
Predicts missing action labels from unlabeled video data by training a secondary model to infer control inputs from frame transitions.