awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
meta-llama avatar

meta-llama/synthetic-data-kit

0
View on GitHub↗

Synthetic Data Kit

Le kit de données synthétiques est un framework intégré conçu pour générer, organiser et formater des jeux de données d'entraînement pour les modèles de langage. Il fournit un pipeline de bout en bout qui transforme les documents sources bruts en données structurées adaptées au fine-tuning, au raisonnement et à l'entraînement de modèles d'utilisation d'outils.

Le framework se distingue par un moteur d'orchestration modulaire qui gère tout le cycle de vie de la préparation des données. Il prend en charge l'entrée multimodale en extrayant à la fois le contenu texte et image à partir de divers formats de fichiers, tout en utilisant un découpage conscient du contexte pour maintenir la cohérence sémantique. Le processus de génération est piloté par l'injection de prompts basée sur des modèles, et la sortie résultante est validée par un système d'évaluation automatisé qui utilise des modèles de langage comme juges pour garantir la qualité et la précision.

Le projet couvre un large éventail de capacités de traitement de données, y compris l'analyse de documents, le filtrage de qualité automatisé et la sérialisation agnostique au schéma. Il prend en charge la création d'exemples d'entraînement divers, tels que des traces de raisonnement et des démonstrations d'utilisation d'outils, et exporte les jeux de données finaux dans des formats standardisés pour la compatibilité avec les frameworks d'entraînement de machine learning.

Les utilisateurs gèrent le flux de travail de génération et les étapes du pipeline via des fichiers de configuration centralisés et des arguments en ligne de commande.

Recherche par IA

Explorez plus de dépôts awesome

Décrivez vos besoins en langage naturel — l'IA classe des milliers de projets open source sélectionnés par pertinence.

Start searching with AI
pypi.org/project/synthetic-data-kit
↗

Features

  • Synthetic Data Generators - Creates and curates high-quality training datasets from raw documents using language model inference.
  • Modular Pipeline Orchestrators - Orchestrates modular processing stages to transform raw documents into structured training datasets.
  • Document Processing Pipelines - Provides an end-to-end pipeline for extracting and structuring text from raw documents.
  • Machine Learning Pipelines - Provides a modular orchestration engine that manages the end-to-end lifecycle of transforming raw documents into structured machine learning training datasets.
  • LLM-As-A-Judge Scoring - Uses language models as judges to evaluate and filter generated content for quality and accuracy.
  • Synthetic Dataset Generators - Automates the generation of diverse synthetic training datasets, including summaries and question-answer pairs, through language model inference on source documents.
  • Text Dataset Curators - Curates machine learning datasets through automated quality filtering and validation.
  • Multimodal Feature Extractors - Provides a unified layer for extracting text and image content from mixed-media documents.
  • Tool-Use Training - Produces specialized training data that teaches language models how to effectively interact with external software tools and APIs.
  • LLM Fine-Tuning Toolsets - Prepares high-quality, structured training datasets specifically for language model fine-tuning.
  • Dataset Curation Tools - Provides utilities for evaluating and filtering generated content to ensure training suitability.
  • Multimodal Document Processing - Extracts text and image content from mixed-media documents to support synthetic data generation.
  • Prompt Templates - Injects source content and instructions into configurable templates to drive dynamic generation behavior.
  • Semantic Chunking - Splits large source documents into overlapping segments to maintain semantic coherence during synthetic data generation.
  • Synthetic Reasoning Data Generators - Generates structured chains of thought and reasoning traces to enhance the logical problem-solving capabilities of language models.
  • Training Data Exporters - Exports processed datasets into standardized formats for downstream model training.
  • Document Parsing Pipelines - Parses diverse file formats into structured text for downstream processing.
  • Multimodal Quality Filters - Filters generated content using automated quality checks to ensure high-quality training samples.
1,602 stars·220 forks·Python·MIT·15 vues

Historique des stars

Graphique de l'historique des stars pour meta-llama/synthetic-data-kitGraphique de l'historique des stars pour meta-llama/synthetic-data-kit

Collections incluant Synthetic Data Kit

Sélections manuelles où Synthetic Data Kit apparaît.
  • Génération de données synthétiques pour LLM
  • Outils de génération de données synthétiques

Questions fréquentes

Que fait meta-llama/synthetic-data-kit ?

Le kit de données synthétiques est un framework intégré conçu pour générer, organiser et formater des jeux de données d'entraînement pour les modèles de langage. Il fournit un pipeline de bout en bout qui transforme les documents sources bruts en données structurées adaptées au fine-tuning, au raisonnement et à l'entraînement de modèles d'utilisation d'outils.

Quelles sont les fonctionnalités principales de meta-llama/synthetic-data-kit ?

Les fonctionnalités principales de meta-llama/synthetic-data-kit sont : Synthetic Data Generators, Modular Pipeline Orchestrators, Document Processing Pipelines, Machine Learning Pipelines, LLM-As-A-Judge Scoring, Synthetic Dataset Generators, Text Dataset Curators, Multimodal Feature Extractors.

Quelles sont les alternatives open-source à meta-llama/synthetic-data-kit ?

Les alternatives open-source à meta-llama/synthetic-data-kit incluent : oumi-ai/oumi — Oumi is a comprehensive large language model development platform designed for synthesizing data, fine-tuning models,… maiot-io/zenml — ZenML is an extensible machine learning orchestration framework designed to manage the end-to-end lifecycle of data… openpipe/art — ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and… nvidia/isaac-gr00t. datajuicer/data-juicer — Data-Juicer is an open-source framework for cleaning, filtering, deduplicating, and transforming multimodal datasets… camel-ai/owl — Owl is a framework for agentic workflow automation and multi-agent orchestration. It functions as a system for…

Alternatives open source à Synthetic Data Kit

Projets open source similaires, classés selon le nombre de fonctionnalités partagées avec Synthetic Data Kit.
  • oumi-ai/oumiAvatar de oumi-ai

    oumi-ai/oumi

    8,858Voir sur GitHub↗

    Oumi is a comprehensive large language model development platform designed for synthesizing data, fine-tuning models, and running performance evaluations. It serves as a unified environment for the entire model lifecycle, encompassing a training and fine-tuning suite, an evaluation framework, and tools for synthetic data generation and model distillation. The platform is distinguished by its iterative, failure-driven synthesis approach, which analyzes model weaknesses during evaluation to generate targeted training data. It utilizes an LLM-based judge framework to programmatically score respo

    Pythondpoevaluationfine-tuning
    Voir sur GitHub↗8,858
  • maiot-io/zenmlAvatar de maiot-io

    maiot-io/zenml

    5,452Voir sur GitHub↗

    ZenML is an extensible machine learning orchestration framework designed to manage the end-to-end lifecycle of data pipelines and AI agent workflows. It functions as a durable orchestrator that executes machine learning tasks as directed acyclic graphs, ensuring that every step is containerized for consistent performance across local, cloud, and hybrid infrastructure. By decoupling pipeline code from underlying compute and storage backends, the platform allows developers to define infrastructure-agnostic stacks that remain portable across diverse environments. The project distinguishes itself

    Python
    Voir sur GitHub↗5,452
  • openpipe/artAvatar de OpenPipe

    OpenPipe/ART

    8,630Voir sur GitHub↗

    ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and compute orchestrator. It enables the improvement of multi-step agent reasoning and tool usage through group relative policy optimization and a judge-based reward modeling system. The project features tools for model distillation to transfer capabilities from large teacher models to smaller architectures, as well as a system for capturing execution trajectories to generate synthetic training data. It supports specialized training workflows including supervised fine-tuning for baselin

    Pythonagentagentic-aigrpo
    Voir sur GitHub↗8,630
  • nvidia/isaac-gr00tAvatar de NVIDIA

    NVIDIA/Isaac-GR00T

    6,222Voir sur GitHub↗
    Jupyter Notebook
    Voir sur GitHub↗6,222
Voir les 30 alternatives à Synthetic Data Kit→