awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·
meta-llama avatar

meta-llama/synthetic-data-kit

0
View on GitHub↗
1,602 estrellas·220 forks·Python·MIT·15 vistaspypi.org/project/synthetic-data-kit↗

Synthetic Data Kit

El kit de datos sintéticos es un framework integrado diseñado para generar, curar y formatear conjuntos de datos de entrenamiento para modelos de lenguaje. Proporciona un pipeline integral que transforma documentos fuente sin procesar en datos estructurados adecuados para el ajuste fino, el razonamiento y el entrenamiento de modelos de uso de herramientas.

El framework se distingue por un motor de orquestación modular que gestiona todo el ciclo de vida de la preparación de datos. Admite entrada multimodal extrayendo contenido de texto e imagen de varios formatos de archivo, mientras emplea fragmentación consciente del contexto para mantener la coherencia semántica. El proceso de generación es impulsado por la inyección de prompts basada en plantillas, y la salida resultante se valida a través de un sistema de evaluación automatizado que utiliza modelos de lenguaje como jueces para asegurar la calidad y la precisión.

El proyecto cubre una amplia gama de capacidades de procesamiento de datos, incluyendo análisis de documentos, filtrado de calidad automatizado y serialización agnóstica al esquema. Admite la creación de diversos ejemplos de entrenamiento, como trazas de razonamiento y demostraciones de uso de herramientas, y exporta los conjuntos de datos finales a formatos estandarizados para su compatibilidad con frameworks de entrenamiento de machine learning.

Los usuarios gestionan el flujo de trabajo de generación y las etapas del pipeline a través de archivos de configuración centralizados y argumentos de línea de comandos.

Features

  • Synthetic Data Generators - Creates and curates high-quality training datasets from raw documents using language model inference.
  • Modular Pipeline Orchestrators - Orchestrates modular processing stages to transform raw documents into structured training datasets.
  • Document Processing Pipelines - Provides an end-to-end pipeline for extracting and structuring text from raw documents.
  • Machine Learning Pipelines - Provides a modular orchestration engine that manages the end-to-end lifecycle of transforming raw documents into structured machine learning training datasets.
  • LLM-As-A-Judge Scoring - Uses language models as judges to evaluate and filter generated content for quality and accuracy.
  • Synthetic Dataset Generators - Automates the generation of diverse synthetic training datasets, including summaries and question-answer pairs, through language model inference on source documents.
  • Text Dataset Curators - Curates machine learning datasets through automated quality filtering and validation.
  • Multimodal Feature Extractors - Provides a unified layer for extracting text and image content from mixed-media documents.
  • Tool-Use Training - Produces specialized training data that teaches language models how to effectively interact with external software tools and APIs.
  • LLM Fine-Tuning Toolsets - Prepares high-quality, structured training datasets specifically for language model fine-tuning.
  • Dataset Curation Tools - Provides utilities for evaluating and filtering generated content to ensure training suitability.
  • Multimodal Document Processing - Extracts text and image content from mixed-media documents to support synthetic data generation.
  • Prompt Templates - Injects source content and instructions into configurable templates to drive dynamic generation behavior.
  • Semantic Chunking - Splits large source documents into overlapping segments to maintain semantic coherence during synthetic data generation.
  • Synthetic Reasoning Data Generators - Generates structured chains of thought and reasoning traces to enhance the logical problem-solving capabilities of language models.
  • Training Data Exporters - Exports processed datasets into standardized formats for downstream model training.
  • Document Parsing Pipelines - Parses diverse file formats into structured text for downstream processing.
  • Multimodal Quality Filters - Filters generated content using automated quality checks to ensure high-quality training samples.

Historial de estrellas

Gráfico del historial de estrellas de meta-llama/synthetic-data-kitGráfico del historial de estrellas de meta-llama/synthetic-data-kit

Búsqueda con IA

Explora más repositorios increíbles

Describe lo que necesitas en lenguaje sencillo: la IA clasifica miles de proyectos open-source curados por relevancia.

Start searching with AI

Colecciones destacadas con Synthetic Data Kit

Colecciones seleccionadas manualmente donde aparece Synthetic Data Kit.
  • Generación de datos sintéticos para LLMs
  • Herramientas de generación de datos sintéticos

Preguntas frecuentes

¿Qué hace meta-llama/synthetic-data-kit?

El kit de datos sintéticos es un framework integrado diseñado para generar, curar y formatear conjuntos de datos de entrenamiento para modelos de lenguaje. Proporciona un pipeline integral que transforma documentos fuente sin procesar en datos estructurados adecuados para el ajuste fino, el razonamiento y el entrenamiento de modelos de uso de herramientas.

¿Cuáles son las características principales de meta-llama/synthetic-data-kit?

Las características principales de meta-llama/synthetic-data-kit son: Synthetic Data Generators, Modular Pipeline Orchestrators, Document Processing Pipelines, Machine Learning Pipelines, LLM-As-A-Judge Scoring, Synthetic Dataset Generators, Text Dataset Curators, Multimodal Feature Extractors.

¿Qué alternativas de código abierto existen para meta-llama/synthetic-data-kit?

Las alternativas de código abierto para meta-llama/synthetic-data-kit incluyen: oumi-ai/oumi — Oumi is a comprehensive large language model development platform designed for synthesizing data, fine-tuning models,… maiot-io/zenml — ZenML is an extensible machine learning orchestration framework designed to manage the end-to-end lifecycle of data… openpipe/art — ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and… nvidia/isaac-gr00t. datajuicer/data-juicer — Data-Juicer is an open-source framework for cleaning, filtering, deduplicating, and transforming multimodal datasets… camel-ai/owl — Owl is a framework for agentic workflow automation and multi-agent orchestration. It functions as a system for…

Alternativas open-source a Synthetic Data Kit

Proyectos open-source similares, clasificados según cuántas características comparten con Synthetic Data Kit.
  • oumi-ai/oumiAvatar de oumi-ai

    oumi-ai/oumi

    8,858Ver en GitHub↗

    Oumi is a comprehensive large language model development platform designed for synthesizing data, fine-tuning models, and running performance evaluations. It serves as a unified environment for the entire model lifecycle, encompassing a training and fine-tuning suite, an evaluation framework, and tools for synthetic data generation and model distillation. The platform is distinguished by its iterative, failure-driven synthesis approach, which analyzes model weaknesses during evaluation to generate targeted training data. It utilizes an LLM-based judge framework to programmatically score respo

    Pythondpoevaluationfine-tuning
    Ver en GitHub↗8,858
  • maiot-io/zenmlAvatar de maiot-io

    maiot-io/zenml

    5,452Ver en GitHub↗

    ZenML is an extensible machine learning orchestration framework designed to manage the end-to-end lifecycle of data pipelines and AI agent workflows. It functions as a durable orchestrator that executes machine learning tasks as directed acyclic graphs, ensuring that every step is containerized for consistent performance across local, cloud, and hybrid infrastructure. By decoupling pipeline code from underlying compute and storage backends, the platform allows developers to define infrastructure-agnostic stacks that remain portable across diverse environments. The project distinguishes itself

    Python
    Ver en GitHub↗5,452
  • openpipe/artAvatar de OpenPipe

    OpenPipe/ART

    8,630Ver en GitHub↗

    ART is a platform for agentic training, providing a reinforcement learning framework, training environment, and compute orchestrator. It enables the improvement of multi-step agent reasoning and tool usage through group relative policy optimization and a judge-based reward modeling system. The project features tools for model distillation to transfer capabilities from large teacher models to smaller architectures, as well as a system for capturing execution trajectories to generate synthetic training data. It supports specialized training workflows including supervised fine-tuning for baselin

    Pythonagentagentic-aigrpo
    Ver en GitHub↗8,630
  • nvidia/isaac-gr00tAvatar de NVIDIA

    NVIDIA/Isaac-GR00T

    6,222Ver en GitHub↗
    Jupyter Notebook
    Ver en GitHub↗6,222
Ver las 30 alternativas a Synthetic Data Kit→