awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

1 repositorio

Awesome GitHub RepositoriesLoading Sequence Determinism

Ensuring a fixed and reproducible order of data files during model training across distributed clusters.

Distinct from Data Standardization: Distinct from general data standardization; specifically targets the sequence of file loading for training consistency.

Explore 1 awesome GitHub repository matching data & databases · Loading Sequence Determinism. Refine with filters or upvote what's useful.

Awesome Loading Sequence Determinism GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • internlm/xtunerAvatar de InternLM

    InternLM/xtuner

    5,150Ver en GitHub↗

    xtuner es un motor de entrenamiento integral para modelos de lenguaje grandes, que ofrece un toolkit para pre-entrenamiento, ajuste fino supervisado (fine-tuning) y la optimización de modelos multimodales de visión-lenguaje. Sirve como un acelerador de entrenamiento distribuido y un framework especializado para escalar modelos de Mezcla de Expertos (MoE) y alinear el comportamiento del modelo mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). El proyecto se distingue por optimizaciones avanzadas de memoria y cómputo, como el paralelismo de secuencia para ventanas de contexto ultra largas y el paralelismo de pipeline entrelazado para reducir el tiempo de inactividad de la GPU. Proporciona una suite dedicada para la optimización de preferencias, implementando técnicas como Group Relative Policy Optimization y Direct Preference Optimization para refinar las políticas del modelo y los sistemas de recompensa. Las áreas de capacidad cubren el entrenamiento distribuido de modelos a través de múltiples nodos, la preparación de datasets multimodales y la gestión del ajuste fino basado en adaptadores. El motor también incluye herramientas para la evaluación de modelos, fusión de pesos y exportación de parámetros entrenados a motores de inferencia. El entrenamiento se gestiona mediante archivos de configuración estandarizados y lanzadores distribuidos para asegurar resultados consistentes a través de clusters de computación.

    Generates a fixed sequence of training data files to ensure consistent results across computing clusters.

    Pythonagentdeepseek-v3gpt-oss
    Ver en GitHub↗5,150
  1. Home
  2. Data & Databases
  3. Data Governance and Modeling
  4. Data Standardization
  5. Loading Sequence Determinism