awesome-repositories.com
Blog
MCP
awesome-repositories.com

Découvrez les meilleurs dépôts open-source grâce à notre recherche par IA.

ExplorerRecherches sélectionnéesAlternatives open sourceLogiciels auto-hébergésBlogPlan du site
ProjetServeur MCPÀ proposNotre méthodologiePresse
Mentions légalesConfidentialitéConditions d'utilisation
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

2 dépôts

Awesome GitHub RepositoriesCross-Model Behavioral Testing

Tools for verifying that server responses remain consistent and correct across different AI model implementations.

Distinct from Model Testing: Distinct from Model Testing: focuses on the interaction between a server and multiple models rather than the internal performance of a single model.

Explore 2 awesome GitHub repositories matching testing & quality assurance · Cross-Model Behavioral Testing. Refine with filters or upvote what's useful.

Awesome Cross-Model Behavioral Testing GitHub Repositories

Trouvez les meilleurs dépôts grâce à l'IA.Nous recherchons les dépôts les plus pertinents grâce à l'IA.
  • mcp-use/mcp-useAvatar de mcp-use

    mcp-use/mcp-use

    10,137Voir sur GitHub↗

    mcp-use is a development framework designed for building, deploying, and managing servers, clients, and autonomous agents using the Model Context Protocol. It provides a comprehensive toolkit for creating servers that expose custom tools, data resources, and prompts to compatible AI agents. The project distinguishes itself by offering a complete lifecycle for protocol-based applications, including a dedicated hosting platform for production servers and a compliance validator to ensure servers meet marketplace publishing requirements. It also features an observability suite for tracing protoco

    Enables browser-based testing of server responses against multiple AI models to ensure consistent behavior.

    TypeScriptagentic-frameworkaiapps-sdk
    Voir sur GitHub↗10,137
  • mrdbourke/zero-to-mastery-mlAvatar de mrdbourke

    mrdbourke/zero-to-mastery-ml

    5,839Voir sur GitHub↗

    Ce projet est un cursus éducatif en machine learning et une plateforme d'apprentissage délivrée via des Jupyter Notebooks interactifs. Il sert de guide complet pour maîtriser le toolkit de science des données Python, fournissant des tutoriels structurés pour le calcul numérique, la manipulation de données tabulaires et la visualisation statistique. Le cursus inclut des guides d'implémentation spécifiques pour Scikit-Learn et un cours pratique sur TensorFlow pour construire, entraîner et déployer des réseaux de neurones et des modèles de vision par ordinateur. Il couvre le processus de bout en bout de la construction de modèles prédictifs, de la formulation initiale du problème et de la catégorisation des tâches au déploiement des modèles via des interfaces web interactives. Le projet couvre une large surface de capacités incluant le calcul numérique avec des tableaux multidimensionnels, l'analyse exploratoire des données et les routines de prétraitement des données. Il fournit des flux de travail détaillés pour l'apprentissage supervisé et non supervisé, les pipelines de machine learning automatisés, l'optimisation des hyperparamètres et l'évaluation des modèles utilisant des métriques de classification et la validation croisée. Le contenu éducatif est organisé sous forme d'une série de notebooks qui entremêlent code Python et explications narratives pour documenter les flux de travail en science des données.

    Tests models across multiple different train-test splits to ensure performance is consistent and stable.

    Jupyter Notebookdata-sciencedeep-learningmachine-learning
    Voir sur GitHub↗5,839
  1. Home
  2. Testing & Quality Assurance
  3. Model Testing
  4. Cross-Model Behavioral Testing

Explorer les sous-tags

  • K-Fold Cross-ValidationA statistical method of evaluating model stability by partitioning data into multiple train-test splits. **Distinct from Cross-Model Behavioral Testing:** Focuses on the internal performance validation of a single model via splitting, not comparing different model implementations.