awesome-repositories.com
Blog
MCP
awesome-repositories.com

Descubre los mejores repositorios open-source con nuestra búsqueda potenciada por IA.

ExplorarBúsquedas curadasAlternativas open-sourceSoftware autohospedableBlogMapa del sitio
ProyectoServidor MCPAcerca deCómo clasificamosPrensa
Aviso legalPrivacidadTérminos
© 2026 Bringes Technology SRL·VAT RO45896025·hello@awesome-repositories.com
·

5 repositorios

Awesome GitHub RepositoriesModel Behavior Evaluation

Executing pre-trained models within environments to qualitatively and quantitatively analyze their behavior.

Distinct from Pre-trained Model Application: Focuses on behavioral observation in an environment rather than applying a model to a downstream NLP task.

Explore 5 awesome GitHub repositories matching artificial intelligence & ml · Model Behavior Evaluation. Refine with filters or upvote what's useful.

Awesome Model Behavior Evaluation GitHub Repositories

Encuentra los mejores repositorios con IA.Buscaremos los repositorios que mejor coincidan usando IA.
  • vwxyzjn/cleanrlAvatar de vwxyzjn

    vwxyzjn/cleanrl

    9,127Ver en GitHub↗

    CleanRL is a reinforcement learning library and PyTorch framework providing a suite of reproducible implementations for online reinforcement learning algorithms. It serves as a deep reinforcement learning benchmark suite and experiment orchestrator designed for research and agent development across both discrete and continuous action spaces. The project is distinguished by its single-file algorithm implementation approach, which encapsulates each algorithm in a standalone script to eliminate complex class hierarchies. This structure is paired with a system for scheduling and executing large-s

    Enables loading pre-trained models from remote hubs and executing them within simulations to observe agent behavior.

    Pythona2cactor-criticadvantage-actor-critic
    Ver en GitHub↗9,127
  • arize-ai/phoenixAvatar de Arize-ai

    Arize-ai/phoenix

    8,605Ver en GitHub↗

    Arize Phoenix is an LLM observability platform and evaluation framework designed to capture execution traces and monitor large language model applications. It serves as a prompt management system for versioning and testing templates, and as a self-hosted AI operations infrastructure for managing telemetry and experiments. The platform differentiates itself through a specialized embedding visualization tool used to detect data drift and optimize vector search. It provides a comprehensive evaluation suite that utilizes judge-based evaluators and ground-truth datasets to score model outputs, and

    Assesses response quality and tool usage to detect hallucinations and validate model behavior.

    Jupyter Notebookagentsai-monitoringai-observability
    Ver en GitHub↗8,605
  • deepmind/labAvatar de deepmind

    deepmind/lab

    7,365Ver en GitHub↗

    Lab is a customizable 3D platform and research testbed designed for training and testing autonomous agents using reinforcement learning. It serves as a spatial AI training simulator where agents can be evaluated through navigation and puzzle-solving tasks. The environment allows for the definition of complex layouts and task behaviors through external scripting, enabling the generation of specific challenges for AI research. It supports both automated training via standard API bindings and manual agent control to validate simulation dynamics. The system utilizes a grid-based spatial represen

    Evaluates trained models in real time through automated navigation tasks and manual control.

    C
    Ver en GitHub↗7,365
  • trigaten/learn_promptingAvatar de trigaten

    trigaten/Learn_Prompting

    4,709Ver en GitHub↗

    Learn_Prompting es un proyecto educativo centrado en la ingeniería de prompts, que proporciona los principios y técnicas necesarios para elaborar entradas efectivas y mejorar la calidad de las salidas de la IA generativa. El proyecto cubre estrategias avanzadas de prompting para mejorar el razonamiento, la fiabilidad y la calidad de la salida. Esto incluye técnicas para la descomposición de tareas, razonamiento de cadena de pensamiento (chain-of-thought) y el uso de guías few-shot y zero-shot. También aborda la seguridad del modelo mediante el estudio de prompt hacking, análisis de vulnerabilidades y auditorías de privacidad para prevenir fugas de datos sensibles. El alcance se extiende a la aplicación práctica de la IA generativa en diversos medios y flujos de trabajo, incluyendo generación de texto, creación de imágenes fotorrealistas y producción audiovisual. Además, cubre el desarrollo de agentes autónomos, programación asistida por IA y la automatización de flujos de trabajo empresariales para marketing y comunicaciones. El proyecto proporciona recursos para la optimización de modelos, evaluación y gestión de ciclos de vida de prompts dentro de un entorno de experimentación interactivo.

    Analyzes the relationship between inputs and outputs to diagnose and evaluate model alignment issues.

    MDXchatgptchatgpt-apideep-learning
    Ver en GitHub↗4,709
  • microsoft/phicookbookAvatar de microsoft

    microsoft/PhiCookBook

    3,755Ver en GitHub↗

    PhiCookBook is a technical guide and implementation framework for integrating small language models into applications. It provides instructions for deploying these lightweight models to perform reasoning, coding, and math tasks across various hardware environments and serving platforms. The project functions as a tutorial for developing intelligent AI applications by chaining prompts and code into executable sequences. It includes a framework for evaluating model behavior and calculating quality metrics to verify the accuracy and reliability of these workflows. The repository covers a broad

    Enables qualitative and quantitative analysis of model behavior using interactive playgrounds across various platforms.

    Jupyter Notebookcookbooklanguage-modelphi-4
    Ver en GitHub↗3,755
  1. Home
  2. Artificial Intelligence & ML
  3. Pre-trained Model Application
  4. Model Behavior Evaluation