14 dépôts
Creation of edge-case and adversarial inputs to stress-test AI models for safety and brand risks.
Distinct from Adversarial Robustness Testing: Focuses specifically on the generation of inputs for AI model testing rather than general network or security vulnerability research.
Explore 14 awesome GitHub repositories matching security & cryptography · Adversarial Input Generation. Refine with filters or upvote what's useful.
Evidently is an AI observability platform and evaluation framework designed to quantify the performance of machine learning models and large language models. It functions as a monitoring tool for detecting data drift and quality degradation in tabular datasets, while providing a specialized analyzer for the faithfulness and correctness of retrieval augmented generation systems. The project distinguishes itself through an evaluation framework that utilizes judge models and custom rubrics to score language model outputs. It includes tools for iterative prompt optimization and the generation of
Generates adversarial inputs and edge-case scenarios to perform safety evaluations and brand risk stress-testing on AI models.
Superagent is an AI safety platform that protects applications from prompt injections, data leaks, and harmful outputs through built-in guardrails. It functions as a prompt injection detection system, data redaction tool, and red team testing tool, automatically removing personally identifiable information and protected health data from AI inputs and outputs while scanning image uploads with vision AI to detect visual prompt injection attacks before processing. The platform routes every prompt through a sequential pipeline of safety checks including injection detection, data redaction, and co
Detects and blocks prompt injection attacks, jailbreaks, and malicious instructions before they reach the language model.
NeMo-Guardrails is a toolkit for adding programmable safety constraints and dialogue boundaries to large language model conversational systems. It functions as security middleware that intercepts inputs and outputs to block prompt injections, jailbreaks, and sensitive data leaks, while providing a conversational dialogue manager to define structured interaction flows through configuration files. The framework includes a hallucination filter to screen model outputs for factual accuracy and a specialized modeling language for defining conversational flows and constraints. It provides capabiliti
Protects models from jailbreak attempts and malicious instructions using input inspection.
Cleverhans est une bibliothèque de machine learning adversarial pour TensorFlow qui sert de framework d'attaque, de benchmark de robustesse et de bibliothèque de défense. Elle fournit une collection d'outils pour générer des exemples adversariaux, tester la sécurité des réseaux de neurones et implémenter des mécanismes de protection pour accroître la résilience des modèles face aux entrées malveillantes. Le projet se concentre sur la création d'entrées perturbées conçues pour tromper les modèles de machine learning afin qu'ils produisent des prédictions incorrectes. Il permet l'évaluation de la stabilité et de la précision des modèles de deep learning lorsqu'ils sont soumis à du bruit adversarial, en fournissant des implémentations de référence d'attaques connues pour identifier les failles de sécurité. Le toolkit couvre la génération d'exemples adversariaux, la défense des modèles de machine learning et le benchmarking de robustesse des réseaux de neurones. Il utilise une interface agnostique au modèle et des implémentations d'attaques différentiables pour exécuter des perturbations basées sur le gradient et des boucles d'optimisation itératives.
Generates malicious input perturbations using reference methods to deceive machine learning models.
The Adversarial Robustness Toolbox (ART) is an open-source library that provides a unified framework for evaluating, defending, and certifying machine learning models against adversarial threats. It wraps models from any framework behind a common estimator interface, enabling composable pipelines for attack generation, defense application, robustness certification, and privacy auditing across evasion, poisoning, and extraction threats. The library distinguishes itself by covering the full adversarial ML security lifecycle within a single toolkit. It supports gradient-based adversarial example
Analyzes inputs and activations to flag samples crafted to deceive the model.
Helicone is an AI gateway and observability platform designed to intercept, manage, and monitor interactions with large language models. By acting as a reverse-proxy, it provides a centralized layer for routing requests across multiple AI providers, allowing developers to maintain consistent application logic while gaining deep visibility into model performance, usage, and costs. The platform distinguishes itself through a robust suite of traffic management and prompt engineering tools. It enables policy-driven control, including automatic failover between providers, rate limiting, and edge-b
Analyzes user messages to identify jailbreak attempts and malicious instructions across multiple languages and blocks the request.
Giskard est un framework d'évaluation, une bibliothèque de test et un système de monitoring de qualité pour les grands modèles de langage (LLM) et les agents IA. Il sert de boîte à outils pour quantifier la performance et la fiabilité des modèles, offrant des capacités spécialisées pour valider les pipelines de génération augmentée par récupération (RAG). Le projet se distingue par un outil de red teaming automatisé et un scanner de sécurité conçu pour identifier les vulnérabilités, les injections de prompts et les risques de sécurité. Il utilise le probing contradictoire et la génération synthétique de cas limites pour quantifier la robustesse du modèle et détecter les fuites d'informations. La plateforme couvre un large éventail de capacités, incluant la détection d'hallucinations et la vérification de l'exactitude factuelle, le benchmarking de la logique et du raisonnement, ainsi que la détection de biais. Elle fournit des outils pour les tests de régression, l'évaluation des composants RAG et la génération automatisée de cas de test à partir de bases de connaissances. Le système inclut des fonctionnalités de gestion pour les espaces de travail collaboratifs, le contrôle d'accès basé sur les rôles et des pipelines d'évaluation planifiés pour surveiller la dérive des performances au fil du temps.
Generates synthetic edge cases and adversarial inputs to stress-test model resilience and robustness.
Ce projet est une ressource éducative complète et un manuel technique axé sur le machine learning interprétable et l'IA explicable. Il sert de manuel et de référence pour implémenter des techniques qui rendent les modèles de machine learning complexes transparents et compréhensibles pour les humains. La ressource fournit des conseils à la fois sur la construction de modèles intrinsèquement transparents, tels que les arbres de décision et les modèles linéaires creux, et sur l'application de méthodes d'explication post-hoc aux systèmes boîte noire. Elle détaille des méthodologies spécifiques pour quantifier l'importance des caractéristiques, générer des justifications pour les prédictions individuelles et utiliser des modèles de substitution pour approximer des processus de prise de décision complexes. Le contenu couvre un large éventail de capacités analytiques, notamment l'analyse de l'influence des caractéristiques globales et locales, l'interprétabilité de la vision par ordinateur et l'utilisation de contributions issues de la théorie des jeux comme les valeurs de Shapley. Il aborde également l'évaluation des modèles via des évaluations d'interprétabilité, des flux de travail de débogage pour identifier les raccourcis des modèles et la conception de structures d'algorithmes transparentes. Le projet est implémenté sous forme d'une collection de Jupyter Notebooks.
Generates adversarial inputs to stress-test AI models and identify vulnerabilities in their decision logic.
The agent-governance-toolkit is a framework for enforcing security policies, managing zero-trust identities, and sandboxing the execution of autonomous AI agents. It provides a governance layer designed to control the behavior of agents through the use of a security policy engine, cryptographic identity management, and a runtime execution sandbox. The project distinguishes itself through a multi-tier privilege ring system and a cryptographic identity mesh that secures communication between autonomous entities. It implements a decay-based trust scoring mechanism to track entity reliability and
Uses a multi-vector evaluation system to detect and block prompt injection and jailbreak attempts.
This repository provides tools and methodologies for studying adversarial attacks on large language models. It focuses on understanding how carefully crafted inputs can manipulate or bypass the safety mechanisms of LLMs, enabling researchers to probe model vulnerabilities and improve their robustness. The project covers techniques for generating adversarial prompts, evaluating model responses under attack conditions, and analyzing the effectiveness of different attack strategies.
Generates gradient-based adversarial inputs to stress-test AI model safety alignments.
Mimic is a unicode homoglyph generator and text obfuscation tool. It functions as a character substitutor that replaces standard ASCII characters with visually similar Unicode symbols to create text that appears correct to humans but is functionally different. The project is used for source code obfuscation by inserting subtle syntax errors into code to hide intent or break automated analysis. It also serves as a tool for textual adversarial testing to evaluate the resilience of software filters against maliciously crafted input. The utility achieves these results through a mapping system th
Generates maliciously crafted input using Unicode substitutions to test the resilience of software filters.
PyRIT is an AI vulnerability assessment tool and security scanner designed to detect risks in large language model applications. It functions as a generative AI red teaming framework used to simulate adversarial attacks and identify weaknesses in system guardrails. The tool automates AI risk assessment by scanning generative AI components for security vulnerabilities. It utilizes automated testing and analysis to identify security gaps and prevent potential exploits through a consistent, repeatable process. The system incorporates asynchronous model orchestration to compare security postures
Generates adversarial inputs through iterative prompt refinement to bypass safety filters.
Identifies jailbreak attempts and prompt injections in real time to prevent unauthorized model behavior.
LLM Guard is a security firewall and guardrail framework designed to scan and sanitize inputs and outputs for large language models. It functions as a proxy gateway and security layer to block prompt injections, toxicity, and sensitive data leakage while ensuring that model interactions remain compliant with organizational policies. The system distinguishes itself through a modular scanner pipeline that utilizes local model orchestration to eliminate external network dependencies. It supports real-time security filtering via streaming chunk analysis and implements a fail-fast execution model
Detects and blocks prompt injection and jailbreak attempts to prevent malicious hijacking of model behavior.