Skip to main content
Ryan Orban

Ryan Orban

Subject
1 entry

Red Teaming

Bookmarks

  1. Agent-Honeypot: LLM vs. LLM Adversarial Testing

    Agent-Honeypot is an automated red-teaming platform where an attacker LLM generates adversarial prompts against a defender LLM — testing alignment safeguards via authority claims, emergency framing, and incremental requests. A systematic way to stress-test LLM safety before deployment.

All bookmarks