Subject
1 entry
Red Teaming
Bookmarks
Agent-Honeypot: LLM vs. LLM Adversarial Testing
Agent-Honeypot is an automated red-teaming platform where an attacker LLM generates adversarial prompts against a defender LLM — testing alignment safeguards via authority claims, emergency framing, and incremental requests. A systematic way to stress-test LLM safety before deployment.
