Report by Forescout
AI Security Testing: Agents Leap from Assistants to Autonomous Hackers
4 FINDINGSPublished Apr 14, 2026
View Original Report →Key Findings
A year ago, 55% of AI models failed basic vulnerability research and 93% failed exploit development tasks
Vulnerability ResearchExploit DevelopmentAI SecurityAI Models
Every model produced at least one false-positive run by hallucinating vulnerable paths in the OpenNDS real-world task
False PositivesVulnerability ResearchOpenNDS
All tested AI models now complete vulnerability research tasks, and 50% generate working exploits autonomously
Vulnerability ResearchExploit DevelopmentAI SecurityAI Models
Claude Opus 4.6 identified exploitable RCE vulnerabilities in 3 of 5 runs.
Vulnerability ResearchClaude OpusRCE VulnerabilitiesExploitable Vulnerabilities