Report by Forescout

AI Security Testing: Agents Leap from Assistants to Autonomous Hackers

4 FINDINGSPublished Apr 14, 2026
View Original Report →

Key Findings

A year ago, 55% of AI models failed basic vulnerability research and 93% failed exploit development tasks

Vulnerability ResearchExploit DevelopmentAI SecurityAI Models

Every model produced at least one false-positive run by hallucinating vulnerable paths in the OpenNDS real-world task

False PositivesVulnerability ResearchOpenNDS

All tested AI models now complete vulnerability research tasks, and 50% generate working exploits autonomously

Vulnerability ResearchExploit DevelopmentAI SecurityAI Models

Claude Opus 4.6 identified exploitable RCE vulnerabilities in 3 of 5 runs.

Vulnerability ResearchClaude OpusRCE VulnerabilitiesExploitable Vulnerabilities