Collinear AI Launches CWE-bench to Test Frontier Coding Agents on Defensive Cybersecurity Capabilities
Held-out cybersecurity benchmark spans 54 weakness types; the leading agent passes less than 50% of tasks, and 18 remain unsolved. Collinear AI has launched CWE-bench,...

