Skip to content
Dashboard

AI model leaderboards

See top models, labs, apps, and providers on AI Gateway with token, request, and cost trends.

DeepsecBench

DeepsecBench measures how well different AI models find security vulnerabilities in application code, based on the deepsec cyber harness(opens in new tab). The report combines recall and precision into a single benchmark score.

OpenAI
Anthropic
Moonshot AI
xAI
Google
Z.ai
Thinking Machines

Score vs Cost

010203040$0$50$100$150Cost (USD)Score

Score vs Total Time

0102030400h1h2h3h4hTotal timeScore

Ranked results

1
35.58
30.7%96.3%71/2313$55.983h 39m2.3Mcodex
2
32.57
28.1%88.0%65/23110$127.932h 34m4.5Mclaude
3
28.36
24.7%70.5%57/23126$31.9647m 1s999.7Kclaude
4
26.79
22.9%81.2%53/23113$24.593h 1m3.3Mcodex
5
25.10
21.2%94.3%49/2313$17.9530m 52s703.0Kcodex
6
21.20
17.7%95.5%41/2312$43.422h 22m2.2Mcodex
7
19.21
16.0%95.3%37/2312$27.811h 45m2.1Mcodex
8
17.56
14.7%77.1%34/23111$12.381h 59m731.9Kpi
9
16.54
13.9%73.3%32/23112$11.041h 37m909.6Kpi
10
15.58
13.0%77.8%30/23110$5.601h 24m1.0Mpi
11
12.63
10.4%92.3%24/2312$14.9424m 5s751.4Kcodex
12
12.12
10.0%92.0%23/2312$5.1513m 15s617.7Kcodex
13
12.08
10.0%82.8%23/2315$5.2311m 59s572.0Kcodex
14
11.56
9.5%80.0%22/2316$10.7426m 21s2.7Mpi
15
11.48
9.5%64.1%22/23114$10.841h 29m676.6Kpi
16
10.46
8.7%62.5%20/23112$11.091h 3m1.5Mpi
17
9.90
8.2%53.8%19/23118$51.842h 30m4.7Mpi
18
8.99
7.4%77.3%17/2315$5.3322m 18s1.8Mpi
19
6.91
5.6%81.3%13/2313$7.5619m 29s80.8Kclaude
20
6.88
5.6%61.9%13/2318$10.8118m 16s78.1Kclaude
21
6.32
5.2%48.0%12/23113$1.9311m 34s300.9Kpi
22
5.26
4.3%37.0%10/23117$2.1810m 31s509.0Kpi
23
4.73
3.9%33.3%9/23118$5.9129m 40s912.4Kclaude
24
2.14
1.7%44.4%4/2315$0.581m 46s459.9Kpi
25
1.07
0.9%28.6%2/2315$0.181m 7s406.5Kpi