SEC-02ClaimBench Evaluation Suite
The industry benchmark for insurance AI
260+ held-out, contamination-controlled tasks. Every score below is reproducible against the public ClaimBench harness — refreshed quarterly.
Harness v2.4 liveEval latency < 42msLeakage detected: 01,208 runs this quarter
#ModelFNOL ExtractionFraud DetectionSeverity GradingPolicy ReasoningOverall
01
Claude 3.7 Sonnet
Anthropic
94.1FNOL Extraction
87.2Fraud Detection
89.2Severity Grading
91.5Policy Reasoning
91.2+1.4
02
GPT-5
OpenAI
93.6FNOL Extraction
85.1Fraud Detection
88.7Severity Grading
92.1Policy Reasoning
90.6+0.8
03
Gemini 2.5 Pro
Google DeepMind
92.8FNOL Extraction
83.4Fraud Detection
87.9Severity Grading
90.4Policy Reasoning
89.4
04
DeepSeek R1
DeepSeek
90.2FNOL Extraction
81.3Fraud Detection
85.6Severity Grading
88.9Policy Reasoning
87.1
05
Llama 3.3 405B
Meta
88.4FNOL Extraction
76.2Fraud Detection
83.1Severity Grading
85.7Policy Reasoning
84.6
06
Mistral Large 3
Mistral AI
86.9FNOL Extraction
72.5Fraud Detection
81.4Severity Grading
83.2Policy Reasoning
82.3
Held-out tasks · contamination-controlled · Q3 2026 refreshSubmit your model →
Contact Sales
Talk to our data team
Tell us about your models and the claims data you need. We respond to every serious inquiry within one business day.
- Dataset samples shared under NDA within 48 hours
- Enterprise licensing with on-prem or VPC delivery
- Custom generation scoped by our solutions engineers