No run loaded
Task Classification
—
load a test run
Complexity Scoring
—
load a test run
Provider Routing
—
load a test run
Test Cost
—
load a test run
Failures
Load a test run to see failures
Model Distribution
No data
All Results
| Prompt | Tag | Exp Task | Got Task | T | Exp Cmplx | Got Cmplx | C | Model | Exp Prov | P |
|---|---|---|---|---|---|---|---|---|---|---|
| Load a test run | ||||||||||
Accuracy by Tag
load a run
—
Provider Routing Results
| Prompt | Tag | Expected Provider | Actual Model | Result |
|---|---|---|---|---|
| No provider tests | ||||
Total Tokens
—
—
Total Cost
—
—
Requests
—
—
Model Usage
No data
Per-Request Cost
| Prompt | Model | Tokens | Cost | Tag |
|---|---|---|---|---|
| No data | ||||
Test Runs
Loading...
Task
—
Complexity
—
Provider
—
Cost
—
Failures
Select a run
All Results
| Prompt | Tag | Exp Task | Got Task | T | Exp Cmplx | Got Cmplx | C | Model | Cost |
|---|---|---|---|---|---|---|---|---|---|
| Select a run | |||||||||
Model Comparison
Loading comparison data...
Per-Prompt Comparison
| Prompt | Task | Cmplx | Haiku Cost | Haiku Score | Sonnet Cost | Sonnet Score | Routed Model | Routed Cost | Routed Score | Winner | Human ✓ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| No comparison data | |||||||||||
Configure & Run Routing Test
Simple prompts
30
Medium prompts
7
Complex prompts
10
Est. ~3 min for 45 requests
Waiting to start...
Tag Routing Test (10 cases)
Tests provider filtering — anthropic, bedrock, private, negation tags
Waiting to start...