Integrity

Coverage

  • 603 logical evidence files
  • 54 compatible groups
  • 30 problems

Subject readiness, tier recall, and exporter problems; missing values never become zero

Answer-key coverage

Every run-referenced subject remains visible, including subjects with no scored trial

SubjectTier countsDefectsRunsAction
feat(proxy): reclaim space from the blob storeT1 3 / T2 7 / T3 6 / T4 42074Inspect subject

Tier recall matrix

Each row is one cohort, reviewer, configuration, and build; values are exporter medians within that row

Recall by discovery tier Higher recall uses a stronger tint; exact values and unavailable states remain visible
Subject / compatible group
Tier 1
Tier 2
Tier 3
Tier 4
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
0%
14.3%
16.7%
25%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
66.7%
28.6%
33.3%
25%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
0%
0%
0%
0%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
100%
0%
33.3%
0%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 2 scored / 2 recorded
33.3%
28.6%
16.7%
50%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
0%
0%
0%
0%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 3 scored / 3 recorded
66.7%
28.6%
33.3%
50%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
66.7%
42.9%
50%
50%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
33.3%
28.6%
50%
50%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 2 scored / 2 recorded
33.3%
28.6%
50%
25%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 3 scored / 3 recorded
33.3%
42.9%
50%
50%
proxy default
Reviewer afi · Tool afi · cli · Build afi 0.30.0 · 1 scored / 1 recorded
0%
14.3%
50%
50%
ReviewerSubjectConfigurationBuildScored / recordedTier 1Tier 2Tier 3Tier 4
afi
afi · cli
proxydefault Default profile · Z.AI · glm 5.2 highafi 0.30.01/10%14.3%16.7%25%
afi
afi · cli
proxydefault Default profile · Moonshot AI · kimi k3 highafi 0.30.01/166.7%28.6%33.3%25%
afi
afi · cli
proxydefault Default profile · Z.AI · glm 5.3 highafi 0.30.01/10%0%0%0%
afi
afi · cli
proxydefault Default profile · DeepSeek · v4 pro highafi 0.30.01/1100%0%33.3%0%
afi
afi · cli
proxydefault Default profile · OpenAI · gpt 5.6 terra highafi 0.30.02/233.3%28.6%16.7%50%
afi
afi · cli
proxydefault Default profile · DeepSeek · v4 flash highafi 0.30.01/10%0%0%0%
afi
afi · cli
proxydefault Default profile · OpenAI · gpt 5.6 luna highafi 0.30.03/366.7%28.6%33.3%50%
afi
afi · cli
proxydefault Default profile · Anthropic · fable 5 highafi 0.30.01/166.7%42.9%50%50%
afi
afi · cli
proxydefault Default profile · Z.AI · glm 5.3 flash highafi 0.30.01/133.3%28.6%50%50%
afi
afi · cli
proxydefault Default profile · Z.AI · glm 5.3 flash highafi 0.30.02/233.3%28.6%50%25%
afi
afi · cli
proxydefault Default profile · Z.AI · glm 5.3 flash highafi 0.30.03/333.3%42.9%50%50%
afi
afi · cli
proxydefault Default profile · Z.AI · glm 5.3 flash highafi 0.30.01/10%14.3%50%50%
All 54 comparison groups
benchee benchee-dashboard-1 built from 10f4ec58 Static benchmark evidence ·