Comparison builder

default

afi / afi · cli / proxy / Default profile / OpenAI · gpt 5.6 sol high / afi 0.30.0

P50 across 3 scored trials

3 recorded; malformed and unscored trials remain inspectable but do not participate in aggregate metrics

Recall55%
Model-judged precisionN/A
Total bill$0.2368
Duration2m 51s

Per-metric distributions

Exact Type-7 percentiles over complete scored samples; partial scored samples remain unavailable; non-scored trials are disclosed below

Recall 3/3 scored trials measured
P50 55% P95 59.5%
Model-judged precision 0/3 scored trials measured
N/A no qualified judge decided these findings, so only locality was measured
N/A · 0 measured
Total bill 3/3 scored trials measured
P50 $0.2368 P95 $0.3209
Duration 3/3 scored trials measured
P50 2m 51s P95 4m 35s
MetricAvailabilityMeasuredMinP50P95Max
Findings
finding_count
Measured 3/3111111.912
Defects found
found
Measured 3/3111111.912
Defects missed
missed
Measured 3/38999
Unkeyed findings
unkeyed
Measured 3/30000
Intended findings
intended
Measured 3/30000
Recall
recall
Measured 3/355%55%59.5%60%
Model-judged precision
precision
N/A
no qualified judge decided these findings, so only locality was measured
0/3----
F1
f1
N/A
no qualified judge decided these findings, so only locality was measured
0/3----
Tier 1 recall
tier_1
Measured 3/3100%100%100%100%
Tier 2 recall
tier_2
Measured 3/342.9%42.9%55.7%57.1%
Tier 3 recall
tier_3
Measured 3/350%50%50%50%
Tier 4 recall
tier_4
Measured 3/350%50%50%50%
Security recall
category_security
Measured 3/350%50%50%50%
Defect recall
category_defect
Measured 3/361.5%69.2%76.2%76.9%
Maintainability recall
category_maintainability
Measured 3/30%0%0%0%
Performance recall
category_performance
Measured 3/333.3%33.3%63.3%66.7%
Median anchor distance
anchor_median
Measured 3/30000
Worst anchor distance
anchor_max
Measured 3/3002.69999999999999973
Refusals a judge overturned
anchor_missed
Not recorded
no judging pass has looked beyond the scored slack
0/3----
Review bill
review_bill
Measured 3/3$0.1998$0.2368$0.3209$0.3303
Judge bill
judge_bill
N/A
no qualified judge decided these findings, so only locality was measured
0/3----
Total bill
total_bill
Measured 3/3$0.1998$0.2368$0.3209$0.3303
Tokens
tokens
Measured 3/3143615741689.21702
Duration
seconds
Measured 3/32m 5s2m 51s4m 35s4m 47s
Carried findings
carried
Not recorded
the reviewer reported no reuse figure
0/3----

Compatibility identity

Any change to these inputs creates another group

Reviewer
afi
Reviewer tool
afi · cli
Subject
proxy
Reviewed SHA
9b51f95ef609a219e211e37b082cd2e6913190e0
Key fingerprint
bd331c0b144e
Settings fingerprint
89cd13e3b4e0
Configuration ID
config-323a87a9eb99b1e3
Build
afi 0.30.0 / b0f313c0b59a66ecc7612396dc8db0ea5da13a7a
Harness
bench 1 / 348a7e367b8c52f1ce72828ed09c15b0e9fac38b dirty
Adapter
afi 1 / sha256:a1a935298956020ee6d767a756847abb4c00694c88c2eb80d454886ebc4acf8c
Build ID
build-13a6e5be87bc4a53
Cohort ID
cohort-fdab2adfb8a4bd39
Comparison ID
comparison-004ca4a8ec71f5cd

Trials

Select View evidence to inspect one run; the static table is paginated at 100 trials

Details
afi
afi · cli
default Default profile · OpenAI · gpt 5.6 sol high
proxy55%N/A11 scoredView evidence
afi
afi · cli
default Default profile · OpenAI · gpt 5.6 sol high
proxy55%N/A11 scoredView evidence
afi
afi · cli
default Default profile · OpenAI · gpt 5.6 sol high
proxy60%N/A12 scoredView evidence
benchee benchee-dashboard-1 built from 10f4ec58 Static benchmark evidence ·