Measure cost per success, not per call.
The cheapest model per request can be the most expensive per result, once you count failures, retries and human clean-up.
Total AI + human cost ÷ Successful outcomes
The Real Cost
Model choice
Bigger models cost more per call and may fail less.
Context length
Long prompts and documents add up quickly.
Retries and failures
Every failed attempt is paid for.
Human review time
Often the biggest cost of all.
Cheap per call can be expensive per result.