Which AI models handle my work
Public AI leaderboards test other people's tasks. These are mine: find and sort information, write code, read a document or a scan, pick the right skill, do agency work. I keep the tasks private and the results open. Every run is dated, so you can see models change.
How I testProject on hold
On 2026-09-26 I paused the benchmark. On simple tasks strong models solve almost everything, and a fair benchmark on tasks from my real work is a big project of its own. I may come back to it later. Below is what I managed to measure.
Plans and code on GitHub →2026-09-26 — three runs on 29 simple tasks: each company's main models; the same models at every effort level; the rest, including the strongest (Fable, Astra) and free ones. Strong models solve almost everything, only small ones fall behind. Gemini sometimes reaches for the terminal, its program forbids it and returns no answer — those tasks are not counted; their number is shown under the model.
Ranking
How many tasks each model solved out of those it got. There are only 29 tasks so far — a gap of one or two tasks between models may still be chance.
- Anthropic
- OpenAI
- OpenCode free
- Claude Opus 5.5Anthropic · effort: medium · isolation: strict · 2026-09-2629 of 29100%Tokens: read / written5,482 / 127Time per task5 sWould cost via API$0.5525
- Claude Sonnet 5Anthropic · effort: low · isolation: strict · 2026-09-2629 of 29100%Tokens: read / written5,549 / 147Time per task5 sWould cost via API$0.2891
- Claude Sonnet 5Anthropic · effort: max · isolation: strict · 2026-09-2629 of 29100%Tokens: read / written5,549 / 912Time per task11 sWould cost via API$0.5109
- Claude Sonnet 5Anthropic · effort: extra high · isolation: strict · 2026-09-2629 of 29100%Tokens: read / written5,549 / 304Time per task5 sWould cost via API$0.3344
- GPT-6 SolOpenAI · effort: max · isolation: sandbox · 2026-09-2629 of 29100%Tokens: read / written16,435 / 143Time per task9 sWould cost via API$0.3801
- Gemini 3.1 ProGoogle · effort: high · isolation: partial · 2026-09-26no answer — blocked by its own program: 11 · not supported by the program: 117 of 17100%Tokens: read / written7,264 / 1,167Time per task15 sWould cost via API$0.5205
- Gemini 3.8 FlashGoogle · effort: high · isolation: partial · 2026-09-26no answer — blocked by its own program: 11 · not supported by the program: 117 of 17100%Tokens: read / written17,707 / 1,417Time per task11 sWould cost via API$0.5096
- Claude Sonnet 5Anthropic · effort: medium · isolation: strict · 2026-09-2628 of 2997%Tokens: read / written5,549 / 145Time per task4 sWould cost via API$0.2883
- Claude Sonnet 5Anthropic · effort: high · isolation: strict · 2026-09-2628 of 2997%Tokens: read / written5,549 / 209Time per task6 sWould cost via API$0.3071
- GPT-5.6 SolOpenAI · effort: medium · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written15,858 / 60Time per task9 sWould cost via APIno data
- GPT-6 AstraOpenAI · effort: medium · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written16,884 / 48Time per task9 sWould cost via API$1.7915
- GPT-6 SolOpenAI · effort: medium · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written17,062 / 116Time per task9 sWould cost via API$0.3800
- GPT-6 SolOpenAI · effort: high · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written16,439 / 112Time per task10 sWould cost via API$0.3712
- GPT-6 SolOpenAI · effort: low · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written16,920 / 59Time per task8 sWould cost via API$0.3592
- GPT-6 SolOpenAI · effort: ultra · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written16,481 / 149Time per task10 sWould cost via API$0.3845
- GPT-6 SolOpenAI · effort: extra high · isolation: sandbox · 2026-09-2628 of 2997%Tokens: read / written16,434 / 126Time per task9 sWould cost via API$0.3749
- MiMo v2.6 FlashOpenCode free · isolation: sandbox · 2026-09-26not supported by the program: 127 of 2896%Tokens: read / written9,474 / 72Time per task14 sWould cost via APIfree
- Gemini 3.8 FlashGoogle · effort: low · isolation: partial · 2026-09-26no answer — blocked by its own program: 8 · not supported by the program: 119 of 2095%Tokens: read / written17,853 / 217Time per task8 sWould cost via API$0.3977
- Gemini 3.8 FlashGoogle · effort: medium · isolation: partial · 2026-09-26no answer — blocked by its own program: 10 · not supported by the program: 117 of 1894%Tokens: read / written16,806 / 731Time per task9 sWould cost via API$0.4297
- Claude Fable 5.1Anthropic · effort: medium · isolation: strict · 2026-09-2627 of 2993%Tokens: read / written7,341 / 122Time per task5 sWould cost via API$1.3949
- GPT-6 LunaOpenAI · effort: medium · isolation: sandbox · 2026-09-2626 of 2990%Tokens: read / written16,256 / 49Time per task9 sWould cost via API$0.0191
- Muse Spark 1.3OpenCode free · isolation: sandbox · 2026-09-26not supported by the program: 124 of 2886%Tokens: read / written11,306 / 83Time per task11 sWould cost via APIfree
- Claude Haiku 4.5Anthropic · isolation: strict · 2026-09-2622 of 2976%Tokens: read / written7,005 / 1,009Time per task11 sWould cost via API$0.3494
- Big PickleOpenCode free · isolation: sandbox · 2026-09-26not supported by the program: 113 of 2846%Tokens: read / written10,900 / 107Time per task7 sWould cost via APIfree
- Nemotron 3 UltraOpenCode free · isolation: sandbox · 2026-09-26not supported by the program: 113 of 2846%Tokens: read / written10,591 / 96Time per task10 sWould cost via APIfree
Every model gets the same tasks, a few hundred tokens each. The difference in “read” is the instructions each program adds on its own: Claude in strict mode about 2k tokens, OpenCode about 8k, Codex and Antigravity about 14k. Time and tokens are averages per task. The price uses API rates on the run date; subscriptions don't charge this.
Who solved what
Each model on each task in the latest run. ✓ solved, ✗ not solved, empty — not given.
| ask-01 | ask-02 | calc-01 | calc-02 | cli-flags-01 | code-review-01 | contract-defects-01 | longctx-32k | longctx-8k | report-error-01 | research-notfound-01 | research-synth-01 | sandbox-hole-01 | scan-card-uz-latn-l1 | scan-invoice-en-l0 | scan-invoice-en-l2 | scan-invoice-en-l3 | scan-invoice-ru-l0 | scan-invoice-ru-l2 | scan-invoice-ru-l3 | scan-invoice-uz-cyrl-l0 | scan-invoice-uz-cyrl-l2 | scan-invoice-uz-cyrl-l3 | scan-invoice-uz-latn-l0 | scan-invoice-uz-latn-l2 | scan-invoice-uz-latn-l3 | scan-payment-ru-stamp | skill-route-01 | skill-route-20 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| Claude Sonnet 5 | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| Claude Sonnet 5 | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| Claude Sonnet 5 | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Sol | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| Gemini 3.1 Pro | solved | solved | solved | solved | solved | solved | solved | not given | solved | solved | solved | solved | solved | not given | solved | not given | solved | not given | not given | not given | not given | not given | not given | not given | not given | not given | solved | solved | solved |
| Gemini 3.8 Flash | solved | solved | solved | not given | solved | solved | not given | not given | solved | solved | solved | solved | solved | not given | not given | solved | not given | not given | not given | not given | not given | solved | solved | not given | solved | not given | solved | solved | solved |
| Claude Sonnet 5 | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| Claude Sonnet 5 | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-5.6 Sol | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Astra | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Sol | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Sol | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Sol | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Sol | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Sol | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| MiMo v2.6 Flash | solved | solved | solved | solved | solved | solved | not solved | not given | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| Gemini 3.8 Flash | solved | solved | solved | not given | solved | solved | not solved | not given | solved | solved | solved | solved | solved | solved | not given | solved | not given | not given | solved | solved | not given | solved | not given | solved | not given | not given | solved | solved | solved |
| Gemini 3.8 Flash | solved | solved | solved | not given | solved | solved | not solved | not given | solved | solved | solved | solved | solved | solved | solved | not given | not given | solved | not given | solved | not given | not given | not given | solved | not given | not given | not given | solved | solved |
| Claude Fable 5.1 | solved | solved | solved | not solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved |
| GPT-6 Luna | solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | not solved | solved | solved | not solved | solved | solved | solved |
| Muse Spark 1.3 | solved | solved | solved | solved | solved | solved | not solved | not given | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | solved | not solved | not solved | solved | solved | not solved | solved | solved | solved |
| Claude Haiku 4.5 | not solved | solved | solved | not solved | solved | solved | not solved | solved | solved | solved | solved | solved | not solved | solved | solved | solved | solved | solved | solved | not solved | not solved | not solved | solved | solved | solved | solved | solved | solved | solved |
| Big Pickle | solved | solved | solved | solved | solved | solved | not solved | not given | solved | solved | solved | not solved | solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | solved | not solved | not solved | not solved | solved | solved |
| Nemotron 3 Ultra | not solved | solved | solved | solved | solved | solved | solved | not given | solved | solved | solved | solved | solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | not solved | solved | solved |
Do models get dumber
Every week and after major updates I give the models the same tasks again. One bad day is chance. If a model fails several runs in a row, it really got worse.
The chart appears after the second run: so far everything was measured on one day.
How I test
Own tasks, kept private
I don't publish tasks or correct answers. Otherwise they end up in model training and the test stops testing anything.
A program checks
Numbers, fields and files are compared to the correct answer automatically. A model saying “done” doesn't count.
Sometimes the right move is not to act
Some tasks lack data. The correct answer there is to ask, not to guess.
Only what was measured
Tasks solved, tokens and time spent. No forecasts or estimated ranges: there are few tasks so far, so draw conclusions carefully.
Every task from scratch
A new session with no memory and none of my settings. How strictly the model is fenced off from the rest of the computer is shown next to the result.
Tokens, time, price
How much text the model read and wrote, how long it took, and what it would cost at API rates on the run date.