← older: suite__qwen3.6-35b-a3b__20260724-160500all runs · task boardnewer: smoke__qwen3.6-35b-a3b__20260726-025257

smoke__qwen3.6-35b-a3b__20260726-002616

No notes for this run yet. Add runs/smoke__qwen3.6-35b-a3b__20260726-002616/NOTES.md — what was run & what changed, results, interpretation, next steps — and it will render here.

Run details

modelllama-local/qwen3.6-35b-a3bagentharnesses.minimal_pi:MinimalPithinkingonreasoning budgetdirect (server/none)* — see journal for the authoritative mechanismmaxTokens / contextWindow65536 / 196608agent timeout ×2.0trials9 of 9 — 8 pass · 1 failmean reward0.89tokens (job total)42,005,349 in / 630,557 outstarted / finished2026-07-26T00:26 / 2026-07-26T01:44wall clock1h17m

Tasks

cobol-modernization — 3/3 passed

#resulttotalagentin/out tokflags
1PASS4m18s3m44s1434867/36025
long reasoning (17,621 chars) ×3
🔍 view
2PASS2m56s2m22s1045025/23307
🔍 view
3PASS5m05s4m32s1302685/44651
long reasoning (12,674 chars)
🔍 view

largest-eigenval — 2/3 passed

#resulttotalagentin/out tokflags
1FAIL22m36s22m03s23635827/164976
long reasoning (30,499 chars)
🔍 view
2PASS5m50s5m19s6007763/35272
🔍 view
3PASS11m55s11m24s4494116/97750
long reasoning (20,314 chars) ×6
🔍 view

vulnerable-secret — 3/3 passed

#resulttotalagentin/out tokflags
1PASS10m16s9m42s1162797/94097
long reasoning (14,464 chars) ×7
🔍 view
2PASS6m28s5m55s786239/59189
long reasoning (16,249 chars) ×4
🔍 view
3PASS8m25s7m51s2136030/75290
long reasoning (13,200 chars) ×3
🔍 view