[pass1] 60 seed tasks, model=gemma-4-31b
[pass1] failures by family: {'letter_sent': 1, 'reverse': 3, 'log_ts': 6, 'id_norm': 6, 'round_rule': 3, 'csv_order': 6, 'status_code': 6, 'branch_name': 6}
[pass2] 120 test tasks x 2 arms

# errlore error-reduction A/B — model gemma-4-31b

tasks (test): 120 | families active (had seed failures): ['branch_name', 'csv_order', 'id_norm', 'letter_sent', 'log_ts', 'reverse', 'round_rule', 'status_code']

| arm | failures | fail rate |
|---|---|---|
| A plain | 80/120 | 66.7% |
| B errlore | 24/120 | 20.0% |

discordant pairs: errlore fixed 61, errlore broke 5
exact McNemar p = 2.631e-13
repeat-error reduction: 70.0%

### KNOWLEDGE-GAP (workspace conventions): A 70/72 -> B 12/72 | reduction 83%

### CAPABILITY-GAP (model skill limits): A 10/48 -> B 12/48 | reduction -20%

per-family (fail A -> fail B):
- branch_name: 12 -> 0 *lesson active*
- csv_order: 12 -> 12 *lesson active*
- id_norm: 12 -> 0 *lesson active*
- letter_sent: 4 -> 3 *lesson active*
- log_ts: 12 -> 0 *lesson active*
- mult4: 0 -> 0
- nth_char: 0 -> 0
- reverse: 6 -> 9 *lesson active*
- round_rule: 10 -> 0 *lesson active*
- status_code: 12 -> 0 *lesson active*

raw outputs: /tmp/errlore_ab_76aidzit/raw_outputs.jsonl
errlore stats: {'errors_total': 37, 'errors_resolved': 37, 'errors_unresolved': 0, 'lessons_total': 19, 'lessons_applied': 18, 'pending_injections': 0, 'trust': {'gemma-4-31b': 0.92}}

[saved: /tmp/cerebras_full.jsonl]
