[pass1] 48 seed tasks, model=claude-haiku-4-5
[pass1] failures by family: {'nth_char': 1, 'letter_sent': 4, 'reverse': 4, 'log_ts': 6, 'id_norm': 6, 'round_rule': 6, 'csv_order': 6}
[pass2] 96 test tasks x 2 arms

# errlore error-reduction A/B — model claude-haiku-4-5

tasks (test): 96 | families active (had seed failures): ['csv_order', 'id_norm', 'letter_sent', 'log_ts', 'nth_char', 'reverse', 'round_rule']

| arm | failures | fail rate |
|---|---|---|
| A plain | 63/96 | 65.6% |
| B errlore | 19/96 | 19.8% |

discordant pairs: errlore fixed 48, errlore broke 4
exact McNemar p = 1.307e-10
repeat-error reduction: 69.8%

### KNOWLEDGE-GAP (workspace conventions): A 46/48 -> B 0/48 | reduction 100%

### CAPABILITY-GAP (model skill limits): A 17/48 -> B 19/48 | reduction -12%

per-family (fail A -> fail B):
- csv_order: 12 -> 0 *lesson active*
- id_norm: 12 -> 0 *lesson active*
- letter_sent: 6 -> 7 *lesson active*
- log_ts: 12 -> 0 *lesson active*
- mult4: 0 -> 0
- nth_char: 0 -> 0 *lesson active*
- reverse: 11 -> 12 *lesson active*
- round_rule: 10 -> 0 *lesson active*

raw outputs: /tmp/errlore_ab_f68cz6tc/raw_outputs.jsonl
errlore stats: {'errors_total': 33, 'errors_resolved': 33, 'errors_unresolved': 0, 'lessons_total': 21, 'lessons_applied': 15, 'pending_injections': 0, 'trust': {'claude-haiku-4-5': 0.92}}

[saved: /tmp/bench_seed_33.jsonl]
