{% extends "base.html" %} {% block title %}Sample Inspection - lm-eval-ledger{% endblock %} {% block content %}

Sample Inspection

Sample comparison
{% if mode == "pairwise" and pairs is not none %}
Pairwise comparison ⇄ swap A/B
A {{ label_a }} B {{ label_b }}
{% for key, text in [("all", "All"), ("improved", "Improved – B fixed"), ("regressed", "Regressed – B broke"), ("answers", "Same score, answer changed"), ("same", "Unchanged")] %} {{ text }} {{ counts.values()|sum if key == "all" else counts[key] }} {% endfor %}
{% for c, r in pairs %} {% endfor %}
samplegoldA answeredB answered ABΔ
{{ r.sample_id|trunc(30) }} {{ r.gold|trunc(100) }} {{ r.ans_a|trunc(80) }} {{ r.ans_b|trunc(80) }} {{ "%g"|format(r.score_a) }} {{ "%g"|format(r.score_b) }} {{ {"improved": "IMPROVED", "regressed": "REGRESSED", "answers": "≠", "same": "="}[c] }}
{% elif mode in ("wrong", "right") and groups is defined %}

{{ groups|length }} samples always {{ mode }} in every {{ "selected benchmark" if sel else "benchmark" }} covering them{{ " (%d selected)"|format(sel|length) if sel }}.

{% for g in groups %} {% endfor %}
tasksampleevalsmodelsgold
{{ g.task }} {{ g.sample_id|trunc(30) }} {{ g.n_evals }} {{ g.n_models }} {{ g.gold|trunc(120) }}
{% elif mode == "browse" and rows is defined %}

Showing {% if chips %} {% for label, remove_url in chips %} {{ label }} × {% endfor %} {% else %}everything{% endif %} — {{ total }} samples · page {{ page }} of {{ ((total - 1) // page_size) + 1 if total else 1 }} {% if page > 1 %}← prev{% endif %} {% if page * page_size < total %}next →{% endif %}

{% for r in rows %} {% set eff = (r.verified_score if r.verified_score is not none else r.score) or 0 %} {% endfor %}
samplemodel / task promptresponse goldextractedstopscore
{% endif %} {% endblock %}