{% extends "base.html" %} {% block title %}Sample Inspection - lm-eval-ledger{% endblock %} {% block content %}
| sample | gold | A answered | B answered | A | B | Δ |
|---|---|---|---|---|---|---|
| {{ r.sample_id|trunc(30) }} | {{ r.gold|trunc(100) }} | {{ r.ans_a|trunc(80) }} | {{ r.ans_b|trunc(80) }} | {{ "%g"|format(r.score_a) }} | {{ "%g"|format(r.score_b) }} | {{ {"improved": "IMPROVED", "regressed": "REGRESSED", "answers": "≠", "same": "="}[c] }} |
{{ groups|length }} samples always {{ mode }} in every {{ "selected benchmark" if sel else "benchmark" }} covering them{{ " (%d selected)"|format(sel|length) if sel }}.
| task | sample | evals | models | gold |
|---|---|---|---|---|
| {{ g.task }} | {{ g.sample_id|trunc(30) }} | {{ g.n_evals }} | {{ g.n_models }} | {{ g.gold|trunc(120) }} |
Showing {% if chips %} {% for label, remove_url in chips %} {{ label }} × {% endfor %} {% else %}everything{% endif %} — {{ total }} samples · page {{ page }} of {{ ((total - 1) // page_size) + 1 if total else 1 }} {% if page > 1 %}← prev{% endif %} {% if page * page_size < total %}next →{% endif %}
| sample | model / task | prompt | response | gold | extracted | stop | score |
|---|---|---|---|---|---|---|---|
| {{ r.sample_id|trunc(24) }}
bench {{ r.benchmark_id }} |
{{ r.model_tag }} {{ r.task }} |
{% for iid in r.image_ids|imgids %}
{{ r.prompt_snip }} |
{{ r.response_snip }} |
{{ r.gold|trunc(200) }} |
{{ r.extracted|trunc(40) }} | {{ r.stop_reason|trunc(30) }} | {{ "%g"|format(r.score) }}{% if r.verified_score is not none %}
v {{ "%g"|format(r.verified_score) }} {% endif %} |