E-Commerce Last Exam Leaderboard

Dataset · Evaluation CLI · 120 tasks (77 travel + 43 e-commerce) · pass@3

Overall (120)
Travel (77)
E-Commerce (43)
Timeline
About
Submit

Weighted average across all 120 tasks (77 travel + 43 e-commerce)

Travel planning tasks — hotel, transport, attraction

English shopping & consumption tasks — gear, food, electronics, lifestyle

Submission history — newest first

120
Total Tasks
77
Travel
43
E-Commerce (EN)

About the Benchmark

E-Commerce Last Exam evaluates LLM agents on real-world tool-use tasks. Each task runs in an isolated Docker container with domain-specific CLI tools and SQLite databases. Agents must search, analyze, and produce structured recommendations.

Travel config 77 tasks — Hotel booking, transport routing, attraction planning across 30+ cities. Tools: search_hotel_list, search_traffic, search_poi_and_ticket.

E-Commerce config 43 tasks — Shopping decisions, price comparison, product research across travel gear, food, electronics, lifestyle. Tools: hotel_search, taobao_search, general_search.

Scoring: Each task yields a reward in [0, 1] combining hard checks (rubrics.py) and LLM soft judge (judge.py).

How to Submit

pip install flyai-bench

# Run evaluation
flyai-bench run --dataset-config travel

# Package results
flyai-bench submit --model your-model --provider your-provider

Then open a PR to ecommerce_last_exam with your results in experiments/evaluation/<config>/<slug>/.

CI validates format automatically. Once merged, the leaderboard updates.

Required Files

FileDescription
metadata.yamlModel/agent info + evaluation stats
scores.jsonlPer-instance: {instance_id, domain, reward, duration_sec}
summary.jsonAggregate statistics (auto-generated if missing)