[ab] server http://172.17.0.1:8100 model /models/Qwen3.8-27B-exl3-4.0bpw
[transformers] Token indices sequence length is longer than the specified maximum sequence length for this model (317092 > 262144). Running this sequence through the model will result in indexing errors
  [0] code       prompt=8244 out=512 proposed=1127 accepted=350 rate=0.3106 tok/s= 69.19 length
  [1] code       prompt=8243 out=512 proposed=1099 accepted=355 rate=0.3230 tok/s= 70.45 length
  [2] code       prompt=8243 out=512 proposed=1057 accepted=361 rate=0.3415 tok/s= 72.15 length
  [3] code       prompt=8244 out=512 proposed=959 accepted=375 rate=0.3910 tok/s= 76.71 length
  [4] wiki       prompt=8244 out=512 proposed=987 accepted=374 rate=0.3789 tok/s= 75.41 length
  [5] wiki       prompt=8244 out=512 proposed=1008 accepted=367 rate=0.3641 tok/s= 74.13 length
  [6] wiki       prompt=8244 out=512 proposed=903 accepted=385 rate=0.4264 tok/s= 79.66 length
  [7] wiki       prompt=8244 out=512 proposed=1113 accepted=354 rate=0.3181 tok/s= 69.59 length
  [8] math       prompt=8244 out=512 proposed=1043 accepted=362 rate=0.3471 tok/s= 72.68 length
  [9] math       prompt=8244 out=512 proposed=980 accepted=377 rate=0.3847 tok/s= 75.55 length
  [10] math       prompt=8244 out=512 proposed=1064 accepted=361 rate=0.3393 tok/s= 71.52 length
  [11] math       prompt=8244 out=349 proposed=574 accepted=267 rate=0.4652 tok/s= 70.18 stop
  [12] longctx    prompt=8244 out=512 proposed=1134 accepted=349 rate=0.3078 tok/s= 68.69 length
  [13] longctx    prompt=8244 out=512 proposed=1043 accepted=364 rate=0.3490 tok/s= 72.62 length
  [14] longctx    prompt=8244 out=512 proposed=1057 accepted=364 rate=0.3444 tok/s= 71.96 length
  [15] longctx    prompt=8244 out=512 proposed=1162 accepted=345 rate=0.2969 tok/s= 67.58 length
  [16] sci        prompt=8244 out=350 proposed=665 accepted=255 rate=0.3835 tok/s= 64.94 stop
  [17] sci        prompt=8244 out=512 proposed=980 accepted=372 rate=0.3796 tok/s= 75.54 length
  [18] sci        prompt=8244 out=266 proposed=553 accepted=186 rate=0.3363 tok/s= 54.45 stop
  [19] sci        prompt=8245 out=512 proposed=714 accepted=413 rate=0.5784 tok/s= 91.36 length
[ab] pooled accept rate 0.3608 over 20 prompts -> /cache/ab/DFLASH.json

## drafter (server log)
20:29:39 INFO    cudaGraphInstantiate MEASURED: decode=12.38 MiB/graph x16, dflash=6.25 MiB/graph x8 (24 exec(s), 248.0 MiB driver total) — persisting; retires the modelled per-graph constant.
20:29:39 INFO    graph_pool budget cache: persisted 1444937728 B (1378.0 MiB) + measured cudaGraphInstantiate decode=12.38 MiB/graph, dflash=6.25 MiB/graph → /cache/arbi-serve/budget-cache/dec74d8777b09bf8.json
