[ab] server http://172.17.0.1:8100 model /models/Qwen3.8-27B-exl3-4.0bpw
[transformers] Token indices sequence length is longer than the specified maximum sequence length for this model (317092 > 262144). Running this sequence through the model will result in indexing errors
  [0] code       prompt=8244 out=512 proposed=1092 accepted=360 rate=0.3297 tok/s= 73.31 length
  [1] code       prompt=8243 out=512 proposed=1204 accepted=340 rate=0.2824 tok/s= 68.71 length
  [2] code       prompt=8243 out=512 proposed=1183 accepted=343 rate=0.2899 tok/s= 69.30 length
  [3] code       prompt=8244 out=512 proposed=973 accepted=373 rate=0.3834 tok/s= 78.56 length
  [4] wiki       prompt=8244 out=512 proposed=952 accepted=376 rate=0.3950 tok/s= 79.82 length
  [5] wiki       prompt=8244 out=512 proposed=1064 accepted=359 rate=0.3374 tok/s= 74.34 length
  [6] wiki       prompt=8244 out=512 proposed=966 accepted=374 rate=0.3872 tok/s= 79.01 length
  [7] wiki       prompt=8244 out=512 proposed=1078 accepted=364 rate=0.3377 tok/s= 73.18 length
  [8] math       prompt=8244 out=512 proposed=854 accepted=391 rate=0.4578 tok/s= 84.63 length
  [9] math       prompt=8244 out=512 proposed=826 accepted=395 rate=0.4782 tok/s= 86.20 length
  [10] math       prompt=8244 out=512 proposed=1141 accepted=350 rate=0.3067 tok/s= 70.44 length
  [11] math       prompt=8244 out=505 proposed=966 accepted=367 rate=0.3799 tok/s= 77.13 stop
  [12] longctx    prompt=8244 out=512 proposed=1225 accepted=336 rate=0.2743 tok/s= 67.15 length
  [13] longctx    prompt=8244 out=512 proposed=1043 accepted=364 rate=0.3490 tok/s= 74.70 length
  [14] longctx    prompt=8244 out=512 proposed=973 accepted=377 rate=0.3875 tok/s= 77.97 length
  [15] longctx    prompt=8244 out=512 proposed=980 accepted=377 rate=0.3847 tok/s= 77.70 length
  [16] sci        prompt=8244 out=129 proposed=238 accepted=94 rate=0.3950 tok/s= 37.25 stop
  [17] sci        prompt=8244 out=512 proposed=959 accepted=376 rate=0.3921 tok/s= 78.71 length
  [18] sci        prompt=8244 out=160 proposed=364 accepted=108 rate=0.2967 tok/s= 40.15 stop
  [19] sci        prompt=8245 out=328 proposed=581 accepted=245 rate=0.4217 tok/s= 66.99 stop
[ab] pooled accept rate 0.3574 over 20 prompts -> /cache/ab/DFLASHg.json

## drafter (server log)
20:33:20 INFO    cudaGraphInstantiate MEASURED: decode=12.38 MiB/graph x16, dflash=6.25 MiB/graph x8 (24 exec(s), 248.0 MiB driver total) — persisting; retires the modelled per-graph constant.
20:33:20 INFO    graph_pool budget cache: persisted 1444937728 B (1378.0 MiB) + measured cudaGraphInstantiate decode=12.38 MiB/graph, dflash=6.25 MiB/graph → /cache/arbi-serve/budget-cache/dec74d8777b09bf8.json
