I need to think about this more, but I'm proposing token-level calculation of that concept: sum(token_bits / token_bytes for _ in all_tokens) … and not: sum(tokens_bits) / sum(tokens_bytes) Because the second one would hide bad predictions for longer tokens in the sum(),
Token-level bit efficiency metric for model evaluation
By
–