AI Dynamics

Global AI News Aggregator

About

Token-level bit efficiency metric for model evaluation

I need to think about this more, but I'm proposing token-level calculation of that concept: sum(token_bits / token_bytes for _ in all_tokens) … and not: sum(tokens_bits) / sum(tokens_bytes) Because the second one would hide bad predictions for longer tokens in the sum(),

→ View original post on X — @alexjc