random research idea: Latent Text Tansformer (LTT) in a nutshell: replace sequence of *vectors* as hidden states of the transformer with sequences of *tokens*, so we can read the model's "thoughts" directly then train a transformer that uses longer sequences of *discrete
Latent Text Transformer: Making Model Thoughts Readable
By
–
