Does it actually work in practice? Wikitext-2 (language modeling): 13M param Grassmann model: 275.7 perplexity
13M param Transformer: 248.4 perplexity
Gap: ~11% behind SNLI (natural language inference): Grassmann head: 85.50% validation accuracy
Transformer head: 85.45%
Grassmann model trails in perplexity but leads in SNLI accuracy
By
–
