10/ Generative Pretraining in Multimodality – presents a new transformer-based multimodal foundation model to generate images and text in a multimodal context; enables performant multimodal assistants via instruction tuning.
Multimodal Transformer Foundation Model for Image and Text Generation
By
–
