LlamaFusion Extends pretrained text-only LLMs with multimodal capabilities while preserving language performance. Problem:
Training multimodal models from scratch is costly and risks degrading pretrained language abilities. Method:
Adds image-specific modules to pretrained
LlamaFusion Extends LLMs with Multimodal Capabilities
By
–
