Lo vi y lo estuve estudiando meter en el vídeo PEEEEEERO tiene un poco de trampa. Comparar modelos unimodales de texto (ciegos como GPT 3.5) en tareas de QyA visuales es un poco raro. Y más teniendo la opción de validarlo contra BLIP.
Unimodal Text Models Unfairly Compared in Visual QA Tasks
By
–