Congrats! Big props unifying vision language datasets and making it easy to access them. We also recently released a massive VQA dataset of 30M samples(22M filtered), spanning 42 countries and 39 languages. The dataset contains factual visual questions and answers about world
Major VQA Dataset Release: 30M Samples Across 42 Countries
By
–