SmolVLM: Redefining small and efficient multimodal models SmolVLM is a family of highly efficient, small-scale vision-language models (VLMs) engineered for low-memory, real-time multimodal inference on mobile and edge devices. These models achieve competitive or even superior
SmolVLM: Efficient Vision-Language Models for Edge Devices
By
–
