A compact multimodal model that handles both text and image inputs, producing text outputs. At 10B parameters, it sits in a mid-range size class — capable enough for vision-language tasks without demanding massive compute resources. Details about its specific strengths and behavioral quirks are limited beyond its multimodal architecture.