Multimodal visual-and-text reasoning.
A more robust multimodal benchmark that filters text-only-solvable questions, expands answer options, and adds vision-only inputs (text embedded in images) to test true joint visual+textual reasoning. Forces models to 'see' and 'read' simultaneously.