MATH · IN · MODELS

LLaVA

various (academic)

By model (6)

LLaVA-Llama-3-8B · 8B
LLaVA-More (CLIP ViT-L/14-336 + Llama-3.1-8B) · 8B
LLaVA-NeXT-13B · 13B
LLaVA-NeXT-7B · 7B

Papers

Head Pursuit: Probing Attention Specialization in Multimodal Transformers (2025), What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models (2026), Vision Transformers Don't Need Trained Registers (2025), Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models (2026), Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models (2025), Towards Understanding Multimodal Fine-Tuning: A Case Study into Spatial Features (2026), Visual Representation Alignment for Multimodal Large Language Models (2025)