LLaVA
various (academic)
Structures found in this family (3)
By model (6)
LLaVA-1.5-7B · 7B
LLaVA-1.5-13B · 13B
LLaVA-Llama-3-8B · 8B
LLaVA-More (CLIP ViT-L/14-336 + Llama-3.1-8B) · 8B
LLaVA-NeXT-13B · 13B
LLaVA-NeXT-7B · 7B
Observations (7)
Papers
Head Pursuit: Probing Attention Specialization in Multimodal Transformers (2025), What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models (2026), Vision Transformers Don't Need Trained Registers (2025), Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models (2026), Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models (2025), Towards Understanding Multimodal Fine-Tuning: A Case Study into Spatial Features (2026), Visual Representation Alignment for Multimodal Large Language Models (2025)