MATH · IN · MODELS

Medical-LMM CAV sensitivity scores track ground-truth causal effects

measured in 1 paper

Janizek et al. extract concept activation vectors from three OpenFlamingo models and score a Visual Concept Ranking sensitivity as the output logit's directional derivative along each CAV [janizek-etal-2026-visual-concept-ranking-medical-shortcuts-large-multimodal-models] On an 800-condition synthetic benchmark, VCR sensitivity correlates with the true interventional effect at Pearson r=0.53 (p=4.9e-49), exceeding 0.6 for 6 of 8 feature pairs [janizek-etal-2026-visual-concept-ranking-medical-shortcuts-large-multimodal-models] Under a spurious-correlation stress test, VCR identifies a spurious feature's causal sign 92% of the time versus 18% for a correlational CLIP baseline [janizek-etal-2026-visual-concept-ranking-medical-shortcuts-large-multimodal-models] On dermatology tasks VCR flagged blue/purple ink-marking as a "malignant" driver specific to darker-skin samples, validated by targeted image edits [janizek-etal-2026-visual-concept-ranking-medical-shortcuts-large-multimodal-models] Distinct semantic labels (Purpura/tattoo) coincided on one direction, a reminder that a CAV's assigned label may not match what it encodes [janizek-etal-2026-visual-concept-ranking-medical-shortcuts-large-multimodal-models]

Context

concept activation vector (CAV) as a unit-length linear direction in a specific layer, directional-derivative sensitivity score (Visual Concept Ranking), quantified correlation (Pearson r) between sensitivity score and ground-truth interventional effect, sign-concordance validation under distribution shift (92% vs. 18% baseline), real-image input-level intervention validating a demographic shortcut hypothesis, CAV semantic-label ambiguity (distinct labels geometrically coinciding on one direction)

Papers

Visual concept ranking uncovers medical shortcuts used by large multimodal models — Janizek, Joseph D., Xu, Sonnet, Lateef, Junayd, Daneshjou, Roxana2026 · arXiv:2602.05096