MATH · IN · MODELS

Multimodal function vectors causally raise visual-relation accuracy

measured in 1 paper

Fu et al. use causal-mediation (Average Indirect Effect per attention head) to identify a top-10-head causal subnetwork per visual relation in OpenFlamingo-4B [fu-etal-2026-multimodal-function-vectors-visual-relations] Summing those heads' mean activations gives a multimodal function vector whose injection raises zero-shot accuracy from 4.8% to 9.7% [fu-etal-2026-multimodal-function-vectors-visual-relations] Fine-tuning the function vector on a held-out novel-object set reaches 13.6% versus a 9.4% ICL baseline [fu-etal-2026-multimodal-function-vectors-visual-relations] Composite function vectors for entirely untrained relations roughly double accuracy again (8.1% to 16.8%) [fu-etal-2026-multimodal-function-vectors-visual-relations] The injection effect peaks at intermediate layers (~layer 19) with a 6-12 head sweet spot [fu-etal-2026-multimodal-function-vectors-visual-relations]

Context

multimodal function vectors, causal-mediation head identification, composite function vectors for untrained relations

Papers

Multimodal Function Vectors for Visual Relations — Fu, Shuhao, Goldberg, Esther, Wu, Ying Nian, Lu, Hongjing2026 · arXiv:2510.02528