Multimodal function vectors causally raise visual-relation accuracy
measured in 1 paperFu et al. use causal-mediation (Average Indirect Effect per attention head) to identify a top-10-head causal subnetwork per visual relation in OpenFlamingo-4B [fu-etal-2026-multimodal-function-vectors-visual-relations] Summing those heads' mean activations gives a multimodal function vector whose injection raises zero-shot accuracy from 4.8% to 9.7% [fu-etal-2026-multimodal-function-vectors-visual-relations] Fine-tuning the function vector on a held-out novel-object set reaches 13.6% versus a 9.4% ICL baseline [fu-etal-2026-multimodal-function-vectors-visual-relations] Composite function vectors for entirely untrained relations roughly double accuracy again (8.1% to 16.8%) [fu-etal-2026-multimodal-function-vectors-visual-relations] The injection effect peaks at intermediate layers (~layer 19) with a 6-12 head sweet spot [fu-etal-2026-multimodal-function-vectors-visual-relations]