MATH · IN · MODELS
methods / Representation Alignment / Triangle-area tri-modal similarity

Triangle-area tri-modal similarity

Techniqueintermediate

Replaces pairwise cosine similarity in a contrastive loss with the exact area of the triangle spanned by three unit-norm modality embeddings, computed directly in the shared high-dimensional embedding space via a Gram-determinant (Heron-style) formula -- a single scalar that jointly measures three-way alignment without an anchor modality, a fusion layer, or any pairwise decomposition.

Used in (1 observation)

structure: Polytope (Simplex) · models: VAST (Vision-Audio-Subtitle-Text foundation model), TRIANGLE (VAST backbone, fusion layers removed, retrained with triangle-area loss) · paper: A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity