MATH · IN · MODELS

Model families (331)

How many distinct mathematical structures have been found in each family, across every model checkpoint in it. Sorted, tallest first. Click a bar (or a card below) to see the family's models and drill into which structures were found in each one specifically.

GPT
10
Show 317 more families
Llama
Meta
27 structures · 1 hypothesis · 35 models · 210 observations
Gemma
Google DeepMind
26 structures · 3 hypotheses · 29 models · 122 observations
Qwen
Alibaba
22 structures · 75 models · 131 observations
Mistral
Mistral AI
17 structures · 1 hypothesis · 20 models · 61 observations
Pythia
EleutherAI
15 structures · 10 models · 47 observations
ResNet
Microsoft Research
11 structures · 13 models · 25 observations
GPT
OpenAI
10 structures · 8 models · 40 observations
CLIP (Contrastive Language-Image Pretraining)
OpenAI
9 structures · 1 hypothesis · 9 models · 31 observations
word2vec
Google
9 structures · 1 hypothesis · 8 models · 18 observations
BERT
Google
8 structures · 1 hypothesis · 13 models · 54 observations
GPT-2
OpenAI
8 structures · 1 hypothesis · 8 models · 28 observations
Phi
Microsoft
8 structures · 8 models · 14 observations
wav2vec 2.0
Meta AI
8 structures · 6 models · 10 observations
DINOv2
Meta AI
7 structures · 1 hypothesis · 5 models · 16 observations
Show 317 more families as cards
GPT-J
EleutherAI
7 structures · 1 models · 21 observations
OLMo 2
Allen Institute for AI
7 structures · 5 models · 7 observations
Custom Research Transformer (small, purpose-built for interpretability studies)
various (academic)
6 structures · 7 models · 6 observations
GPT-OSS
OpenAI
6 structures · 1 models · 10 observations
OLMo
Allen Institute for AI
6 structures · 5 models · 13 observations
RoBERTa
Meta AI
6 structures · 7 models · 17 observations
Stable Diffusion
Stability AI
6 structures · 10 models · 21 observations
VGG
Visual Geometry Group, Oxford
6 structures · 1 models · 7 observations
WavLM
Microsoft
6 structures · 3 models · 8 observations
Custom Research CNN (purpose-built convolutional net for representation-geometry studies)
various (academic)
5 structures · 7 models · 5 observations
DeepSeek
DeepSeek AI
5 structures · 9 models · 10 observations
ELMo
AllenNLP / Allen Institute for AI
5 structures · 2 models · 6 observations
HuBERT
Meta AI
5 structures · 2 models · 7 observations
OPT
Meta AI (Facebook AI Research)
5 structures · 6 models · 6 observations
StyleGAN
NVIDIA
5 structures · 3 models · 5 observations
Vision Transformer (ViT)
Google Research
5 structures · 6 models · 12 observations
AlexNet
University of Toronto
4 structures · 2 models · 5 observations
Custom research feedforward MLP
4 structures · 9 models · 7 observations
GloVe
Stanford NLP Group
4 structures · 3 models · 11 observations
InternVL
Shanghai AI Lab / OpenGVLab
4 structures · 2 models · 6 observations
JEPA (Joint Embedding Predictive Architecture)
Independent / academic
4 structures · 4 models · 5 observations
Mamba
CMU / Princeton (Gu & Dao)
4 structures · 3 models · 4 observations
OpenCLIP
LAION
4 structures · 3 models · 5 observations
OpenAI Embeddings
OpenAI
4 structures · 2 models · 4 observations
SigLIP
Google DeepMind
4 structures · 2 models · 6 observations
SimCLR
Google Research
4 structures · 3 models · 7 observations
Whisper
OpenAI
4 structures · 4 models · 5 observations
ALBERT
Google
3 structures · 1 models · 3 observations
Bayesian Wind Tunnel Mamba
Research (Agarwal, Dalal & Misra 2026; Mamba/SSM architecture (Gu & Dao 2023), custom-trained from scratch per synthetic task)
3 structures · 1 models · 1 observations
Bayesian Wind Tunnel Transformer
Research (Agarwal, Dalal & Misra 2026; custom-trained from scratch, one model per synthetic task with an analytically known Bayesian posterior)
3 structures · 2 models · 1 observations
BLOOM
BigScience
3 structures · 6 models · 5 observations
CLAP (Contrastive Language-Audio Pretraining)
Multiple (Microsoft/LAION-style CLAP architecture)
3 structures · 3 models · 2 observations
Claude
Anthropic
3 structures · 3 models · 4 observations
Data2Vec
Meta AI
3 structures · 1 models · 2 observations
DistilBERT
Hugging Face
3 structures · 1 models · 6 observations
ESM-2
Meta AI (FAIR)
3 structures · 5 models · 7 observations
FLUX
Black Forest Labs
3 structures · 2 models · 8 observations
GPT-Neo
EleutherAI
3 structures · 3 models · 3 observations
LLaVA
various (academic)
3 structures · 6 models · 7 observations
MiniLM
Microsoft
3 structures · 2 models · 5 observations
MPNet
Microsoft
3 structures · 2 models · 5 observations
OthelloGPT
Research (Li et al. 2023, custom-trained on synthetic Othello move sequences)
3 structures · 1 models · 4 observations
scGPT
University of Toronto / Broad Institute (open-source)
3 structures · 1 models · 5 observations
Vicuna
LMSYS
3 structures · 4 models · 9 observations
VideoMAE
MCG-NJU (Nanjing University)
3 structures · 2 models · 6 observations
Wan
Alibaba (Wan-Video team)
3 structures · 3 models · 3 observations
Weather/Climate Foundation Model
various (Microsoft, Google DeepMind)
3 structures · 2 models · 3 observations
XLM-RoBERTa
Meta AI (FAIR)
3 structures · 2 models · 5 observations
Yi
01.AI
3 structures · 3 models · 2 observations
Achilli/Pham et al. Diffusion Memorization-Transition DDPMs
Research (Achilli, Ventura, Pham, Raya, Krotov, Lucibello, Ambrogioni et al.; PixelCNN++-backbone DDPMs, arXiv:2410.08727 / arXiv:2505.21777)
2 structures · 5 models · 2 observations
AIMv2
Apple
2 structures · 1 models · 1 observations
Alpaca
Stanford
2 structures · 2 models · 3 observations
AlphaZero
Google DeepMind
2 structures · 2 models · 2 observations
Aya
Cohere For AI
2 structures · 2 models · 4 observations
BART
Meta AI (Facebook AI Research)
2 structures · 2 models · 5 observations
BGE
BAAI
2 structures · 4 models · 4 observations
BigGAN
DeepMind
2 structures · 2 models · 2 observations
Chemical Language Model (ChemBERTa / MoLFormer / RoBERTa-Zinc family)
various (academic)
2 structures · 3 models · 2 observations
Code Llama
Meta
2 structures · 1 models · 1 observations
CogVideoX
Zhipu AI / THUDM
2 structures · 3 models · 3 observations
ConvNeXt
Meta AI
2 structures · 1 models · 3 observations
CosyVoice
Alibaba
2 structures · 2 models · 2 observations
Custom Recurrent RL Policies
Academic
2 structures · 3 models · 2 observations
DDPM (Denoising Diffusion Probabilistic Models, HuggingFace Diffusers checkpoints)
Ho, Jain & Abbeel / HuggingFace
2 structures · 10 models · 4 observations
DeBERTa
Microsoft
2 structures · 2 models · 3 observations
DenseNet
Huang, Liu, van der Maaten & Weinberger (academic)
2 structures · 2 models · 2 observations
DIAMOND (diffusion UNet world model)
Independent / academic (Alonso et al.)
2 structures · 1 models · 2 observations
DINO
Meta AI
2 structures · 2 models · 3 observations
DINOv3
Meta AI
2 structures · 1 models · 3 observations
E5
Microsoft
2 structures · 5 models · 5 observations
Earth-Observation / Remote-Sensing Foundation Model
Google
2 structures · 1 models · 1 observations
ELECTRA
Google
2 structures · 2 models · 2 observations
EnCodec
Meta AI
2 structures · 1 models · 3 observations
Falcon
TII
2 structures · 2 models · 1 observations
FastText
Facebook AI Research
2 structures · 3 models · 6 observations
Float
Prakash et al. (2024)
2 structures · 1 models · 1 observations
Gaperon
LightOn
2 structures · 1 models · 1 observations
Geneformer
Broad Institute
2 structures · 1 models · 2 observations
GLM-4
Zhipu AI
2 structures · 2 models · 2 observations
GPT-NeoX
EleutherAI
2 structures · 1 models · 5 observations
GPT2-Spanish
DCC Universidad de Chile
2 structures · 1 models · 2 observations
iBOT
ByteDance / Academic
2 structures · 2 models · 3 observations
Inception
Google
2 structures · 1 models · 2 observations
IRIS (VQ-VAE + Transformer world model)
Independent / academic (Micheli et al.)
2 structures · 1 models · 2 observations
Jukebox
OpenAI
2 structures · 1 models · 2 observations
Leela Chess Zero
Open-source community
2 structures · 1 models · 1 observations
MERT
Multi-Agent Perception Lab (m-a-p)
2 structures · 1 models · 2 observations
MetaCLIP
Meta AI
2 structures · 2 models · 2 observations
Mitra
Amazon (AutoGluon team)
2 structures · 1 models · 1 observations
MusicGen
Meta AI
2 structures · 2 models · 3 observations
NLLB (No Language Left Behind)
Meta AI
2 structures · 1 models · 2 observations
OLMoE
Allen Institute for AI
2 structures · 1 models · 2 observations
OpenVLA
Stanford / TRI / UC Berkeley / Google DeepMind (open collaboration)
2 structures · 1 models · 5 observations
PGGAN (Progressive GAN)
NVIDIA
2 structures · 3 models · 3 observations
RNNLM (Recurrent Neural Network Language Model)
Independent / academic (Mikolov et al.)
2 structures · 2 models · 2 observations
SchNet (continuous-filter convolutional GNN for molecules)
research/foundational-architecture
2 structures · 1 models · 1 observations
Sentiment-classification RNNs (LSTM/GRU/UGRNN/vanilla)
Maheswaranathan, Williams, Golub, Ganguli & Sussillo (academic)
2 structures · 4 models · 2 observations
SiT (Scalable Interpolant Transformers)
research
2 structures · 2 models · 2 observations
SmolLM2
Hugging Face
2 structures · 2 models · 2 observations
T5
Google
2 structures · 4 models · 4 observations
TabICL
Soda-Inria / academic open-source
2 structures · 1 models · 2 observations
TabPFN
Prior Labs
2 structures · 1 models · 3 observations
Ace-Step
ACE Studio / StepFun
1 structure · 1 models · 1 observations
Adaptive Input Transformer LM (Baevski & Auli)
Facebook AI Research
1 structure · 1 models · 1 observations
ADM (Ablated Diffusion Model, Guided Diffusion)
OpenAI
1 structure · 1 models · 1 observations
AION-1
Academic / multi-institution collaboration (Parker, Lanusse, Shen et al., 26 authors incl. Cho, Cranmer, Ho)
1 structure · 1 models · 1 observations
Ankh
Rostlab / TU Munich
1 structure · 1 models · 1 observations
Autoregressive Predictive Coding (APC)
MIT CSAIL
1 structure · 1 models · 1 observations
Apertus
Swiss AI
1 structure · 1 models · 1 observations
Arora et al. SN word embeddings
Arora, Li, Liang, Ma & Risteski (2016/2018)
1 structure · 1 models · 1 observations
AST (Audio Spectrogram Transformer)
MIT
1 structure · 1 models · 1 observations
Atomistic/Equivariant Graph Neural Network
various (academic)
1 structure · 3 models · 1 observations
AudioLDM
various (academic)
1 structure · 1 models · 1 observations
Audio-MAE
Meta AI
1 structure · 1 models · 1 observations
Banino et al. (2018) grid-cell navigation agent
DeepMind (Banino et al. 2018)
1 structure · 1 models · 1 observations
BEiT (BERT Pre-Training of Image Transformers)
Microsoft
1 structure · 1 models · 1 observations
β-VAE
DeepMind
1 structure · 1 models · 1 observations
Bielik
SpeakLeash / ACK Cyfronet AGH
1 structure · 1 models · 1 observations
Bag-of-Words Superposition Autoencoder (BOWS)
Research (Prieto, Stevinson, Barsbey, Birdal & Mediano 2026; tied-weight autoencoder, custom-trained from scratch on binary bag-of-words vectors of WikiText-103 / OpenWebText text chunks)
1 structure · 2 models · 1 observations
BOWS Toy Transformer
Research (Prieto, Stevinson, Barsbey, Birdal & Mediano 2026; custom 2-layer causal transformer, d_model=768, 8 heads, GELU FFN width 4*d_model, trained from scratch on WikiText-103 with a multi-hot 'seen-so-far' token-recovery objective)
1 structure · 1 models · 1 observations
Brandon, Chadwick & Pellegrino (2025) Boolean-Function MLPs
Research (Univ. Edinburgh / ENS Paris / UCL Gatsby Unit; custom-trained from scratch, arXiv:2512.00196)
1 structure · 1 models · 1 observations
Custom CNN/FC image classifiers (Burfitt, Brodzki & Dłotko 2026)
custom-trained
1 structure · 2 models · 1 observations
EHR Foundation Model (Llama-3.2-1B architecture, trained on MIMIC-IV)
University of Chicago / Rush University (Burkhart, Ramadan, Liao, Chhikara, Rojas, Parker & Beaulieu-Jones)
1 structure · 1 models · 1 observations
Byte-level multiplicative LSTM (Radford, Józefowicz & Sutskever 2017)
OpenAI (Radford, Józefowicz & Sutskever 2017, trained on Amazon reviews)
1 structure · 1 models · 1 observations
CARNN (Continuous Attractor RNN, Sorscher-style path-integration model)
Schøyen et al. (academic, University of Oslo/Simula)
1 structure · 1 models · 1 observations
ChatGLM
Zhipu AI / Tsinghua KEG
1 structure · 1 models · 1 observations
Sonny (hierarchical weather transformer)
Sejong University (Minjong Cheon)
1 structure · 1 models · 1 observations
ChessGPT (Karvonen)
Independent (Adam Karvonen)
1 structure · 2 models · 1 observations
Chronos
Amazon
1 structure · 1 models · 2 observations
Chughtai, Chan & Nanda (2023) group-composition networks
Chughtai, Chan & Nanda (2023), ICML
1 structure · 1 models · 1 observations
Clock/Pizza Modular-Arithmetic Transformer
Research (Zhong, Liu, Tegmark & Andreas 2023; custom-trained from scratch, large hyperparameter/initialization sweep on modular addition)
1 structure · 2 models · 1 observations
CodeBERT
Microsoft
1 structure · 1 models · 1 observations
CodeBERTa
Hugging Face
1 structure · 1 models · 1 observations
CodeT5
Salesforce Research
1 structure · 1 models · 1 observations
Cohere
Cohere
1 structure · 1 models · 1 observations
Conformal-Normalization Path-Integration RNN
Xu, Gao, Zhang, Wei & Wu (academic)
1 structure · 2 models · 1 observations
Conneau et al. Monolingual MLM
Facebook AI / Johns Hopkins (Conneau, Wu, Li, Zettlemoyer & Stoyanov 2020; custom 8-layer bidirectional Transformer MLM, d_model=768, 12 heads, FFN width 3072, GELU, trained from scratch per-language on Wikipedia using the Lample & Conneau (2019) MLM implementation, architecture held fixed across languages for controlled comparison)
1 structure · 5 models · 1 observations
Convergent Evolution controlled 300M architecture comparison (Fu, Zhou, Belkin, Sharan & Jia 2026)
USC / UC San Diego
1 structure · 3 models · 1 observations
Counter-Language Transformer
Research (Tiwari, Gupta & Hahn 2025; architecture and training setup following Bhattamishra, Ahuja & Goyal 2020, custom-trained from scratch per formal language)
1 structure · 1 models · 1 observations
Contrastive Predictive Coding (CPC)
DeepMind
1 structure · 2 models · 1 observations
Cueva & Wei (2018) path-integration RNN
Research (Cueva & Wei 2018, custom-trained vanilla RNN)
1 structure · 1 models · 1 observations
Custom Behavior-Cloning Vision Encoder
academic (various)
1 structure · 1 models · 1 observations
Custom Chess RL Agents
Academic
1 structure · 2 models · 1 observations
Custom Research Contrastive MoE-CNN (sparsely-gated ResNet trained with SimCLR)
various (academic)
1 structure · 1 models · 1 observations
Custom Molecular Transformer-VAE (purpose-built for SELFIES generation)
various (academic)
1 structure · 1 models · 1 observations
Custom research sparse mixture-of-experts transformer
1 structure · 2 models · 2 observations
Custom Research ResNet (constant-width residual variant, purpose-built for SSL studies)
various (academic)
1 structure · 1 models · 1 observations
Custom Research VAE (purpose-built variational autoencoder for representation-geometry studies)
various (academic)
1 structure · 5 models · 4 observations
DAC (Descript Audio Codec)
Descript
1 structure · 1 models · 1 observations
H2O-Danube3
h2oai
1 structure · 1 models · 1 observations
DCGAN (Deep Convolutional GAN)
Radford, Metz & Chintala (2016), ICLR
1 structure · 1 models · 1 observations
DDPM++ (Score-Based SDE Diffusion)
Song et al. (Stanford)
1 structure · 3 models · 1 observations
DeepMoji
MIT Media Lab
1 structure · 1 models · 1 observations
DeepSpeech
Baidu
1 structure · 1 models · 1 observations
DiffRhythm
ASLP@NPU / Xiaomi
1 structure · 1 models · 1 observations
DRC (Deep Repeating ConvLSTM)
Academic (Guez et al. / Garriga-Alonso Lab)
1 structure · 1 models · 2 observations
Echo State Network / Reservoir Computer
various (academic, reservoir-computing tradition)
1 structure · 1 models · 1 observations
EDM
NVIDIA
1 structure · 1 models · 1 observations
EDM2
NVIDIA (Karras et al.)
1 structure · 1 models · 1 observations
ERNIE
Baidu
1 structure · 1 models · 1 observations
ESM3
EvolutionaryScale
1 structure · 2 models · 2 observations
ESM Cambrian (ESMC)
EvolutionaryScale
1 structure · 2 models · 2 observations
Eternis Forecaster
Eternis
1 structure · 1 models · 1 observations
EuroBERT
EuroBERT Team (multi-institution EU consortium)
1 structure · 2 models · 1 observations
EuroLLM
Unbabel / EuroLLM project
1 structure · 2 models · 2 observations
Falcon-Mamba
TII
1 structure · 1 models · 1 observations
Falcon3
TII
1 structure · 1 models · 1 observations
Filus et al. (2026) Continual-Learning ResNet-18 (Mammoth framework)
Research (Filus, Faber, Corizzo & Kanan; trained from scratch via the Mammoth CL framework, arXiv:2605.16374)
1 structure · 2 models · 1 observations
FLAVA
Meta
1 structure · 1 models · 2 observations
Gao et al. (2019) tied-embedding NLG models
Gao, He, Tan, Qin, Wang & Liu (2019), ICLR
1 structure · 1 models · 1 observations
Graph Attention Network (Veličković et al.)
research/foundational-architecture
1 structure · 1 models · 1 observations
Graph Convolutional Network (Kipf & Welling)
research/foundational-architecture
1 structure · 1 models · 1 observations
GELU Toy Transformer
Neel Nanda (independent/TransformerLens)
1 structure · 1 models · 1 observations
Gemini
Google
1 structure · 1 models · 1 observations
GESAM
TU Berlin
1 structure · 1 models · 1 observations
GNN diagnostic-classifier probing suite (GCN/GAT/GIN on Grid-House and ClinTox)
research/toy
1 structure · 1 models · 1 observations
Google Massively Multilingual NMT
Google
1 structure · 1 models · 1 observations
GoogLeNet (Inception v1)
Google
1 structure · 1 models · 1 observations
Gaussian Process Latent Variable Model (GP-LVM)
various (academic)
1 structure · 2 models · 1 observations
GPT-3
OpenAI
1 structure · 1 models · 1 observations
GPT2-base-french
community (HuggingFace)
1 structure · 1 models · 2 observations
Granite Embedding
IBM
1 structure · 1 models · 2 observations
GraphCodeBERT
Microsoft
1 structure · 1 models · 1 observations
Grid-walker toy transformer
Brenner, Knosche & Scherf (2026); custom-trained from scratch on 2D-lattice random walks
1 structure · 1 models · 1 observations
Grokking Modular-Arithmetic MLP
Research (custom-trained from scratch on modular addition, MLP architecture as a non-attention grokking comparison point)
1 structure · 1 models · 1 observations
Grokking Modular-Arithmetic Transformer
Research (Nanda, Chan, Lieberum, Smith & Steinhardt 2023; custom-trained from scratch on modular addition and related algorithmic tasks)
1 structure · 2 models · 3 observations
GTE (General Text Embeddings)
Alibaba
1 structure · 2 models · 2 observations
GTR (Generalizable T5-based dense Retriever)
Google
1 structure · 1 models · 3 observations
Handke et al. (2025) Custom Class-Conditional DDPMs
Research (Handke, Koulischer, Raya & Ambrogioni; custom-trained from scratch, arXiv:2506.10433)
1 structure · 1 models · 1 observations
Haputhanthri, Storan, Jiang et al. (2025) Task-Trained Memory RNNs
Research (Stanford CNC / NTT Physics & Informatics Labs; custom-trained from scratch, arXiv:2502.07256)
1 structure · 1 models · 1 observations
Hermes
NousResearch
1 structure · 1 models · 1 observations
Hierarchical-Equality MLP (custom, Geiger et al. 2023)
Stanford (custom-trained)
1 structure · 1 models · 1 observations
Huginn
ELLIS Institute / MPI-IS / University of Maryland (Geiping et al.)
1 structure · 1 models · 1 observations
HunyuanVideo
Tencent
1 structure · 1 models · 1 observations
HyCoCLIP
Pal et al. (academic)
1 structure · 1 models · 1 observations
HyenaDNA
Stanford University
1 structure · 1 models · 1 observations
Hyperbolic Graph Neural Networks (HGCN / HyboNet)
Various (Chami et al. 2019 HGCN; Chen et al. 2022 HyboNet)
1 structure · 2 models · 1 observations
I3D (Inflated 3D ConvNet)
DeepMind
1 structure · 1 models · 1 observations
Improved DDPM (iDDPM)
OpenAI
1 structure · 1 models · 1 observations
Idefics
Hugging Face
1 structure · 1 models · 1 observations
Image GPT
OpenAI
1 structure · 3 models · 1 observations
Impala-CNN Atari encoder
1 structure · 1 models · 1 observations
IndexTTS
Bilibili
1 structure · 1 models · 1 observations
InternLM
Shanghai AI Laboratory
1 structure · 2 models · 1 observations
Importance-Weighted Autoencoder (IWAE)
various (academic)
1 structure · 3 models · 1 observations
JetMoE
MyShell.ai / Princeton
1 structure · 1 models · 1 observations
JSB Chorales VAE
University of Porto / INESC-TEC
1 structure · 1 models · 1 observations
Jude & Hennig (2020) T-maze LSTM agent
Research (Jude & Hennig 2020, University of Edinburgh)
1 structure · 1 models · 1 observations
Poker Hand History Transformer (Kamel, Rastogi, Ma, Ranganathan & Zhu)
Algoverse AI Research / Waterloo / Berkeley
1 structure · 1 models · 1 observations
Karczewski et al. (2026) custom molecular diffusion model
custom (paper-trained)
1 structure · 1 models · 1 observations
Apple Health Foundation Models (PPG/Accel)
Apple (Katuwal, Koparkar, Abbaspourazad, Mishra & Kirthivasan)
1 structure · 1 models · 1 observations
Kim et al. (2025) Custom Continual-Learning Networks
Research (Kim, Kim & Sohn; custom-trained from scratch, arXiv:2505.20970, ICML 2025)
1 structure · 2 models · 1 observations
Kimi Linear
Moonshot AI
1 structure · 1 models · 1 observations
Kiseleva (2026) Boundary-Aware Quantization Toy Classifiers
Research (Kiseleva, Innopolis University, 2026; custom-trained small classifiers under post-training and quantization-aware quantization, arXiv:2607.01478)
1 structure · 1 models · 1 observations
LaBSE
Google
1 structure · 1 models · 1 observations
Lanza et al. (2026) Continual-Learning ResNet-18 Feature Extractors
Research (Lanza, Pereira, Miozzo, Angelats & Dini; trained from scratch, arXiv:2602.06586)
1 structure · 2 models · 1 observations
LeNet
classic CNN architecture (LeCun et al.)
1 structure · 1 models · 1 observations
VoxGenesis
Hong Kong Polytechnic University / UC Berkeley (Lin, He, Mak, Lian & Lee)
1 structure · 1 models · 1 observations
Ling
inclusionAI
1 structure · 1 models · 1 observations
Passive object-state world models (Liu & Chen 2026)
Independent / academic (Fudan University)
1 structure · 2 models · 1 observations
LLaVA-OneVision
ByteDance / LMMs-Lab
1 structure · 2 models · 2 observations
Brain-to-Speech Decoder (Conv1D + BiGRU + HiFi-GAN, trained on VOCALMIND sEEG)
University of Maryland College Park (Maghsoudi & Mishra)
1 structure · 1 models · 1 observations
Mannes (2026) Positional-Encoding ViT-S Ablation Suite
Research (Mannes, 2026; custom-trained from scratch on ImageNet-100 across five positional-encoding variants, arXiv:2606.00124)
1 structure · 1 models · 1 observations
Custom Research Matrix-Factorization Recommender (purpose-built dot-product recommender for embedding-geometry studies)
various (academic)
1 structure · 1 models · 1 observations
Maze-Solving Transformer
Research (Ivanitskiy et al. 2023, custom-trained on synthetic maze-solving token sequences)
1 structure · 4 models · 1 observations
McCracken, Moisescu-Pareja, Letourneau, Precup & Love (2025) modular-addition networks
McCracken, Moisescu-Pareja, Letourneau, Precup & Love (2025)
1 structure · 1 models · 1 observations
Minegishi, Feng, Furuta et al. (2026) Analogical-Reasoning Toy Transformer
Research (Minegishi et al., ICML 2026; custom-trained from scratch on synthetic entity-relation analogies, arXiv:2602.01992)
1 structure · 1 models · 1 observations
Ministral
Mistral AI
1 structure · 1 models · 1 observations
Controlled Geospatial SSL Encoders (DINO/MAE/MoCo on SSL4EO Sentinel-1/2)
Johns Hopkins Applied Physics Lab / Johns Hopkins University
1 structure · 1 models · 1 observations
Moirai
Salesforce
1 structure · 1 models · 1 observations
Molmo
Allen Institute for AI
1 structure · 1 models · 1 observations
MOMENT
Carnegie Mellon University / Autodesk
1 structure · 1 models · 2 observations
mT5
Google
1 structure · 1 models · 1 observations
MultiBERTs
Google Research
1 structure · 5 models · 1 observations
NanoGPT Causal-Attention, No Positional Encoding (Causal-NoPE)
Research (Zuo, Guerzhoy & Guerzhoy 2025; custom-trained NanoGPT variants with causal attention and no positional encodings, on synthetic position-sensitive tasks)
1 structure · 1 models · 1 observations
NeuralDaredevil
mlabonne
1 structure · 1 models · 1 observations
NFNet (Normalizer-Free Networks)
DeepMind
1 structure · 1 models · 1 observations
Nucleotide Transformer
InstaDeep / NVIDIA / TUM
1 structure · 1 models · 1 observations
NVILA
NVIDIA
1 structure · 1 models · 1 observations
OpenFlamingo
LAION / University of Washington / Stanford / others (open-source)
1 structure · 3 models · 2 observations
Ovis
Alibaba
1 structure · 1 models · 1 observations
PaliGemma
Google
1 structure · 2 models · 1 observations
Pellegrino & Chadwick (2025) Task-Trained Continuous-Time RNNs
Research (Pellegrino & Chadwick, NeurIPS 2025; custom-trained from scratch, arXiv:2512.04310)
1 structure · 2 models · 1 observations
PhonSSM
independent research
1 structure · 1 models · 1 observations
Pi (Physical Intelligence VLA)
Physical Intelligence
1 structure · 2 models · 3 observations
PLLuM
PLLuM Consortium
1 structure · 1 models · 1 observations
Principal Odor Map GNN
Google Research / Osmo
1 structure · 1 models · 1 observations
Poolside Laguna
Poolside
1 structure · 2 models · 1 observations
ProSoRo (Proprioceptive Soft Robot)
Southern University of Science and Technology / Shanghai Jiao Tong University
1 structure · 1 models · 1 observations
ProtTrans
RostLab (Technical University of Munich)
1 structure · 4 models · 1 observations
Rangamani (2025) Modular-Addition RNN
Research (Rangamani 2025; custom-trained from scratch on modular addition, arXiv:2503.22059)
1 structure · 1 models · 1 observations
Reddy (2026) custom toy RNNs (Elman/GRU/LSTM, repeat-copy task)
custom (paper-trained)
1 structure · 4 models · 1 observations
ResMLP
Meta AI
1 structure · 1 models · 1 observations
RoboRefer
academic (RoboRefer authors)
1 structure · 1 models · 1 observations
ruBERT / ruRoBERTa (ai-forever)
SberDevices / ai-forever
1 structure · 3 models · 1 observations
RWKV
RWKV community / Recursal
1 structure · 1 models · 1 observations
Saanum et al. (2024) Custom Contrastive World Models
Research (Saanum, Schulze Buschoff, Dayan & Schulz; custom-trained from scratch, arXiv:2410.04940)
1 structure · 2 models · 1 observations
Saito & Matsubara (2025) Custom MNIST Diffusion Model
Research (Saito & Matsubara; custom-trained from scratch on MNIST, arXiv:2504.20288)
1 structure · 1 models · 1 observations
Saponati et al. (2025) Custom Encoder/Decoder Transformers
Research (Saponati, Sager, Vilimelis Aceituno, Stadelmann & Grewe; trained from scratch, arXiv:2502.10927)
1 structure · 2 models · 1 observations
scFoundation
BioMap
1 structure · 1 models · 1 observations
Dolph2Vec (Wav2Vec2-style SSL model for dolphin vocalizations)
ENS Paris / Institut du Cerveau / Champalimaud Foundation
1 structure · 1 models · 1 observations
Shai et al. (2024) Custom Epsilon-Machine Transformers
Research (Shai, Marzen, Teixeira, Gietelink Oldenziel & Riechers; custom-trained from scratch, arXiv:2405.15943, NeurIPS 2024 spotlight)
1 structure · 1 models · 1 observations
Ordinal Local-Comparison Toy Transformer
Research (Singh 2026; custom-trained from scratch on adjacent-pair comparisons over total orders of N=10/15/20 synthetic entities)
1 structure · 1 models · 1 observations
SlotContrast
research community
1 structure · 1 models · 1 observations
SMI-TED
IBM Research
1 structure · 1 models · 1 observations
SmolLM
Hugging Face
1 structure · 1 models · 1 observations
SmolLM3
Hugging Face
1 structure · 1 models · 2 observations
SpeechTokenizer
Fudan University
1 structure · 1 models · 1 observations
SphereFace CNN
Liu, Wen, Yu, Li, Raj & Song (academic)
1 structure · 1 models · 1 observations
SPOT (Self-Training with Patch-Order Permutation)
research community
1 structure · 1 models · 1 observations
Stable Audio
Stability AI
1 structure · 1 models · 2 observations
Stella
Dun Zhang
1 structure · 1 models · 2 observations
ST-GCN (Spatio-Temporal Graph Convolutional Network)
open-source (research)
1 structure · 1 models · 1 observations
StyleNeRF
various (academic)
1 structure · 1 models · 1 observations
Sudoku Transformer
Research (Kniazev & Fijalkow 2026; architecture following Giannoulis, Pantis & Tzamos 2026, custom-trained from scratch on Norvig-style Sudoku solving traces)
1 structure · 1 models · 1 observations
Sussillo & Barak (2013) trained toy RNNs
Research (Sussillo & Barak 2013, custom-trained continuous-time RNNs)
1 structure · 1 models · 1 observations
Swaroop (2026) modular-arithmetic ReLU MLP
Research (Swaroop 2026; custom-trained from scratch on modular arithmetic)
1 structure · 1 models · 1 observations
T0
BigScience
1 structure · 1 models · 1 observations
TAPE (Tasks Assessing Protein Embeddings)
UC Berkeley
1 structure · 2 models · 1 observations
Tian (2024/2025) Quadratic-Activation Toy MLP
Research (Tian, NeurIPS 2025; custom-trained from scratch on synthetic modular-addition/Abelian-group tasks, arXiv:2410.01779)
1 structure · 1 models · 1 observations
TinyLlama
TinyLlama project
1 structure · 1 models · 1 observations
TinyModel (TinyStories-trained)
Noa Nabeshima (independent)
1 structure · 1 models · 1 observations
Toy Superposition Autoencoder (Elhage et al.)
Anthropic
1 structure · 1 models · 1 observations
Trinity
1 structure · 1 models · 1 observations
UnifiedQA
Allen Institute for AI
1 structure · 1 models · 1 observations
Vanilla tanh RNN (task-trained, N=100 neurons)
various (academic, computational-neuroscience tradition)
1 structure · 2 models · 1 observations
VAST
Renmin University of China / Baidu
1 structure · 2 models · 1 observations
Vemula (2026) Custom Decoder-Only Transformers (FineWeb-Edu, from scratch)
Research (Vemula; custom-trained from scratch, arXiv:2606.20743)
1 structure · 2 models · 1 observations
Ventura et al. (2025) Custom Score-Based Diffusion Models
Research (Ventura, Achilli, Silvestri, Lucibello & Ambrogioni; custom-trained from scratch, arXiv:2410.05898)
1 structure · 3 models · 1 observations
VideoPrism
Google DeepMind
1 structure · 1 models · 1 observations
VideoSAUR
research community
1 structure · 1 models · 1 observations
Voita et al. (2019) objective-matched Transformers (MT/LM/MLM)
Voita, Sennrich & Titov (2019), EMNLP-IJCNLP
1 structure · 3 models · 1 observations
VST
Academic
1 structure · 1 models · 1 observations
FNN (Foundation Model of Neural Activity)
Wang et al. (2025, Nature); MICrONS consortium data
1 structure · 1 models · 1 observations
WavTokenizer
Zhejiang University / Alibaba
1 structure · 1 models · 1 observations
Tolman-Eichenbaum Machine (TEM)
Whittington, Muller, Mark, Chen, Barry, Burgess & Behrens (2020), Cell
1 structure · 1 models · 1 observations
Bach WTC Autoencoder
American University of Beirut
1 structure · 1 models · 1 observations
Wu, Geiger & Millière (2025) Variable-Binding Toy Transformer
Research (Wu, Geiger & Millière, ICML 2025; custom-trained from scratch on synthetic variable-assignment programs, arXiv:2505.20896)
1 structure · 1 models · 1 observations
Euclid Q1 Galaxy Morphology Models (Zoobot ConvNeXt-Nano + self-supervised ViT-S MAE)
STScI / Johns Hopkins / University of Toronto (Wu & Walmsley)
1 structure · 1 models · 1 observations
XGLM
Meta AI
1 structure · 1 models · 1 observations
XLNet
Google/CMU
1 structure · 1 models · 1 observations
xLSTM
NXAI / JKU Linz
1 structure · 1 models · 1 observations
Mini-ICL toy transformers (custom, Yan, Yang & Zhong 2026)
University of Wisconsin-Madison / University of Chicago (custom-trained)
1 structure · 1 models · 1 observations
Synthetic GPT-2-style ICL transformers (custom, Yang, Lin, Lee, Papailiopoulos & Nowak 2025)
University of Wisconsin-Madison (custom-trained)
1 structure · 1 models · 1 observations
Zephyr
HuggingFace H4
1 structure · 1 models · 2 observations
BLOOMZ
BigScience
0 structures · 5 models · 1 observations
Convolutional neural network (generic)
various
0 structures · 1 models · 2 observations
Cora Graph Convolutional Network (varied-hyperparameter ensemble)
research/toy
0 structures · 1 models · 1 observations
EvoDiff
Microsoft Research
0 structures · 1 models · 1 observations
Grid Walker RNN baseline
Research (Brenner, Knösche & Scherf 2026; LSTM/GRU baselines custom-trained from scratch on the same synthetic 2D grid-walk sequences)
0 structures · 2 models · 0 observations
Grid Walker Transformer
Research (Brenner, Knösche & Scherf 2026; TransformerLens HookedTransformer, custom-trained from scratch on synthetic 2D grid-walk sequences)
0 structures · 2 models · 0 observations
ModernCamemBERT
Inria (ALMAnaCH)
0 structures · 1 models · 0 observations
Moschella et al. (2022) image (variational) autoencoder
Sapienza University of Rome
0 structures · 1 models · 1 observations
OpenLLaMA
OpenLM Research
0 structures · 3 models · 2 observations
ProGen2
Salesforce Research
0 structures · 1 models · 1 observations
RexNet
NAVER
0 structures · 1 models · 1 observations
Transformer (generic)
various
0 structures · 1 models · 1 observations