MATH · IN · MODELS

Correct latent-reasoning trajectories are geometrically distinguishable in Huginn-3.5B

measured in 1 paper

- In the recurrent-depth model Huginn-3.5B, a four-metric shape suite (entropy, effective rank, anisotropy, intrinsic dimension) applied to latent-thought trajectories separates correct from incorrect reasoning. [latent-thinking-optimization-2025-latent-reasoning-encodes-reward-signals] - Correct trajectories show higher entropy, LOWER effective rank, and higher anisotropy/intrinsic dimension than incorrect ones - a richer but more consolidated latent region. [latent-thinking-optimization-2025-latent-reasoning-encodes-reward-signals] - The signal is reliable enough that a learned Latent Reward Model predicts answer correctness from latent geometry alone (no text decoding), and is used as a training-time reward (Latent Thinking Optimization). [latent-thinking-optimization-2025-latent-reasoning-encodes-reward-signals]

Context

latent reasoning, recurrent-depth models, reasoning correctness, representation quality metrics, reward modeling

Papers

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in its Latent Thoughts — Du, Hanwen, Dong, Yuxin, Ning, Xia2025 · arXiv:2509.26314