MATH · IN · MODELS

A moral-framework probe decodes and steers mid-reasoning ethics

measured in 1 paper

Huang, Kwak & An train linear probes on last-token residual-stream states across all 81 layers of Llama-3.3-70B and Qwen2.5-72B to predict a 5-dimensional moral-framework distribution [huang-etal-2026-understanding-moral-reasoning-trajectories-in-llms] Framework encoding localizes to model-specific layers (63/81 for Llama-3.3-70B, 17/81 for Qwen2.5-72B), achieving 13.8-22.6% lower KL divergence than a training-prior baseline [huang-etal-2026-understanding-moral-reasoning-trajectories-in-llms] Steering along the probe direction modestly reduces the Framework Drift Rate (6.7% at Llama layer 6; 8.9% at Qwen layer 1) [huang-etal-2026-understanding-moral-reasoning-trajectories-in-llms] Probing and steering are restricted to the two open-weight models, while closed models (GPT-5, GPT-4o family) are evaluated only behaviorally [huang-etal-2026-understanding-moral-reasoning-trajectories-in-llms]

Context

moral-reasoning, chain-of-thought-geometry

Papers

Understanding Moral Reasoning Trajectories in LLMs: Toward Probing-Based Explainability — Huang, Fan, Kwak, Haewoon, An, Jisun2026 · arXiv:2603.16017