MATH · IN · MODELS

Concept probes show chess concepts emerge at different training points

measured in 1 paper

Hammersborg & Strumke train two custom self-play RL chess agents and apply TCAV-style L1-penalized logistic-regression concept probes with a random-label control for four chess concepts [hammersborg-strumke-2022-reinforcement-learning-in-an-adaptable-chess-environment-for-detecting-human-understandable-concepts] Material-advantage and mate-threat are decodable from initialization in the 6x6 ResNet agent (via skip connections), while concepts plateau after ~100 iterations in the 4x5 agent [hammersborg-strumke-2022-reinforcement-learning-in-an-adaptable-chess-environment-for-detecting-human-understandable-concepts] The work replicates McGrath et al.'s AlphaZero concept-probing methodology at a smaller toy scale [hammersborg-strumke-2022-reinforcement-learning-in-an-adaptable-chess-environment-for-detecting-human-understandable-concepts]

Context

chess, concept-probing

Papers

Reinforcement Learning in an Adaptable Chess Environment for Detecting Human-understandable Concepts — Hammersborg, Patrik, Strumke, Inga2022 · arXiv:2211.05500