Texonom
Texonom
/
Engineering
Engineering
/Data Engineering/Artificial Intelligence/AI Risk/AI Alignment/Explainable AI/Interpretable AI/Mechanistic interpretability/Activation Engineering/Activation Decomposition/Sparse Autoencoder/SAE Feature/SAE Steering/
ControlRL
Loading views...
Search

ControlRL

Creator
Creator
Seonglae ChoSeonglae Cho
Created
Created
2026 Sep 4 13:49
Editor
Editor
Seonglae ChoSeonglae Cho
Edited
Edited
2026 Sep 4 13:51
Refs
Refs
 
 
 
 
 
mechreward
OpenInterpretability • Updated 2026 Aug 18 7:15
Control Reinforcement Learning: Interpretable Token-Level Steering...
Sparse autoencoders (SAEs) decompose language model activations into interpretable features, but existing methods reveal only which features activate, not which change model outputs when...
Control Reinforcement Learning: Interpretable Token-Level Steering...
https://arxiv.org/abs/2602.10437
Control Reinforcement Learning: Interpretable Token-Level Steering...
Activation Steering in 2026: A Practitioner’s Field Guide
I’ve been working with steering vectors for months. Here’s what actually works in practice, what fails in ways nobody warned me about, and the honest playbook for getting started.
Activation Steering in 2026: A Practitioner’s Field Guide
https://subhadipmitra.com/blog/2026/activation-steering-field-guide/
Activation Steering in 2026: A Practitioner’s Field Guide
 

Backlinks

Agent State Machine

Recommendations

Texonom
Texonom
/
Engineering
Engineering
/Data Engineering/Artificial Intelligence/AI Risk/AI Alignment/Explainable AI/Interpretable AI/Mechanistic interpretability/Activation Engineering/Activation Decomposition/Sparse Autoencoder/SAE Feature/SAE Steering/
ControlRL
Copyright Seonglae Cho·