Texonom
Texonom
/
Engineering
Engineering
/Data Engineering/Artificial Intelligence/AI Risk/AI Alignment/Explainable AI/Interpretable AI/Mechanistic interpretability/Activation Engineering/Activation Decomposition/Sparse Autoencoder/SAE Training/
SAE Decoder Loss
Loading views...
Search

SAE Decoder Loss

Creator
Creator
Seonglae ChoSeonglae Cho
Created
Created
2025 Mar 13 17:23
Editor
Editor
Seonglae ChoSeonglae Cho
Edited
Edited
2025 May 20 18:46
Refs
Refs
SAE Feature Direction

SAE Feature Direction Loss

 
 

Tanh loss

Achieves Pareto-optimality by "minimizing feature activations while maintaining low output error"
Circuit Tracing: Revealing Computational Graphs in Language Models
We describe an approach to tracing the “step-by-step” computation involved when a model responds to a single prompt.
Circuit Tracing: Revealing Computational Graphs in Language Models
https://transformer-circuits.pub/2025/attribution-graphs/methods.html
Circuit Tracing: Revealing Computational Graphs in Language Models
 
 
 

Backlinks

SAE FeatureSAE Loss

Recommendations

Texonom
Texonom
/
Engineering
Engineering
/Data Engineering/Artificial Intelligence/AI Risk/AI Alignment/Explainable AI/Interpretable AI/Mechanistic interpretability/Activation Engineering/Activation Decomposition/Sparse Autoencoder/SAE Training/
SAE Decoder Loss
Copyright Seonglae Cho·Sign in