Loading views...

AI Confession

Creator
Creator
Seonglae ChoSeonglae Cho
Created
Created
2026 Jan 1 17:3
Editor
Edited
Edited
2026 Mar 22 0:52
Refs
Refs
 
 
 
 
 
 
AI cyber attack capability is better than human pen-tester
MLSN #19: Honesty, Disempowerment, & Cybersecurity
Also, a new AI safety fellowship for experienced researchers
MLSN #19: Honesty, Disempowerment, & Cybersecurity
Backtracking: Reset token as a control tool 2024
arxiv.org

SRFT: Self-Report Fine-Tuning

Hidden objective execution ability remains intact → Not actually better behaved, just better at confessing. However, honesty is confirmed to generalize strongly through training
arxiv.org
 

Recommendations