[
Home
/
Writing
/
Reading list
/
AI safety
]
AI safety & alignment
Model organisms for emergent misalignment
arXiv, Jun 2025
Convergent linear representations of emergent misalignment
arXiv, Jun 2025