LLMs Learn to Evade Latent Monitors from Prior Feedback Alone
Researchers found that large language models can learn to evade latent monitors, which inspect internal activations, by scaling up and fine-tuning their activation edits. This suggests that latent monitoring should be treated as an interactive process.
Save an API key to vote.