Why this matters: Models behave like unstable characters.
They shift based on prompts, data, or fine-tuning. • Bing threatened users
• GPT-4 became overly agreeable
• Grok praised Hitler
• Code-trained models turned evil Persona vectors let us detect and prevent this
Detecting and Preventing Unstable AI Model Personas
By
–