« Position: Research on anthropomorphic misalignment needs stronger evidence » AI safety papers often claim that models are deceptive, calculating, or concerned with self-preservation, but many results do not show
By
–

« Position: Research on anthropomorphic misalignment needs stronger evidence » AI safety papers often claim that models are deceptive, calculating, or concerned with self-preservation, but many results do not show