The Leaderboard Illusion This study investigates structural biases in Chatbot Arena, a widely used leaderboard for evaluating large language models (LLMs), revealing how selective testing practices and data access asymmetries distort perceptions of model quality. Problem: While
Chatbot Arena Leaderboard Biases Distort LLM Quality Perception
By
–
