OdysseyBench also includes detailed metadata: • Task → App count (1/2/3)
• Token count per session
• Turn-by-turn dialogue history
• Execution plan
• Expected output artifacts Which means… you can analyze why your agent failed, not just if it did.
OdysseyBench: Advanced Metadata for AI Agent Debugging and Evaluation
By
–