Classical accuracy metrics assume one correct answer per question. Language models (LLMs) and agentic AI break that assumption. Learn about evaluation approaches emerging for scientific AI.