automated evaluationlanguage-model rankingpublished Aug 24, 2026 · arXiv:2608.20574FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth