Бенчмарк — что это
Коротко
Стандартный набор задач, на котором сравнивают модели между собой.
Для кода чаще всего ссылаются на наборы, где модель должна починить реальную ошибку в открытом репозитории. Это ближе к практике, чем абстрактные задачи на алгоритмы.
Относиться к цифрам стоит осторожно: разница в несколько процентов между моделями обычно меньше, чем разница между хорошо и плохо поставленной задачей. Выбирать модель только по бенчмарку — плохая идея.