OenoBench оценивает 16 конфигураций моделей на 3 266 вопросах с выбором ответа. Корпус покрывает виноградарство, виноделие, винный бизнес, винные регионы мира, сорта винограда и производителей. Используйте фильтры, чтобы отсечь лидерборд по домену, уровню сложности или признаку, отвечается ли вопрос из параметрической памяти (closed-book) или требует контекстного рассуждения. Остальные вкладки раскрывают ещё три среза того же прогона: эффект расширенного reasoning, самопредпочтение модели и экономическую эффективность.
Ступенчатая диаграмма. Корпус упорядочен по closed-book разбиению: сначала идут вопросы, отвечаемые из параметрических знаний (1 601), затем — требующие контекстного рассуждения (1 665). Перо держит 0,974 в первом режиме и 0,703 во втором — падение 0,271 у o3 — внутри полосы ±1 биномиальной стандартной ошибки, 0,0159 и 0,0457, при опорном окне 100. Штриховые линии — среднее по всем конфигурациям (16): 0,896 и 0,570, падение 0,326. Точность — от 0,30 до 1,00. Перо рисует ступень, а не скользящее среднее: прогон публикует агрегаты по режимам, а не результаты по отдельным вопросам.
Диаграмма «гантели». Конфигурации (16) упорядочены по общей точности, от первой к последней, каждая занимает одну строку. Отрезок соединяет точность на вопросах, требующих контекстного рассуждения (n 1 665), с точностью на closed-book вопросах (n 1 601) по шкале от 0,30 до 1,00; падение между ними напечатано справа. Наименьшее падение — у GPT-5, 0,266; наибольшее — у DeepSeek-V3, 0,396. Лидер по общей точности — o3.
- 1o3OpenAIeffort83.6%
- 2GPT-5OpenAI82.8%
- 3Gemini 2.5 Pro (thinking)Googlethinking82.6%
- 4Gemini 2.5 ProGoogle81.7%
- 5Claude Opus 4.7Anthropic81.0%
- 6Claude Opus 4.7 (thinking)Anthropicthinking81.0%
- 7GPT-5 miniOpenAI78.4%
- 8DeepSeek-R1DeepSeekthinking77.1%
- 9Gemini 2.5 FlashGoogle75.1%
- 10DeepSeek-V3DeepSeek70.3%
- 11Mistral Large 2411Mistral AI69.1%
- 12Qwen 2.5 72BAlibaba67.4%
- 13Llama 3.3 70BMeta67.1%
- 14Llama 3.1 8BMeta60.5%
- 15Qwen 2.5 7BAlibaba57.0%
- 16Claude Haiku 4.5Anthropic53.3%
Все цифры выше берутся из одного версионированного файла прогона, опубликованного под лицензией CC BY 4.0: скачать полные результаты (JSON, 23 КБ). Файлы прогонов накапливаются, а не перезаписываются, поэтому эта ссылка продолжит работать и после публикации следующих прогонов — ссылайтесь на датированный файл, а не на страницу лидерборда.
Отдельной статьи о бенчмарке нет. Этот лидерборд, файл прогона, на котором он построен, и страница OenoBench — устройство корпуса, мульти-модельная генерация, ИИ-валидация и стратегия снижения смещения — и есть опубликованное описание бенчмарка.