Перейти к содержимому
VinumExMachina Атлас ИИ в вине
Выберите язык: English

АтласБенчмаркиЛидерборд

Лидерборд OenoBench

Раздел § 3.2
Статус опубликовано
Обновлено
Языки EN · RU
Объём 72 зн. · 1 мин

OenoBench оценивает 16 конфигураций моделей на 3 266 вопросах с выбором ответа. Корпус покрывает виноградарство, виноделие, винный бизнес, винные регионы мира, сорта винограда и производителей. Используйте фильтры, чтобы отсечь лидерборд по домену, уровню сложности или признаку, отвечается ли вопрос из параметрической памяти (closed-book) или требует контекстного рассуждения. Остальные вкладки раскрывают ещё три среза того же прогона: эффект расширенного reasoning, самопредпочтение модели и экономическую эффективность.

Рис.02
Рис. 02Где прибор проседаетпоказание 1 из 3 · o3 · два режима · n 1 601 / 1 665

Ступенчатая диаграмма. Корпус упорядочен по closed-book разбиению: сначала идут вопросы, отвечаемые из параметрических знаний (1 601), затем — требующие контекстного рассуждения (1 665). Перо держит 0,974 в первом режиме и 0,703 во втором — падение 0,271 у o3 — внутри полосы ±1 биномиальной стандартной ошибки, 0,0159 и 0,0457, при опорном окне 100. Штриховые линии — среднее по всем конфигурациям (16): 0,896 и 0,570, падение 0,326. Точность — от 0,30 до 1,00. Перо рисует ступень, а не скользящее среднее: прогон публикует агрегаты по режимам, а не результаты по отдельным вопросам.

Δ 0,2710,300,400,500,600,700,800,901,0001 0001 6012 0003 0003 266CLOSED-BOOK (ПАРАМЕТРИЧЕСКИЕ) · n 1 601КОНТЕКСТНОЕ РАССУЖДЕНИЕ · n 1 6650,9740,7030,8960,570ось: точность · абсцисса: корпус в порядке closed-book
±1 SE, биномиальная, при опорном окне 100среднее по всем конфигурациям (16)сплошное перо: o3 · OpenAI · effort
Вывод 1. Каждая конфигурация проседает на вопросах, требующих рассуждения, а не припоминания. o3 теряет 0,271; среднее по всем конфигурациям (16) — 0,326. Полоса шума расширяется вместе с падением: контекстный режим измеряется менее точно при том же опорном окне. Перо рисует ступень, а не скользящее среднее: прогон публикует агрегаты по режимам, а не результаты по отдельным вопросам.
Рис.03
Рис. 03Разрыв не сокращается с рангомвсе конфигурации (16) · по общей точности

Диаграмма «гантели». Конфигурации (16) упорядочены по общей точности, от первой к последней, каждая занимает одну строку. Отрезок соединяет точность на вопросах, требующих контекстного рассуждения (n 1 665), с точностью на closed-book вопросах (n 1 601) по шкале от 0,30 до 1,00; падение между ними напечатано справа. Наименьшее падение — у GPT-5, 0,266; наибольшее — у DeepSeek-V3, 0,396. Лидер по общей точности — o3.

0,300,400,500,600,700,800,901,00ТОЧНОСТЬΔ ПАДЕНИЕКОНФИГУРАЦИЯo30,271GPT-50,266Gemini 2.5 Pro (thinking)0,290Gemini 2.5 Pro0,300Claude Opus 4.70,319Claude Opus 4.7 (thinking)0,323GPT-5 mini0,319DeepSeek-R10,337Gemini 2.5 Flash0,343DeepSeek-V30,396Mistral Large 24110,358Qwen 2.5 72B0,381Llama 3.3 70B0,364Llama 3.1 8B0,304Qwen 2.5 7B0,311Claude Haiku 4.50,331
Closed-book (параметрические) · n 1 601Контекстное рассуждение · n 1 665
От первого места к последнему длина отрезка почти не меняется. Наименьший разрыв — у GPT-5 (0,266), наибольший — у DeepSeek-V3 (0,396).
OenoBench · v2026-05-0416 конфигураций моделей · 3 266 вопросов в шести винных доменах
Домен
Сложность
Closed-book vs контекст
МодельТочность
  1. 1
    o3OpenAIeffort
    83.6%
  2. 2
    GPT-5OpenAI
    82.8%
  3. 3
    Gemini 2.5 Pro (thinking)Googlethinking
    82.6%
  4. 4
    Gemini 2.5 ProGoogle
    81.7%
  5. 5
    Claude Opus 4.7Anthropic
    81.0%
  6. 6
    Claude Opus 4.7 (thinking)Anthropicthinking
    81.0%
  7. 7
    GPT-5 miniOpenAI
    78.4%
  8. 8
    DeepSeek-R1DeepSeekthinking
    77.1%
  9. 9
    Gemini 2.5 FlashGoogle
    75.1%
  10. 10
    DeepSeek-V3DeepSeek
    70.3%
  11. 11
    Mistral Large 2411Mistral AI
    69.1%
  12. 12
    Qwen 2.5 72BAlibaba
    67.4%
  13. 13
    Llama 3.3 70BMeta
    67.1%
  14. 14
    Llama 3.1 8BMeta
    60.5%
  15. 15
    Qwen 2.5 7BAlibaba
    57.0%
  16. 16
    Claude Haiku 4.5Anthropic
    53.3%

Все цифры выше берутся из одного версионированного файла прогона, опубликованного под лицензией CC BY 4.0: скачать полные результаты (JSON, 23 КБ). Файлы прогонов накапливаются, а не перезаписываются, поэтому эта ссылка продолжит работать и после публикации следующих прогонов — ссылайтесь на датированный файл, а не на страницу лидерборда.

Отдельной статьи о бенчмарке нет. Этот лидерборд, файл прогона, на котором он построен, и страница OenoBench — устройство корпуса, мульти-модельная генерация, ИИ-валидация и стратегия снижения смещения — и есть опубликованное описание бенчмарка.