Перейти к содержимому
VinumExMachina Атлас ИИ в вине
Выберите язык: English

АтласБенчмарки

OenoBench

Раздел § 3.1
Статус опубликовано
Обновлено
Языки EN · RU
Объём 72 зн. · 3 мин

OenoBench — бенчмарк винных знаний для больших языковых моделей. Текущий релиз содержит 3 266 вопросов с выбором ответа в шести доменах — виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда и производители — на четырёх уровнях сложности, откалиброванных по лестнице WSET / Court of Master Sommeliers. Оценено 16 конфигураций моделей (фронтирные и open-source), суммарно 52 256 прогонов вопросов, и каждый релиз публикуется как версионированный JSON-файл в этом репозитории — чтобы исторические прогоны оставались воспроизводимыми.

Результаты — на лидерборде: ранжированная точность с фильтрами по домену, уровню сложности и режиму closed-book / контекст, плюс три анализа, посчитанных из того же прогона — эффект расширенного reasoning, самопредпочтение и стоимость. Каждый рисунок там генерируется из файла прогона, а не нарисован однажды, поэтому разойтись с данными он не может.

Как собирается корпус вопросов

Четыре этапа: автоматизировано там, где автоматизация надёжна, и с человеком там, где нужно суждение.

  • Сбор данных. Отбор авторитетных источников по всем шести доменам с явными квотами покрытия — чтобы ни один поддомен не доминировал, а каждый факт ссылался на внешний источник.
  • Мульти-модельная генерация. Пять семейств моделей (Claude, GPT, Gemini, Llama, Qwen) плюс детерминированные шаблоны формируют кандидатные вопросы. Это центральный приём снижения смещения, а не способ ускориться: ни одно семейство не пишет непропорциональную долю вопросов, на которых его потом оценивают.
  • ИИ-валидация. Аудит девятью агентами: фактическая корректность, однозначность, утечка из промпта, качество дистракторов, баланс по странам, дословное копирование источника. Сомнительные кандидаты отбрасываются или переписываются.
  • Человеческий обзор. Выборочная проверка по каждому стратифицированному поддомену, разрешение спорных случаев и подпись под релизом.

Что показывает лидерборд

Общая точность — одно число, и самое неинтересное. Под ним четыре ортогональных среза: по доменам, по уровням сложности, closed-book против контекста (ответ достаётся из параметрической памяти или требует рассуждения по поданному контексту) и эффект расширенного reasoning — одна и та же базовая модель с ним и без него. Самопредпочтение — точность модели на вопросах своего семейства против чужих — вынесено отдельно: это свойство устройства самого бенчмарка, а не модели.

Разница называется находкой только тогда, когда её доверительный интервал не включает ноль, и рисунок с карточкой рядом берут этот вывод из одной и той же функции — разойтись на экране они не могут.

Что не публикуется

Отдельной статьи о бенчмарке нет: эта страница и версионированный JSON-релиз, на котором строится лидерборд, и есть опубликованное описание. Полные промпты, версии моделей-генераторов и статистика согласованности проверок на этом этапе не публикуются, а гистограммы в файле прогона дают в сумме чуть больше, чем число вопросов, — известная особенность исследовательских данных, оставленная видимой, а не подогнанная руками.

До 2026-08-12 это были две страницы: обзор и методология. Бенчмарк, метод которого лежит на второй странице, — это бенчмарк, метод которого можно не читать.