Атлас/Бенчмарки
OenoBench
OenoBench — бенчмарк винных знаний для больших языковых моделей. Текущий релиз содержит 3 266 вопросов с выбором ответа в шести доменах — виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда и производители — на четырёх уровнях сложности, откалиброванных по лестнице WSET / Court of Master Sommeliers. Оценено 16 конфигураций моделей (фронтирные и open-source), суммарно 52 256 прогонов вопросов, и каждый релиз публикуется как версионированный JSON-файл в этом репозитории — чтобы исторические прогоны оставались воспроизводимыми.
Результаты — на лидерборде: ранжированная точность с фильтрами по домену, уровню сложности и режиму closed-book / контекст, плюс три анализа, посчитанных из того же прогона — эффект расширенного reasoning, самопредпочтение и стоимость. Каждый рисунок там генерируется из файла прогона, а не нарисован однажды, поэтому разойтись с данными он не может.
Как собирается корпус вопросов
Четыре этапа: автоматизировано там, где автоматизация надёжна, и с человеком там, где нужно суждение.
- Сбор данных. Отбор авторитетных источников по всем шести доменам с явными квотами покрытия — чтобы ни один поддомен не доминировал, а каждый факт ссылался на внешний источник.
- Мульти-модельная генерация. Пять семейств моделей (Claude, GPT, Gemini, Llama, Qwen) плюс детерминированные шаблоны формируют кандидатные вопросы. Это центральный приём снижения смещения, а не способ ускориться: ни одно семейство не пишет непропорциональную долю вопросов, на которых его потом оценивают.
- ИИ-валидация. Аудит девятью агентами: фактическая корректность, однозначность, утечка из промпта, качество дистракторов, баланс по странам, дословное копирование источника. Сомнительные кандидаты отбрасываются или переписываются.
- Человеческий обзор. Выборочная проверка по каждому стратифицированному поддомену, разрешение спорных случаев и подпись под релизом.
Что показывает лидерборд
Общая точность — одно число, и самое неинтересное. Под ним четыре ортогональных среза: по доменам, по уровням сложности, closed-book против контекста (ответ достаётся из параметрической памяти или требует рассуждения по поданному контексту) и эффект расширенного reasoning — одна и та же базовая модель с ним и без него. Самопредпочтение — точность модели на вопросах своего семейства против чужих — вынесено отдельно: это свойство устройства самого бенчмарка, а не модели.
Разница называется находкой только тогда, когда её доверительный интервал не включает ноль, и рисунок с карточкой рядом берут этот вывод из одной и той же функции — разойтись на экране они не могут.
Что не публикуется
Отдельной статьи о бенчмарке нет: эта страница и версионированный JSON-релиз, на котором строится лидерборд, и есть опубликованное описание. Полные промпты, версии моделей-генераторов и статистика согласованности проверок на этом этапе не публикуются, а гистограммы в файле прогона дают в сумме чуть больше, чем число вопросов, — известная особенность исследовательских данных, оставленная видимой, а не подогнанная руками.
До 2026-08-12 это были две страницы: обзор и методология. Бенчмарк, метод которого лежит на второй странице, — это бенчмарк, метод которого можно не читать.