Что такое бенчмарки и как оценивать качество ответов нейросетей | РБК Тренды

Что такое бенчмарки и как оценивать качество ответов нейросетей Современный искусственный интеллект пишет код, пересказывает статьи и решает задачи. Но насколько хорошо он это […]

Что такое бенчмарки и как оценивать качество ответов нейросетей | РБК Тренды

Что такое бенчмарки и как оценивать качество ответов нейросетей

Фото: Shutterstock

Современный искусственный интеллект пишет код, пересказывает статьи и решает задачи. Но насколько хорошо он это делает? Чтобы узнать это, разработчики создают бенчмарки — специальные тесты для нейросетей

Об эксперте: Ирина Барская, руководитель службы аналитики и исследований в «Яндексе».

Что такое бенчмарки для ИИ

Бенчмарки (от англ. benchmark — «эталон») — это специализированные тесты, которые показывают, насколько хорошо искусственный интеллект выполняет разные задачи. С развитием больших языковых моделей (LLM) возникает необходимость оценивать их «ум». Самое простое решение — использовать для этого «человеческие» тесты, например стандартный ЕГЭ или аналогичный американский AP. Более глубокие знания можно проверять через профессиональные экзамены — USMLE для медиков или Uniform Bar Exam для юристов. Однако ИИ — не человек, процесс его «мышления» устроен иначе. LLM может решить сложную математическую задачу, но при этом ошибиться в вопросе, который не смутит даже ребенка. К примеру, на вопрос «Кто украл кораллы?» нейросеть вполне может ответить «Кража кораллов не является общеизвестным событием» вместо «Карл у Клары украл кораллы». Пользователи периодически сталкиваются с примерами отсутствия здравого смысла у LLM. Некоторые из них становятся вирусными: как совет AI Overview добавить в пиццу клей, чтобы с нее не соскальзывал сыр.

Фото:Freepik

Чтобы проверять знания ИИ в разных областях, умение решать задачи, здравый смысл и другие неочевидные навыки, исследователи создают бенчмарки. Этой работой занимаются академические группы, крупные компании вроде OpenAI, Anthropic и «Яндекса», а также сообщества энтузиастов-специалистов. Если вы читаете новость о выходе новой модели ИИ, в ней наверняка укажут одну или сразу несколько метрик прохождения бенчмарков, чтобы показать уровень нейросети. Бенчмарки GSM8K и MATH используют для оценки математических способностей, HumanEval — навыков программирования, DROP и RACE — понимания текста. Общую эрудицию часто оценивают по MMLU — тест из 16 тыс. вопросов позволяет проверить фактические знания в разных областях (математика, философия, право, медицина и так далее). Все это — «экзамены», разработанные специально для ИИ. Однако нередко исследователи сравнивают, как с такими же задачами справляется человек. Например, эксперт в соответствующей области сдает MMLU примерно на 90%. В 2020 году топовые нейросети справлялись примерно на 40%, но к 2024 году лучшие из них тоже достигли почти 90%. Из-за того, что модели ИИ постоянно совершенствуются, существующие бенчмарки довольно быстро устаревают. Поэтому разработчикам нужно постоянно улучшать или создавать все новые и более сложные тесты. Например, в 2024 году появилась новая версия MMLU — MMLU-Pro. Новые вопросы требуют от ИИ более глубоких рассуждений и позволяют не только лучше оценить качество нейросетей, но и постепенно решить более сложные задания.

Какими бывают бенчмарки для нейросетей

Не существует одного универсального бенчмарка, который позволит однозначно оценить «ум» модели. Вместо этого разработчики опираются на широкий набор разнообразных тестов. Зачастую бизнес создает и собственные бенчмарки, отталкиваясь от того, как LLM будет применяться внутри компании. К типичным задачам, для которых компании используют большие языковые модели, относятся ответы на вопросы по внутренней документации, оценка удовлетворенности клиентов службой поддержки, анализ юридических контрактов или помощь в креативных задачах.

  • Знания и навыки. Бенчмарки могут оценивать фактические знания сразу из нескольких областей (как упомянутый MMLU) или проверять какую-то одну тему (математику или право). Иногда компании требуется оценить знания модели в специфичной области. Например, мы используем YandexGPT для внутренних задач компании, поэтому оцениваем ее знания в сфере e-commerce: ИИ должен ответить, какой процессор используется в конкретном смартфоне или какие товары подойдут под конкретный запрос пользователя.
  • Устойчивость к провокациям. Разработчикам важно, насколько модель стабильно работает в разных ситуациях, в том числе когда ей задают вопросы-ловушки. ИИ можно спросить, почему в русском языке можно писать букву «й» без точек сверху без потери смысла. Это сложный вопрос, поскольку нейросеть должна ответить, что у «й» нет точек.
Средний рейтинг
0 из 5 звезд. 0 голосов.

Редакционный дайджест

Один полезный разбор каждую неделю

Новые инструкции, сравнения и разборы появляются в тематических рубриках журнала.

Выбрать тему