Перейти к содержимому
Опубликовано

Бенчмарки нас обманывают

Автор
  • Имя
    🔥 Дмитрий Ирешев: AI • Продукты • Проекты
    Telegram

Кратко

Бенчмарки нейросетей обманывают: скандал с Llama 4 Maverick в Chatbot Arena

Бенчмарки нас обманывают

Chatbot Arena — это система, которая позволяет тестировать и сравнивать различные языковые модели нейросетей. Реальные пользователи задают вопросы, и две модели одновременно отвечают на них. Затем пользователь выбирает понравившийся ответ, что дает соответствующей нейросети очки в рейтинге.

Скандал начался с нейросети от Цукерберга Llama 4 Maverick. В Chatbot Arena выпустили версию специально заточенную под этот «бенчмарк». И больше ни подо что. Естественно, она показала отличные результаты, а когда выяснилось, что реальная версия такие показатели не выдает, то компания поспешила извиниться.

Позже выяснилось, что организаторы бенчмарка Chatbot Arena предоставляла ведущим игрокам в области искусственного интеллекта (OpenAI, Google, Amazon и другие) возможность проводить закрытые тесты различных вариантов собственных моделей. После этого неудачные варианты исключались и не попадали в публичные рейтинги.

Это позволило лидерам рынка создавать модели, оптимально подходящие для тестов, и представлять в Chatbot Arena именно их. К примеру, в случае с Llama 4 Maverick компания провела 27 тестов и выбрали только одну версию. Google проводил более 10 тестов, Amazon - 7. У компаний поменьше возможности проводить закрытые тесты - нет.

Нейронки придёться проверят по старинке, методом тыка.

Пруфы

@dmitrii_ireshev_Agile_PMP #ai #ии

🔥 Дмитрий Ирешев: AI • Продукты • Проекты
12970 подписчиков
1019 постов
Привет, я Дима Ирешев, Директор продуктов и проектов в e-com На канале ты найдешь 🛒 Разборы крутых проектов и продуктов 🦾 AI & Tech: внедрение нейросетей в работу 🔬 Менеджмент через науку ✉️ Связь: @ireshev 🤡 Мемы: @jokes_in_IT