25.08.2026

Arena AI: от краудсорсингового рейтинга до глобального стандарта оценки ИИ

Arena AI — это не просто рейтинговая таблица, а целая экосистема, в центре которой находится крупнейшая в мире краудсорсинговая платформа для сравнения и оценки AI-моделей. То, что начиналось как исследовательский проект в Калифорнийском университете в Беркли, за несколько лет превратилось в прибыльный бизнес, чей стремительный рост и коммерческий успех сделали его одним из самых заметных феноменов в индустрии искусственного интеллекта.

Arena AI

Arena AI — это не просто рейтинговая таблица, а целая экосистема, в центре которой находится крупнейшая в мире краудсорсинговая платформа для сравнения и оценки AI-моделей. То, что начиналось как исследовательский проект в Калифорнийском университете в Беркли, за несколько лет превратилось в прибыльный бизнес, чей стремительный рост и коммерческий успех сделали его одним из самых заметных феноменов в индустрии искусственного интеллекта.

Истоки и эволюция: от студенческого проекта до единорога

Arena AI берет начало в 2023 году как исследовательский проект LMSYS Org (Large Model Systems Organization) в Sky Computing Lab при UC Berkeley. Изначально это был открытый исследовательский проект, созданный аспирантами и профессорами для решения проблемы отсутствия надежных методов тестирования больших языковых моделей.

Эволюция названия платформы отражает ее рост и коммерциализацию:

  • Проект начался как Chatbot Arena в апреле 2023 года.
  • В сентябре 2024 года платформа была официально переименована в LMArena (Large Model Arena) и получила собственный домен.
  • В апреле 2025 года проект выделился в независимую компанию Arena Intelligence Inc.
  • 28 января 2026 года платформа получила свое текущее имя — Arena, переехав на новый домен.

Коммерческий рост платформы был стремительным. В мае 2025 года компания привлекла 100 млн долларов посевных инвестиций при оценке 600 млн долларов. Уже 6 января 2026 года Arena закрыла раунд Series A на 150 млн долларов при оценке в 1.7 млрд долларов, что означало трехкратный рост стоимости за семь месяцев. Инвесторами выступили Felicis Ventures, UC Investments, Andreessen Horowitz (a16z), Lightspeed Venture Partners, Kleiner Perkins и другие известные венчурные фонды. На начало 2026 года в компании работало всего 29 человек, что означало, что каждый сотрудник оценивался примерно в 400 млн долларов.

Как работает «Арена»: механизм краудсорсинговой оценки

Механизм платформы удивительно прост и напоминает спортивный турнир, что и дало ей название:

  1. Слепой бой: Пользователь вводит свой запрос (промпт) на сайте.
  2. Анонимность: Система отправляет этот запрос двум случайным, анонимным AI-моделям. Пользователь не знает, какая именно модель отвечает (GPT-5, Claude, Gemini, Grok и т.д.), что исключает предвзятость.
  3. Голосование: Пользователь выбирает, какой из двух ответов ему кажется лучше.
  4. Рейтинг: На основе миллионов таких голосов строится публичный рейтинг (лидерборд) по системе Elo (как в шахматах).

Этот подход позволяет оценивать модели не по абстрактным тестам, а по реальным предпочтениям людей в решении повседневных задач: письмо, программирование, рассуждение, дизайн. Как отмечает сооснователь и CEO Arena Анастасиос Ангелопулос, платформа работает по принципу демократии: голосование — это механизм, который позволяет представлять интересы людей.

Масштабы и влияние

Сегодня Arena — это не просто сайт, а огромная база данных и ключевой игрок AI-индустрии:

  • Аудитория: Более 10 миллионов активных пользователей в месяц из 150+ стран.
  • Данные: Накоплено более 700 миллионов диалогов и 82 миллиона человеческих голосов. Это самый большой набор данных о человеческих предпочтениях в мире для оценки AI.
  • Влияние: Ведущие AI-лаборатории, включая OpenAI, Google, Anthropic и Meta, используют Arena как независимый «судейский» полигон. Они не только публично соревнуются, но и анонимно тестируют свои еще не выпущенные модели перед релизом. Рейтинги Arena считаются одним из самых признанных независимых бенчмарков для передовых AI-моделей.

Бизнес-модель: монетизация краудсорсинговой оценки

Главный парадокс Arena в том, что основной продукт (публичный рейтинг) бесплатен для пользователей. Деньги компания зарабатывает, продавая коммерческую услугу AI Evaluations, запущенную в сентябре 2024 года:

  • Кому продают: AI-лабораториям и крупным предприятиям.
  • Что продают: Глубокую аналитику и отчеты о производительности их моделей в «реальном мире», собранные на основе голосов и данных сообщества. Услуга также предоставляет прослеживаемые образцы оценочных данных и соглашения об уровне обслуживания (SLA).
  • Результат: Уже через четыре месяца после запуска коммерческого продукта годовой доход достиг 30 млн долларов. К июню 2026 года, всего через восемь месяцев после запуска, годовой доход (annualized run-rate) достиг 100 млн долларов. Это один из самых быстрых темпов роста выручки в истории AI-индустрии.

Как пояснил Ангелопулос, компания зарабатывает на «потреблении», а не на подписках, и конкурирует за тот же бюджет, что и стартапы по маркировке данных, такие как Scale AI. При этом прямых конкурентов у Arena нет — похожий проект Yupp закрылся в марте 2026 года.

Новые горизонты: Agent Mode и оценка агентного AI

Платформа не стоит на месте и постоянно развивается. В июне 2026 года Arena представила режим Agent Mode, который оценивает AI не по отдельным ответам, а по способности выполнять сложные, многошаговые задачи. Вместо того чтобы разбивать сложную задачу на множество отдельных промптов, Agent Mode автономно строит план и использует встроенные инструменты для выполнения всего многошагового рабочего процесса.

Agent Mode предлагает набор инструментов, включая веб-поиск, генерацию изображений, помощь в программировании, загрузку файлов и мощную среду песочницы для тестирования. Он измеряет такие важные для бизнеса метрики, как процент успешного завершения задачи и уровень галлюцинаций (выдумок). В первый месяц работы Agent Mode обработал более 5 миллионов взаимодействий и показывает рост 10% еженедельно. Среди задач, выполняемых в этом режиме, доминирует программирование (29%), за ним следуют исследования и планирование (по 11%).

Фактологические рейтинги: новый стандарт оценки

В июле 2026 года Arena сделала еще один важный шаг, обновив свой рейтинг с учетом фактологической точности. Новая система отводит 25% веса фактологичности наряду с традиционными голосами пользователей. Платформа извлекает из каждого ответа модели атомарные, проверяемые утверждения, а затем поисковые агенты присваивают им калиброванные вероятности истинности. Система работает на основе более чем 2 миллионов размеченных утверждений из более чем 130 000 битв в текстовой Arena и 40 000 битв в Search Arena.

Результаты оказались драматическими: OpenAI GPT-5.5 поднялся на 13 позиций до седьмого места, в то время как Meta Muse Spark упал на 13 мест до двадцатого. Это показало, что модели, которые пользователи предпочитали в очных сравнениях, могут быть менее надежными при фактической проверке их утверждений. Как отмечает издание, Arena фактически признала, что одного человеческого суждения больше недостаточно для ранжирования этих систем. Для компаний, строящих продукты на основе этих моделей, это имеет прямое значение для отраслей с высокими требованиями к точности, таких как финансы, здравоохранение и юридические услуги.

Сегодня Arena — это не просто платформа для сравнения AI-моделей, а фактически «неофициальное табло» для всей индустрии генеративного AI, задающее стандарты оценки и влияющее на развитие технологий.

Официальный сайт Arena AI

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *