ООН и Google открыли статистику для ИИ: точность моделей по данным развития — 21%
В четверг ООН объявила, что работает с Google, чтобы её огромная коллекция глобальной статистики стала проще для доступа и использования ИИ-системами.
Новая система UN System Data Commons построена на открытой платформе Google Data Commons и позволяет искать статистику всех агентств ООН запросами на естественном языке. Она заменяет портал UNData, где пользователям приходилось в основном бродить по базе и искать данные через традиционный интерфейс. Новая платформа также поддерживает Model Context Protocol (MCP) — стандарт, позволяющий ИИ-системам подключаться напрямую к внешним источникам данных.
Люди всё чаще обращаются за ответами к ИИ-инструментам, но многие системы по-прежнему не могут надёжно выдавать авторитетные данные. Тест ЮНИСЕФ по шести большим языковым моделям — более 133 000 ответов на вопросы о показателях глобального развития — дал среднюю точность всего 21,2%, рассказал журналистам на виртуальном брифинге Жуан Педро Азеведу, главный статистик агентства.
В тесте участвовали GPT-4o и GPT-4o-mini от OpenAI, Claude Sonnet 4.5 и Haiku 4.5 от Anthropic, а также Gemini 2.5 Flash и Gemini 2.0 Flash от Google, сообщил Азеведу TechCrunch.
Примерно в трёх ответах из пяти вообще не было пригодного числа — часто потому, что модели уходили от прямого ответа, сказал Азеведу. Но когда те же вопросы задали тем же версиям моделей примерно на два дня позже, модели, давшие число оба раза, совпали лишь примерно в половине случаев.
Это рабочая статья ЮНИСЕФ, готовящаяся к подаче в журнал; рецензирования она пока не проходила. Организация обещает опубликовать методологию, код и данные вместе со статьёй.
ЮНИСЕФ также отметил резкий рост в этом году трафика с генеративных ИИ-ассистентов на свой сайт данных: он получает более 6 млн посещений в месяц и входит в число самых популярных сайтов агентства. Переходы по ссылкам из ответов ChatGPT выросли на 67% год к году с 1 января по 14 сентября, сообщил Азеведу TechCrunch. Такие переходы дали 6,4% всех сессий за год, а ИИ-ассистенты в целом, по оценке ЮНИСЕФ, обеспечивают примерно каждое десятое посещение.
ООН сообщила, что 26 её структур присоединились к Data Commons, а данные почти 20 из них доступны уже на старте. Кроме того, к 2027 году она намерена перенести на платформу 80% статистических наборов данных системы ООН.
«Мы на порядки продвинулись в масштабе, охвате и гибкости, впервые соединив столько агентств системы ООН, — сказал Шантану Мукерджи, исполняющий обязанности директора Статистического отдела ООН. — И пользуемся моментом, чтобы сделать наши данные готовыми для ИИ».
Google.org выделила $2 млн на укрепление потенциала и техническую поддержку для создания базовой инфраструктуры платформы. Прем Рамасвами, руководитель команды Data Commons в Google, рассказал TechCrunch, что система размещена на управляемом ООН экземпляре и в будущем должна поддерживаться, эксплуатироваться и масштабироваться силами самой ООН.
«Мы на протяжении всего внедрения применяли подход «обучи обучающего», и команда системы ООН, как мы видим, быстро набирает обороты», — сказал Рамасвами.
Google запустила Data Commons в 2018 году, чтобы упорядочить публичные наборы данных из разных источников в общую рамку. В прошлом году она добавила поддержку MCP, позволяющую ИИ-агентам напрямую запрашивать у Data Commons статистику и её источники.
Платформа ООН также отслеживает происхождение каждой цифры: можно проследить путь данных, полученных ИИ-системой, к исходному источнику в ООН. Азеведу сказал журналистам, что это важно, поскольку всё больше людей полагается на ИИ-инструменты в поиске и трактовке информации.
Помимо возможности ИИ-агентов получать отдельные показатели, Google показала, как подключённая через MCP к данным ООН ИИ-система может собрать несколько индикаторов и на их основе построить дашборды, графики и письменный анализ — без ручного поиска и сопоставления наборов данных.
В одной из демонстраций Google попросила ИИ-систему выяснить эффект Чрезвычайного плана президента США по борьбе со СПИДом в Африке. Система нашла нужные показатели ООН — число заражений ВИЧ, смертность от СПИДа, ожидаемую продолжительность жизни — и сделала инфографику.
Однако авторитетные данные не делают выводы ИИ автоматически авторитетными. «Поскольку модели могут неверно понимать нюансы, человек всегда должен проверять результаты, прежде чем ссылаться на них или публиковать», — сказал Рамасвами.
