Harvey представила Harvey Tenet: юридическая ИИ-модель на базе Kimi K3, дообученная с Fireworks
Harvey выпустила Harvey Tenet — свою первую дообученную модель, представленную сегодня в формате исследовательского превью. Tenet — это базовая модель Kimi K3, дообученная с помощью Fireworks методом асинхронного обучения с подкреплением на длительных юридических задачах.
Обучающий корпус сочетал синтетические данные, публично доступные юридические данные и данные от экспертов-людей. В Harvey утверждают, что данные клиентов не использовались. По сравнению с базовой моделью K3 Tenet выполняет почти вдвое больше отложенных задач в собственном бенчмарке Harvey Legal Agent Benchmark (LAB) и на 20% больше в LAB: Contracts, поднимая долю полностью успешных прохождений на 9 и 2 процентных пункта соответственно.
Harvey сообщает о передовом результате в LAB: Contracts и втором месте в LAB. Прирост также переносится без дополнительного обучения на Mercor APEX Agents и Redline Bench от Crosby. Заявленная цель двойная: построить передовой юридический интеллект на моделях с открытыми весами и дать юридическим фирмам путь к собственным специализированным моделям.
Можно ли её развернуть?
Пока нет. Harvey Tenet — это исследовательский превью, анонсированный 20 августа 2026 года. Harvey не опубликовала веса, карточку модели или API-эндпоинт. Базовая модель имеет открытые веса; сама Tenet — собственный чекпоинт Harvey, и компания говорит, что работа со временем перейдёт «из исследований в продакшен» внутри продуктов Harvey. Сегодня публикуется рецепт, а не сам артефакт.
Уровень доступа: только для корпоративных клиентов. Доступ осуществляется через платформу Harvey, которая продаётся юридическим фирмам, средним фирмам и внутренним юридическим отделам компаний. Лаборатория с RL-стеком могла бы воспроизвести метод: обучение заняло около 150 GPU NVIDIA B300 в течение двух месяцев.
Отрасли: юридические услуги, корпоративные внутренние юридические отделы, private equity и инвестиционный банкинг (due diligence при сделках M&A), а также регулируемые сектора, где объём контрактов определяет издержки, — страхование, финансовые услуги, здравоохранение, энергетика.
Применения: меморандумы по M&A due diligence в дата-румах, составление контрактов, ревью и правки (redlining), структурированное извлечение данных из документов (до 10 000 документов) и поиск прецедентов по накопленным знаниям фирмы.
Что говорят цифры
По сравнению с базовой K3 Tenet выполняет почти вдвое больше отложенных задач в LAB и на 20% больше в LAB: Contracts, поднимая долю полностью успешных прохождений на 9 и 2 п.п. соответственно. Harvey сообщает о передовом результате в LAB: Contracts и втором месте в LAB, используя оценки базовых моделей от Vals.
Более интересен эффект переноса. Tenet также значительно улучшает результаты на Mercor APEX Agents (корпоративное право) и Crosby Redline Bench — ни один из них не использовался при обучении, — сохраняя при этом производительность на бенчмарках знаний, включая LegalBench, CUAD, MAUD и PRBench от Scale. Агентное обучение не подорвало традиционные юридические рассуждения.
Стоимость оптимизируется, а не приносится в жертву. Открытые веса снижают цену за токен; формирование награды, отдающее предпочтение более коротким траекториям при равном качестве, снижает потребление токенов. Harvey сообщает о значительном повышении качества при стабильной стоимости.
Как проходило обучение
Обучение использовало асинхронное обучение с подкреплением в изолированных юридических средах, построенных по образцу задач LAB: инструкция в стиле партнёра (около 50 слов), клиентское дело из ключевых и периферийных документов и экспертная рубрика с атомарными критериями «сдано/не сдано» — примерно 50 на задачу, а в крайних случаях сотни. Один прогон может превышать 1000 шагов.
Прогоны оценивает LLM-судья; абляции остановились на Kimi 2.6. Награда сочетает долю выполненных критериев рубрики, общий подсчёт решённых юридических задач и бонус за полное прохождение. Политика оптимизируется с помощью GSPO с LoRA ранга 64 на полной сети K3, восемью группами задач по восемь прогонов на шаг оптимизатора, примерно на 1750 средах и более 10 000 прогонов за эпоху.
Fireworks совместно создавала тренер и развёртывание прогонов на уровне ядра — с token-in-token-out и router replay, — чтобы держать большую MoE численно согласованной между обучением и инференсом.
Три отдельно обученные возможности
Команда Harvey также дообучила специализированные модели, к которым Tenet может обращаться как к инструментам или субагентам:
M&A diligence. В LAB: Diligence одна задача может обрабатывать до 80 млн токенов; ни один бейзлайн не превышал 43,8% критериев. Вместе с Baseten Harvey перешла на среду Recursive Language Model, где корневой агент держит дата-рум в REPL и делегирует задачи субагентам. Один оркестратор GLM-5.2 достиг 46,1%; дообучение в такой среде через самодистилляцию подняло результат до 60,1%.
Review Table. Вместе с Applied Compute дообученная GLM-5.2 улучшила качество ответов на 3,6 пункта и качество цитирования на 12,1 пункта примерно при десятой доле стоимости за ячейку, научившись воздерживаться от ответа, когда вопрос неприменим.
Знания фирмы. Вместе с Engram модель Qwen3.8-27B изучает около 100 млн токенов клиентских дел, превращая их в 1 млн токенов структурированных знаний плюс параметрическую память. Доля выполненных критериев выросла более чем на 15%, токены в завершённых траекториях упали на 58%, а стоимость запроса снизилась примерно на 90% — 190,8 «интеллекта на токен» против 129,3 у лучшей фронтовой конфигурации.
Независимая проверка
Редакция MarktechPost провела собственную факт-проверку заявлений Harvey: ни одно из опубликованных утверждений не было опровергнуто, однако большинство цифр являются самозаявленными — Tenet отсутствует в публичных лидербордах, а бенчмарк LAB принадлежит самой Harvey. Независимая проверка выявила несколько особенностей подачи: результаты в блоге (+9 и +2 п.п.) на X подавались как «+82%» и «+22%»; сравнение с конкурентами в APEX Agents проводилось в собственной среде Harvey (прирост 58,8% → 67,5% объясняется сменой окружения ещё до обучения); «открытые веса» относятся к базовой модели Kimi K3, а не к самой Tenet, у которой нет ни опубликованных весов, ни API. При этом Harvey добровольно раскрыла нулевой результат на PRBench и заказала слепой прогон APEX v1 у Mercor — это сильнейшие элементы верификации в материале.
Ключевые выводы
- Tenet — это дообученный чекпоинт Kimi K3, а не публичный релиз с открытыми весами: ни весов, ни API.
- Прирост переносится без обучения на APEX Agents и Redline Bench, что говорит об усвоенном поведении, а не о подгонке под бенчмарки.
- Формирование награды по длине траекторий позволило улучшать качество и стоимость одновременно, а не в ущерб друг другу.
- Специализированный стек — RLM diligence, Review Table, память фирмы — дал наибольшие улучшения.
