09.10.2026

PrismML сжала 27-миллиардную модель до 5,9 ГБ и обещает ИИ прямо на устройстве

PrismML сжала 27-миллиардную модель до 5,9 ГБ и обещает ИИ прямо на устройстве

Если ИИ-лаборатории PrismML ещё нет в вашем поле зрения, ей стоит там оказаться — не потому, что она привлекла горы денег (пока лишь $22,25 млн посевных), а из-за технических умов, которые в ней собрались, и технологий, способных изменить отрасль. PrismML делает ставку на то, что способные, высокопроизводительные рассуждающие большие языковые модели вовсе не обязаны быть большими.

Компания сжимает рассуждающие модели настолько, что они помещаются на ПК и смартфоны. (Поговаривают даже о переговорах с Apple, хотя генеральный директор Бабак Хассиби отказался комментировать это для TechCrunch.)

В четверг PrismML выпустила Bonsai 2 27B — новейшую модель в семействе, которая сжимает Qwen3.8 27B, широко используемую открытую модель от Alibaba, до 5,9 ГБ. Этого достаточно, чтобы уместиться на ПК, а возможно, и на флагманском смартфоне: расход памяти сокращён в 9–10 раз по сравнению с оригиналом.

PrismML основана группой исследователей Калтеха и управляется Хассиби — профессором Калтеха и экспертом по технологиям сжатия. В числе советников стартапа — Ион Стойка, соучредитель Databricks и ещё нескольких компаний, директор знаменитой лаборатории Sky Computing Lab в Беркли, из которой выросли многие технологии и стартапы — от Letta до SGLang.

Среди инвесторов PrismML — Khosla Ventures, Cerberus Capital и Калтех.

Стартап далеко не единственный, кто занимается сжатием LLM. Другой пример — Multiverse Computing, основанная известным профессором из испанского Центра физики Доностии. (И она-то как раз привлекла горы денег.)

Но Хассиби утверждает, что технология PrismML уникальна: её модели почти не потеряли в качестве по сравнению с оригиналами. Bonsai 2 повторяет 98% совокупных результатов Qwen по бенчмаркам — против 95% у первой Bonsai, вышедшей в марте. Ту первую модель уже скачали более 11 млн раз, а ещё более компактные модели PrismML — ещё 2,6 млн раз, говорит компания.

Так что результаты сжатия от релиза к релизу улучшаются. Достижимо ли когда-нибудь 100-процентное равенство по бенчмаркам — вопрос открытый. По словам Хассиби, сжатие, вероятно, всегда будет на что-то влиять.

Впрочем, идеальное равенство по бенчмаркам — скорее академическая тонкость. LLM и в несжатом виде не настолько точны, а бенчмарки не настолько точно отражают реальные задачи, чтобы потеря 2% заметно сказалась на практике. (К тому же на точность сильно влияет окружающее программное обеспечение — та обвязка, внутри которой работает модель.)

Компания объясняет эффект сжатием «весов», из которых состоит модель, — по сути, той информации, которую модель выучила и сохранила при обучении. Обычно каждый вес требует 16 бит. Подход PrismML, так называемые «троичные» веса, сводит их к трём значениям: +1, −1 или 0. Хранить нужно куда меньшие числа, поэтому модель занимает драматически меньше места. (Подробнее о технике сжатия — на странице проекта на Hugging Face.)

Следующая цель стартапа — применить это сжатие к ещё более крупным моделям. «Следующие модели, которые мы выпустим, надеюсь, в ближайшие пару месяцев, будут в диапазоне сотен миллиардов параметров, и там, я ожидаю, удержать интеллект будет проще», — сказал Хассиби TechCrunch.

По его словам, с ростом размера модели «остаётся больше простора для сжатия без потери интеллекта. Так что, если говорить об общей тенденции: для крупных моделей легче выйти на 100%».

Стойка говорит, что рад этой технологии, поскольку она позволяет запускать продвинутые модели прямо у пользователя: «Интеллект окажется у вас под рукой, и он будет бесплатным, потому что работает на устройстве, которое вы уже купили. И ещё он будет приватным, потому что вы не отправляете его в облако».

Подписывайтесь на наш канал Дзен и группу ВК

TechCrunch

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *