Hitech logo

Идеи

Ученые из России научили ИИ-модели общаться с помощью «математической телепатии»

TODO:
Екатерина ШемякинскаяСегодня, 09:10 AM

Стартап от российских математиков Mostik разработал способ, позволяющий ИИ-моделям обмениваться информацией без передачи текста. Вместо этого система использует математические представления, заложенные во внутренних параметрах моделей. По замыслу разработчиков, такой подход позволит объединять возможности больших и маленьких моделей и получать более высокое качество при меньших вычислительных затратах. Стартап протестировал свое решение на настройке, где модель на 753B читает проблему, а модель на 4B для edge-устройств пишет ответ. С этим подходом были получены результаты, точность которых на 80% соответствует фронтирной модели, но с производительностью в 20 раз быстрее.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Обычно для взаимодействия двух моделей результат работы первой передается второй в виде текста: одна система формирует ответ, другая обрабатывает его и продолжает работу. Mostik предлагает отказаться от этого промежуточного шага и напрямую сопоставлять внутренние числовые представления разных моделей. Компания называет такой механизм «мостом» между моделями, что отражено в ее названии.

В чем идея и как она реализована. Генерируя один токен, языковая модель строит огромные скрытые векторы. Это порядка миллиона чисел (~2 МБ). При этом в выхлоп попадает только около 17 бит — сам токен, а остальное выбрасывается. Все системы, где модели общаются между собой (команды агентов и пр.), общаются именно через этот узкий текстовый канал. При этом в отбрасываемой части остается море информации, описывающей все, что модель знает о задаче в этот момент. Это не только данные о текущем токене, но и о будущих. Идея Mostik — это, собственно, дать моделям «мостик», через который они смогут общаться полноценно, чтобы работать эффективнее. Команда обучила небольшой модуль-переводчик, который передает скрытые состояния от одной модели к другой. При этом модели могут быть из разных семейств, их веса не меняются, и совсем никакого текста между ними не проходит.

Разработчики продемонстрировали технологию на двух моделях с открытыми весами — GLM-5.2 с 753 млрд параметров и Qwen-3.5 с 4 млрд параметров, которая может работать на мобильных устройствах. По заявлению Mostik, объединенная система стоит примерно в 20 раз дешевле полной версии GLM-5.2, а ее производительность находится между показателями двух исходных моделей. Точный принцип работы «моста» компания не раскрывает.

Mostik также применил свою технологию в системе, участвовавшей в ARC-AGI-3 — тесте, оценивающем способность ИИ обобщать правила и решать новые абстрактные задачи. Решение стартапа вошло в число лидеров текущего рейтинга. Разработчики также не раскрывают деталей реализации.

Глава Mostik Саша Малышева считает, что объединение нескольких специализированных моделей может стать альтернативой постоянному увеличению размера универсальных систем.

Например, к одной модели можно подключать отдельные системы, специализирующиеся на биологии, физике или других областях. В этом случае небольшая модель сможет использовать возможности более мощной, не запуская ее в полном объеме для каждого запроса.

В команде стартапа, который запустился четыре месяца назад, всего 15 человек. Среди них 12 докторов наук и специалисты, ранее работавшие в Google X, Nvidia и Perplexity. Главным научным сотрудником Mostik стал профессор Женевского университета и лауреат Филдсовской премии Станислав Смирнов. По его словам, найти общий язык между двумя ИИ-моделями на удивление сложно — подходящего математического языка для их взаимодействия пока, возможно, не существует. Смирнов считает, что работа Mostik может не только помочь моделям общаться, но и выявить новые закономерности в их функционировании. Более глубокий математический анализ, по его мнению, позволит сравнить принципы рассуждения ИИ и человеческого мозга.

Распространение Mostik способно изменить практику работы с открытыми моделями. Разработчики смогут собирать дешевые ансамбли из нескольких моделей разного размера и профиля вместо одной дорогой системы. Это сократит вычислительные расходы и повысит конкурентоспособность открытых решений по сравнению с проприетарными системами.