Российские инженеры научили нейросети общаться без текста и слов

Современные нейросети тратят колоссальные ресурсы на то, чтобы облечь мысль в слова, после чего другая модель вновь переводит текст обратно в математические векторы. Разработчики Mostik создали компактный обучаемый мост, который переносит скрытое состояние одной нейросети в пространство, понятное другой. Первая модель читает запрос и передаёт его внутреннее представление через этот модуль, после чего вторая генерирует финальный ответ. Сами нейросети заморожены — обучается только связующая прослойка.

Российские инженеры научили нейросети общаться без текста и слов

Для проверки идеи инженеры объединили гигантскую GLM-5.2 с 753 миллиардами параметров и крошечную Qwen3.5-4B с четырьмя миллиардами. Большая модель обрабатывала входные данные, но не писала текст. Её скрытые состояния поступали через мост в компактную Qwen3.5-4B, которая формировала ответ. По итогам тестов гибридная связка закрыла примерно половину качественного разрыва между моделями. Точность Qwen3.5-4B выросла на четверть, а на сложных задачах улучшение достигало двукратного. При сопоставимом качестве архитектура потребовала в два с половиной раза меньше вычислений, чем одиночная модель промежуточного размера.

Экономия объясняется просто: мощная система выполняет лишь дешёвую стадию чтения, а генерацию берёт на себя компактная. Подход относится к направлению латентной коммуникации, где нейросети обмениваются эмбеддингами и скрытыми состояниями вместо текста. Главная трудность — несовпадение внутренних пространств у разных архитектур.

Практическая польза выходит за рамки экономии. Вместо одной гигантской нейросети разработчики смогут связывать несколько специализированных систем — для программирования, физики, биологии. Мощная модель будет подключаться лишь на сложных этапах, а дешёвая выполнять рутинную работу.

Исследователь предлагает проверять качество нейросетей «чепухой».


Следите за нашими статьями в Telegam, Дзен, VK и OK
Exit mobile version