Проект нейросимвольного ИИ Сергея Шумского: как сжатие формирует интеллект

Сложность через сжатие: как устроен проект нейросимвольного ИИ Сергея Шумского

Современные языковые модели впечатляют возможностями, но одновременно вызывают серьёзные вопросы. Инженеров беспокоит низкая интерпретируемость трансформеров: зачастую невозможно точно объяснить, почему система выбрала тот или иной ответ. Бизнесу нужны нейросети с гарантией правильного ответа, особенно в медицине, финансах, промышленности и государственных сервисах. Пользователей же прежде всего раздражают галлюцинации - уверенные, но недостоверные утверждения.

Поэтому исследователи ищут архитектуры, способные объединить гибкость машинного обучения с проверяемостью формальных систем. Одним из таких направлений становится нейросимвольный искусственный интеллект. В проекте нейросимвольного ИИ Сергея Шумского предлагается отказаться от привычной логики масштабирования трансформеров и сделать центральным механизмом не генерацию токенов, а многоуровневое сжатие информации.

Почему символьный подход снова оказался востребован

Классический символьный искусственный интеллект строился на идее, что интеллект представляет собой манипуляцию символами по заранее заданным правилам. Если формализовать объекты, отношения и операции над ними, рассуждала ранняя школа ИИ, можно получить интеллектуальную систему.

Так появились экспертные системы, логическое программирование, семантические сети, фреймы, онтологии и графы знаний. Они успешно применялись в бизнесе, научных исследованиях и управлении. Однако по мере усложнения задач проявились фундаментальные ограничения. Такие системы оказывались хрупкими, плохо переносили неполные или противоречивые данные и почти не умели обобщать знания.

Если новая задача не была предусмотрена разработчиком, требовалось вручную добавлять правила. В результате сложность реального мира постоянно опережала возможности его формального описания. При этом графовые структуры, онтологии и базы знаний, появившиеся в эпоху символьного ИИ, сохранили значение и сегодня.

Проект Сергея Шумского предлагает иной компромисс. Это не нейросеть в традиционном смысле: обучение выполняется не посредством градиентного спуска, а с помощью счётных процедур. Модель не пытается напрямую предсказывать каждый следующий токен. Вместо этого она выявляет повторяющиеся закономерности и сжимает последовательности - сначала грамматически, затем семантически. Благодаря этому снижается объём вычислений, уменьшается риск комбинаторного взрыва, а обучение может выполняться на обычном CPU.

Принцип минимальной длины описания

В основе подхода лежит принцип минимальной длины описания. Упрощённо его можно сформулировать так: хорошая модель должна одновременно быть компактной и эффективно кодировать данные. Оценивается суммарная длина описания самой модели и закодированной с её помощью информации. Чем меньше итоговый объём, тем удачнее найденное представление.

Архитектура состоит из нескольких уровней. На первом система анализирует последовательность символов и пытается предсказать следующий элемент. Но задача не сводится к максимальному повышению точности. Важнее обнаружить момент, когда качество предсказания начинает резко ухудшаться. Именно там последовательность разделяется на фрагменты.

Полученная цепочка кодируется, после чего проверяется, даёт ли новое представление экономию в битах. Если да, найденная единица добавляется в словарь. Далее аналогичная процедура выполняется уже над полученными единицами. Так постепенно формируется иерархия: на нижнем уровне могут возникать морфемы, выше - слова, затем устойчивые фразы, предложения, понятия и элементы рассуждений.

Такой принцип напоминает последовательное построение пирамиды абстракций. Каждый новый уровень работает не с исходным потоком, а с более компактным описанием предыдущего. В теории это позволяет уменьшить длину контекста и одновременно повысить содержательность обрабатываемых единиц.

Почему сжатие помогает экономить вычисления

Главное преимущество проекта - работа с контекстом. На уровне отдельных символов для предсказания может потребоваться окно примерно из десятка предыдущих элементов. После перехода к словам часто достаточно трёх-четырёх единиц.

Для табличного предсказателя увеличение длины окна особенно дорого: число возможных комбинаций растёт экспоненциально. Поэтому укрупнение последовательностей становится не косметическим улучшением, а условием практической работоспособности.

У трансформеров ситуация иная, но проблема также существует: вычислительная стоимость обработки контекста растёт квадратично относительно его длины. Чем больше окно, тем дороже становится анализ взаимосвязей между всеми его элементами. Иерархическое сжатие потенциально позволяет передавать на верхние уровни уже обработанные и компактные представления.

На каждом уровне используются два типа сжатия. Сначала применяется сжатие без потерь: поток разбивается на повторяющиеся фрагменты, которые могут пополнить словарь. Затем используется сжатие с потерями. Каждая единица описывается распределением своих контекстов и преобразуется в короткий код, при этом сохраняется информация о соседстве и характере употребления.

Фактически второй этап формирует векторное представление на основе статистики контекстов. Два элемента оказываются близкими не потому, что их заранее отнесли к одной категории, а потому, что они сходным образом используются в данных. Именно это должно добавить гибкости, которой не хватало классическим символьным системам.

Что может обеспечить обобщение

В традиционном символьном ИИ обобщение ограничивалось набором заложенных правил. В нейросетях оно возникает благодаря статистическому обучению, но часто сопровождается непрозрачностью и ошибками. В нейросимвольной модели ИИ Шумского предполагается объединить оба механизма.

Нижние уровни фиксируют повторяющиеся элементы и устойчивые закономерности, а верхние работают с более абстрактными единицами. Такая иерархия должна позволить системе переносить найденные структуры на новые последовательности. Если модель научилась распознавать общую схему фразы или рассуждения, ей не обязательно хранить каждый конкретный пример.

В этом состоит отличие подхода от простого словаря шаблонов. Единицы не только запоминаются, но и получают компактные коды, связанные с контекстами употребления. За счёт этого нейросимвольные модели ИИ могут сочетать дискретную структуру и статистическую близость.

Ограничения и нерешённые вопросы

У проекта есть и слабые стороны. Прежде всего, пока не очевидно, насколько хорошо такая система справится с задачами, где важны внешний мир, сенсорные данные, причинность и долгосрочное планирование. Сжатие текста само по себе ещё не гарантирует понимания.

Кроме того, минимизация описания может приводить к неоднозначным решениям. Одна и та же информация иногда эффективно кодируется несколькими способами, а наиболее компактное представление не обязательно оказывается наиболее удобным для объяснения человеку. Поэтому интерпретируемый искусственный интеллект требует не только компактных кодов, но и средств их расшифровки.

Отдельный вопрос - качество ответов. Даже прозрачная архитектура не даёт автоматически нейросети с гарантией правильного ответа. Для критически важных сценариев потребуются проверка фактов, внешние базы знаний, формальная верификация и контроль ограничений. Вероятно, практическая система должна будет сочетать нейросимвольные механизмы с проверяемыми правилами и специализированными модулями.

Перспективным направлением выглядит связка с графами знаний. Иерархические коды могут помогать выявлять понятия и отношения, а графовая структура - проверять их согласованность. В таком случае разработка нейросимвольного ИИ будет включать не только обучение модели, но и создание инструментов анализа её внутренних представлений.

Важна и инженерная сторона. Если алгоритмы действительно работают на CPU и не требуют огромных массивов ускорителей, это снизит порог входа для исследовательских групп и компаний. Однако преимущество по вычислениям необходимо подтвердить на больших корпусах и разнообразных задачах, сравнив скорость, качество, устойчивость и стоимость эксплуатации с современными трансформерами.

Итоговая оценка

Идея проекта Сергея Шумского интересна тем, что предлагает смотреть на интеллект не как на бесконечное наращивание параметров, а как на поиск всё более эффективного описания данных. В этой картине обучение - это обнаружение устойчивых структур, их упаковка в компактные единицы и построение иерархии абстракций.

Такой подход не отменяет трансформеры и не решает автоматически все проблемы генеративного ИИ. Но он показывает возможный путь к системам, где вычислительная эффективность сочетается с более понятной внутренней организацией. Если удастся подтвердить способность модели обобщать, работать с широким контекстом и объяснять происхождение выводов, нейросимвольный искусственный интеллект может стать важной альтернативой чисто статистическим архитектурам.

Прокрутить вверх