Нейросимволический искусственный интеллект

Материал из MachineLearning.

Версия от 12:22, 19 июля 2026; Oleg Batsiev (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск
Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 18:07, 11 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Нейросимволический искусственный интеллект.


Содержание

Нейросимволический искусственный интеллект (англ. neuro-symbolic artificial intelligence, neuro-symbolic AI) — направление искусственного интеллекта, в котором нейронное обучение сочетают с символическим представлением знаний и рассуждением. В зависимости от архитектуры символическая часть может быть базой фактов и правил, логической программой, онтологией, исполнимой программой либо набором ограничений, влияющих на обучение.

Нейросимволический ИИ не является одним алгоритмом. Этим термином называют как модульные системы, где нейронная сеть распознаёт объекты, а отдельный исполнитель применяет к ним правила, так и более тесно интегрированные модели, в которых вероятностный или приближённый логический вывод включён в обучение. Поэтому наличие на входе или выходе слов и других дискретных меток само по себе ещё не означает, что система выполняет символическое рассуждение.[1]

Мотивация

Нейронные модели умеют извлекать признаки из изображений, аудио и текста и оптимизируются по примерам. Их внутреннее знание обычно распределено по параметрам и непрерывным представлениям. Такое представление полезно для распознавания, но само по себе не задаёт явной процедуры логического вывода и не гарантирует соблюдение известных правил.

Символические системы, напротив, оперируют именованными объектами, предикатами, переменными и правилами. Пусть parent(x,y) означает «x — родитель y». Тогда одно из правил для отношения «дедушка или бабушка» можно записать так:

parent(x,y)\wedge parent(y,z)\Rightarrow grandparent(x,z).

Правило можно прочитать, проверить и применить к объектам, не встречавшимся при его формулировке. Однако символический исполнитель не определит по необработанной фотографии, кто на ней изображён, если система восприятия и связь её результатов с символами не заданы отдельно.

Нейросимволический подход пытается связать эти две стороны: научиться получать из данных пригодные для рассуждения сущности и одновременно использовать структуру предметной области при выводе или обучении.

Исторический контекст

В классическом символическом ИИ знания представляли правилами, логическими формулами, семантическими сетями и программами. Физическая символьная гипотеза Ньюэлла и Саймона связывала общие интеллектуальные действия со способностью системы создавать и преобразовывать символические структуры.[1]

Параллельно развивался коннекционизм, в котором вычисление и обучение описываются сетями простых взаимодействующих элементов и распределёнными представлениями. Противопоставление двух программ исследования не было абсолютным: способы переводить логические знания в нейронные сети и извлекать правила из сетей изучаются многие десятилетия. Современное направление продолжает эту линию с использованием глубокого обучения, вероятностного программирования и дифференцируемых вычислений.[1]

Нейронные и символические представления

Нейронная модель с параметрами \theta обычно вычисляет прогноз или распределение

p_\theta(y\mid x).

Понятия в такой модели могут соответствовать направлениям или областям непрерывного пространства, однако заранее установленное взаимно однозначное соответствие между отдельным нейроном и отдельным понятием обычно отсутствует.

В символическом представлении используются дискретные термы и отношения. Например, факты red(cubeA) и leftof(cubeA,sphereA) утверждают, что куб красный и расположен слева от шара. При принятой семантике пространственных отношений можно задать правило

leftof(x,y)\Rightarrow rightof(y,x).

После подстановки констант исполнитель получает новый факт rightof(sphereA,cubeA). Такой вывод зависит не только от записей в базе, но и от выбранной логики: классической, вероятностной, нечёткой, немонотонной или иной. Поэтому «символическая часть» разных нейросимволических систем может иметь различную семантику и различные гарантии.

Основные схемы интеграции

Нейронное восприятие и символический исполнитель

В модульной схеме нейросеть выделяет объекты, их атрибуты и отношения, а символический исполнитель работает с полученным описанием сцены. Например, в задаче ответа на вопрос по изображению один модуль формирует объектное представление, другой переводит вопрос в программу наподобие «выбрать шары, оставить синие, посчитать», после чего программа исполняется над сценой.

Промежуточные представления облегчают диагностику: можно различить ошибку обнаружения объекта, неверный разбор вопроса и ошибку исполнения. Но интерфейс между модулями становится узким местом. Жёсткое решение на этапе восприятия может отбросить неопределённость, а ошибка одного предиката — изменить всю последующую цепочку вывода.

Логические знания как ограничения обучения

Вместо отдельного исполнителя формулы можно преобразовать в дифференцируемый штраф. Для этого атомам сопоставляют степени истинности из [0,1], а логическим связкам — непрерывные операции. Например, одна из возможных интерпретаций конъюнкции — произведение

T(a,b)=ab.

Если известна формула bird(x)\Rightarrow hasWings(x), в функцию потерь можно добавить слагаемое, возрастающее при высокой оценке bird(x) и низкой оценке hasWings(x). Конкретный штраф зависит от выбранной многозначной логики, способа агрегации кванторов и нормализации. Он направляет градиентный спуск, но обычно не равносилен точному доказательству формулы в классической логике. Такой принцип используется, в частности, в Logic Tensor Networks.[1]

Вероятностное логическое программирование

Вероятностная логическая программа задаёт распределение над возможными мирами или ответами на запросы, сохраняя структурированные правила. Нейросеть может выступать как нейронный предикат и выдавать распределение для фактов, которые трудно получить непосредственно из необработанных данных.

В DeepProbLog результат нейросети используется внутри языка ProbLog, а градиент ошибки запроса передаётся к параметрам нейронного компонента. В демонстрационной задаче сеть распознаёт изображения цифр, а программа выражает арифметическое отношение между ними. Система поддерживает совместное обучение нейронных предикатов и параметров вероятностной программы, но структура программы или пространство допустимых правил всё равно должны быть заданы.[1]

Дифференцируемое рассуждение

Дифференцируемые решатели заменяют некоторые дискретные операции — например, унификацию символов или выбор правила — гладкими функциями. Neural Theorem Provers строят вычисление по образцу обратного логического вывода, но сравнивают символы через близость их векторных представлений. Это позволяет обучать представления и параметры вывода по итоговой ошибке.[1]

Цена дифференцируемости — приближённая семантика и вычислительная сложность при большом числе фактов, правил и длинных цепочках доказательства. Высокая оценка запроса в такой модели не всегда означает существование доказательства в обычном логическом исчислении.

Индукция правил

Индукция правил — поиск логической программы, согласующейся с примерами и фоновыми знаниями. Для отношения предка возможна программа из двух дизъюнктов:

ancestor(x,z)\Leftarrow parent(x,z),
ancestor(x,z)\Leftarrow parent(x,y)\wedge ancestor(y,z).

В индуктивном логическом программировании поиск выполняется в дискретном пространстве правил. Дифференцируемые варианты задают шаблоны возможных правил и обучают непрерывные веса кандидатов, после чего могут извлечь дискретную программу. Например, система \partialILP обучалась восстанавливать небольшие логические программы по примерам, в том числе при наличии шума.[1]

Такой подход не устраняет комбинаторную сложность: язык предикатов, максимальная длина правила, допустимые переменные и другие ограничения пространства гипотез обычно задаются разработчиком. Чем выразительнее язык, тем больше кандидатов требуется различать.

Примеры архитектур

DeepProbLog

DeepProbLog предназначен для задач, где неопределённые результаты восприятия должны участвовать в вероятностном логическом выводе. В исходной работе рассматривались распознавание и сложение изображённых цифр, логические задачи с вероятностями и ограниченные постановки индукции программ. Эти эксперименты показывают механизм интеграции, но не означают, что система автоматически открывает произвольные правила по необработанным данным.[1]

Neural Logic Machines

Neural Logic Machines (NLM) обрабатывают тензоры, соответствующие свойствам отдельных объектов и отношениям различной арности. Слои реализуют обучаемые аналоги подстановки, логических связок и квантификации. Авторы проверяли NLM на родственных отношениях, графовых задачах, сортировке, поиске кратчайших путей и планировании в мире блоков; в ряде синтетических экспериментов обучение на малых экземплярах переносилось на более крупные.[1]

NLM работают с заранее определёнными объектами и наборами предикатов. Поэтому эти результаты относятся к структурированным задачам и сами по себе не решают проблему выделения символов из реальных изображений или текста.

Neuro-Symbolic Concept Learner

Neuro-Symbolic Concept Learner (NS-CL) решает задачу ответа на вопросы по синтетическим изображениям CLEVR. Модель строит объектное представление сцены, переводит вопрос в исполнимую программу и выполняет её над объектами. Обучающий сигнал поступает из троек «изображение — вопрос — ответ» без прямой разметки визуальных понятий и программ разбора, заявленных в работе как изучаемые промежуточные компоненты.[1]

Архитектура демонстрирует совместное связывание слов, визуальных признаков и программ в контролируемой предметной области. Перенос этого результата на открытый мир затрудняют неоднозначность языка, неполный набор объектов и отношений и ошибки детектора.

Возможные преимущества

При подходящем интерфейсе между компонентами нейросимволическая система может дать:

  • композиционное обобщение — применение известного правила к новым объектам или сочетаниям признаков;
  • использование фоновых знаний — учёт правил и ограничений, не восстанавливаемых надёжно из одной обучающей выборки;
  • модульную диагностику — раздельную проверку восприятия, представления и вывода;
  • контролируемость — возможность заменить правило или ограничить допустимую программу без полного переобучения всех компонентов;
  • интерпретируемые промежуточные результаты — факты, правила или программы, которые можно исследовать отдельно.

Это возможности архитектуры, а не автоматические гарантии. Извлечённое правило может лишь приближать поведение нейросети, а понятная цепочка вывода не объясняет, почему модуль восприятия выдал исходные факты. Для заявлений об объяснимости необходимо проверять верность промежуточных символов, соответствие правила реальному вычислению и устойчивость объяснения.

Ограничения и открытые проблемы

Заземление символов

Проблема заземления символов (англ. symbol grounding problem) состоит в том, как придать формальным знакам значение, связанное не только с другими знаками, но и с восприятием и действиями системы. Харнад предложил связывать элементарные символы с несимволическими и категориальными представлениями.[1] Нейронный классификатор создаёт возможный канал такой связи, но не гарантирует, что понятие останется устойчивым при смене среды или действительно соответствует человеческому употреблению слова.

Проектирование знаний и пространства поиска

Онтологии, типы, предикаты, шаблоны правил и допустимая глубина вывода часто задаются вручную. Это сокращает объём данных, но переносит часть труда в инженерное проектирование. При расширении языка число заземлённых фактов и кандидатов в правила может расти комбинаторно.

Ошибки и неопределённость

Ошибки восприятия распространяются по цепочке рассуждения. Точный символический исполнитель не исправляет неверный исходный факт. Сохранение распределения вероятностей уменьшает потери информации, но усложняет вывод и требует корректной вероятностной семантики.

Дискретность и дифференцируемость

Точный выбор правила, ветвление программы и унификация дискретны, тогда как обучение нейросети обычно опирается на градиенты. Непрерывные релаксации удобны для оптимизации, но могут давать дробные решения, отличающиеся от дискретной программы. Альтернативные методы поиска и обучения с подкреплением также сталкиваются с большим пространством вариантов и разреженным сигналом качества.

Оценивание

Высокая точность на синтетической задаче ещё не показывает устойчивость к новым понятиям, иной длине доказательства или шумному восприятию. Нужны раздельные проверки качества распознавания, правильности программ и правил, обобщения на новые размеры задачи и итоговой точности. Сравнение с обычной нейросетью и обычным символическим решателем необходимо, чтобы установить пользу именно интеграции.

Связь с философией искусственного интеллекта

Нейросимволический ИИ продолжает спор между символическим подходом и коннекционизмом, но не разрешает его простым соединением двух модулей. Явный символ делает структуру рассуждения доступной для проверки, однако его значение может зависеть от данных, разметки и действий системы. Непрерывное представление может быть обучено из опыта, однако само наличие вектора ещё не показывает, каким понятием он является и как это понятие используется в рассуждении.

Поэтому центральный философский вопрос касается не только формата вычисления, но и происхождения семантики: кто задал предикаты, чем они связаны с миром и при каких изменениях эта связь сохраняется. Нейросимволические модели дают техническую площадку для исследования этих вопросов, но не являются сами по себе доказательством понимания или наличия сильного искусственного интеллекта.

См. также

Примечания


Литература

  • Garcez A. S. d'Avila, Lamb L. C., Gabbay D. M. Neural-Symbolic Cognitive Reasoning. — Berlin, Heidelberg: Springer, 2009.
  • Garcez A. d'Avila, Lamb L. C. Neurosymbolic AI: The 3rd Wave. — 2020.
  • Manhaeve R., Dumančić S., Kimmig A., Demeester T., De Raedt L. DeepProbLog: Neural Probabilistic Logic Programming // Advances in Neural Information Processing Systems. — 2018. — Т. 31.
  • Dong H., Mao J., Lin T., Wang C., Li L., Zhou D. Neural Logic Machines // International Conference on Learning Representations. — 2019.
  • Mao J., Gan C., Kohli P., Tenenbaum J. B., Wu J. The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision // International Conference on Learning Representations. — 2019.
  • Harnad S. The Symbol Grounding Problem // Physica D: Nonlinear Phenomena. — 1990. — Т. 42. — № 1–3. — С. 335–346.
  • Evans R., Grefenstette E. Learning Explanatory Rules from Noisy Data // Journal of Artificial Intelligence Research. — 2018. — Т. 61. — С. 1–64.
Личные инструменты