Нейросимволический искусственный интеллект
Материал из MachineLearning.
(Новая: {{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником ~~~~. Промпт приводится по...) |
|||
| (2 промежуточные версии не показаны) | |||
| Строка 1: | Строка 1: | ||
| - | {{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18: | + | {{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18:07, 11 июля 2026 (MSD). |
| - | + | Промпты и описание редакторской проверки приведены в [[Обсуждение:Нейросимволический искусственный интеллект]]. | |
}} | }} | ||
{{TOCright}} | {{TOCright}} | ||
| - | '''Нейросимволический искусственный интеллект''' (англ. ''neuro-symbolic artificial intelligence'', ''neuro-symbolic AI'') — направление | + | '''Нейросимволический искусственный интеллект''' (англ. ''neuro-symbolic artificial intelligence'', ''neuro-symbolic AI'') — направление [[искусственный интеллект|искусственного интеллекта]], в котором нейронное обучение сочетают с символическим представлением знаний и рассуждением. В зависимости от архитектуры символическая часть может быть базой фактов и правил, логической программой, онтологией, исполнимой программой либо набором ограничений, влияющих на обучение. |
| - | Нейросимволический | + | Нейросимволический ИИ не является одним алгоритмом. Этим термином называют как модульные системы, где [[нейронная сеть]] распознаёт объекты, а отдельный исполнитель применяет к ним правила, так и более тесно интегрированные модели, в которых вероятностный или приближённый логический вывод включён в обучение. Поэтому наличие на входе или выходе слов и других дискретных меток само по себе ещё не означает, что система выполняет символическое рассуждение.<ref name="thirdwave">{{статья |автор=Garcez A. d'Avila, Lamb L. C. |заглавие=Neurosymbolic AI: The 3rd Wave |год=2020 |ссылка=https://arxiv.org/abs/2012.05876}}</ref> |
== Мотивация == | == Мотивация == | ||
| - | Нейронные | + | Нейронные модели умеют извлекать признаки из изображений, аудио и текста и оптимизируются по примерам. Их внутреннее знание обычно распределено по параметрам и непрерывным представлениям. Такое представление полезно для распознавания, но само по себе не задаёт явной процедуры логического вывода и не гарантирует соблюдение известных правил. |
| - | + | Символические системы, напротив, оперируют именованными объектами, предикатами, переменными и правилами. Пусть <tex>parent(x,y)</tex> означает «<tex>x</tex> — родитель <tex>y</tex>». Тогда одно из правил для отношения «дедушка или бабушка» можно записать так: | |
| - | ::<tex> | + | ::<tex>parent(x,y)\wedge parent(y,z)\Rightarrow grandparent(x,z).</tex> |
| - | можно | + | Правило можно прочитать, проверить и применить к объектам, не встречавшимся при его формулировке. Однако символический исполнитель не определит по необработанной фотографии, кто на ней изображён, если система восприятия и связь её результатов с символами не заданы отдельно. |
| - | Нейросимволический | + | Нейросимволический подход пытается связать эти две стороны: научиться получать из данных пригодные для рассуждения сущности и одновременно использовать структуру предметной области при выводе или обучении. |
== Исторический контекст == | == Исторический контекст == | ||
| - | В | + | В классическом символическом ИИ знания представляли правилами, логическими формулами, семантическими сетями и программами. Физическая символьная гипотеза Ньюэлла и Саймона связывала общие интеллектуальные действия со способностью системы создавать и преобразовывать символические структуры.<ref name="newellsimon">{{статья |автор=Newell A., Simon H. A. |заглавие=Computer Science as Empirical Inquiry: Symbols and Search |издание=Communications of the ACM |год=1976 |том=19 |номер=3 |страницы=113–126 |doi=10.1145/360018.360022}}</ref> |
| - | + | Параллельно развивался коннекционизм, в котором вычисление и обучение описываются сетями простых взаимодействующих элементов и распределёнными представлениями. Противопоставление двух программ исследования не было абсолютным: способы переводить логические знания в нейронные сети и извлекать правила из сетей изучаются многие десятилетия. Современное направление продолжает эту линию с использованием глубокого обучения, вероятностного программирования и дифференцируемых вычислений.<ref name="garcezbook">{{книга |автор=Garcez A. S. d'Avila, Lamb L. C., Gabbay D. M. |заглавие=Neural-Symbolic Cognitive Reasoning |место=Berlin, Heidelberg |издательство=Springer |год=2009 |doi=10.1007/978-3-540-73246-4}}</ref> | |
| - | == | + | == Нейронные и символические представления == |
| - | + | Нейронная модель с параметрами <tex>\theta</tex> обычно вычисляет прогноз или распределение | |
| - | ::<tex>p_\theta(y\mid x) | + | ::<tex>p_\theta(y\mid x).</tex> |
| - | + | Понятия в такой модели могут соответствовать направлениям или областям непрерывного пространства, однако заранее установленное взаимно однозначное соответствие между отдельным нейроном и отдельным понятием обычно отсутствует. | |
| - | В символическом представлении | + | В символическом представлении используются дискретные термы и отношения. Например, факты <tex>red(cubeA)</tex> и <tex>leftof(cubeA,sphereA)</tex> утверждают, что куб красный и расположен слева от шара. При принятой семантике пространственных отношений можно задать правило |
| - | :<tex> | + | ::<tex>leftof(x,y)\Rightarrow rightof(y,x).</tex> |
| - | + | После подстановки констант исполнитель получает новый факт <tex>rightof(sphereA,cubeA)</tex>. Такой вывод зависит не только от записей в базе, но и от выбранной логики: классической, вероятностной, нечёткой, немонотонной или иной. Поэтому «символическая часть» разных нейросимволических систем может иметь различную семантику и различные гарантии. | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
== Основные схемы интеграции == | == Основные схемы интеграции == | ||
| Строка 55: | Строка 44: | ||
=== Нейронное восприятие и символический исполнитель === | === Нейронное восприятие и символический исполнитель === | ||
| - | + | В модульной схеме нейросеть выделяет объекты, их атрибуты и отношения, а символический исполнитель работает с полученным описанием сцены. Например, в задаче ответа на вопрос по изображению один модуль формирует объектное представление, другой переводит вопрос в программу наподобие «выбрать шары, оставить синие, посчитать», после чего программа исполняется над сценой. | |
| - | + | Промежуточные представления облегчают диагностику: можно различить ошибку обнаружения объекта, неверный разбор вопроса и ошибку исполнения. Но интерфейс между модулями становится узким местом. Жёсткое решение на этапе восприятия может отбросить неопределённость, а ошибка одного предиката — изменить всю последующую цепочку вывода. | |
| - | + | === Логические знания как ограничения обучения === | |
| - | + | Вместо отдельного исполнителя формулы можно преобразовать в дифференцируемый штраф. Для этого атомам сопоставляют степени истинности из <tex>[0,1]</tex>, а логическим связкам — непрерывные операции. Например, одна из возможных интерпретаций конъюнкции — произведение | |
| - | + | ::<tex>T(a,b)=ab.</tex> | |
| - | + | Если известна формула <tex>bird(x)\Rightarrow hasWings(x)</tex>, в функцию потерь можно добавить слагаемое, возрастающее при высокой оценке <tex>bird(x)</tex> и низкой оценке <tex>hasWings(x)</tex>. Конкретный штраф зависит от выбранной многозначной логики, способа агрегации кванторов и нормализации. Он направляет [[градиентный спуск]], но обычно не равносилен точному доказательству формулы в классической логике. Такой принцип используется, в частности, в Logic Tensor Networks.<ref name="ltn">{{статья |автор=Serafini L., Garcez A. d'Avila |заглавие=Logic Tensor Networks: Deep Learning and Logical Reasoning from Data and Knowledge |год=2016 |ссылка=https://arxiv.org/abs/1606.04422}}</ref> | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
=== Вероятностное логическое программирование === | === Вероятностное логическое программирование === | ||
| - | + | Вероятностная логическая программа задаёт распределение над возможными мирами или ответами на запросы, сохраняя структурированные правила. Нейросеть может выступать как ''нейронный предикат'' и выдавать распределение для фактов, которые трудно получить непосредственно из необработанных данных. | |
| - | + | В DeepProbLog результат нейросети используется внутри языка ProbLog, а градиент ошибки запроса передаётся к параметрам нейронного компонента. В демонстрационной задаче сеть распознаёт изображения цифр, а программа выражает арифметическое отношение между ними. Система поддерживает совместное обучение нейронных предикатов и параметров вероятностной программы, но структура программы или пространство допустимых правил всё равно должны быть заданы.<ref name="deepproblog">{{статья |автор=Manhaeve R., Dumančić S., Kimmig A., Demeester T., De Raedt L. |заглавие=DeepProbLog: Neural Probabilistic Logic Programming |издание=Advances in Neural Information Processing Systems |год=2018 |том=31 |ссылка=https://proceedings.neurips.cc/paper/2018/hash/dc5d637ed5e62c36ecb73b654b05ba2a-Abstract.html}}</ref> | |
=== Дифференцируемое рассуждение === | === Дифференцируемое рассуждение === | ||
| - | + | Дифференцируемые решатели заменяют некоторые дискретные операции — например, унификацию символов или выбор правила — гладкими функциями. Neural Theorem Provers строят вычисление по образцу обратного логического вывода, но сравнивают символы через близость их векторных представлений. Это позволяет обучать представления и параметры вывода по итоговой ошибке.<ref name="ntp">{{статья |автор=Rocktäschel T., Riedel S. |заглавие=End-to-End Differentiable Proving |издание=Advances in Neural Information Processing Systems |год=2017 |том=30 |ссылка=https://proceedings.neurips.cc/paper/2017/hash/b2ab001909a8a6f04b51920306046ce5-Abstract.html}}</ref> | |
| - | + | Цена дифференцируемости — приближённая семантика и вычислительная сложность при большом числе фактов, правил и длинных цепочках доказательства. Высокая оценка запроса в такой модели не всегда означает существование доказательства в обычном логическом исчислении. | |
== Индукция правил == | == Индукция правил == | ||
| - | + | '''Индукция правил''' — поиск логической программы, согласующейся с примерами и фоновыми знаниями. Для отношения предка возможна программа из двух дизъюнктов: | |
| - | + | ::<tex>ancestor(x,z)\Leftarrow parent(x,z),</tex> | |
| - | ::<tex> | + | ::<tex>ancestor(x,z)\Leftarrow parent(x,y)\wedge ancestor(y,z).</tex> |
| - | + | В [[индуктивное логическое программирование|индуктивном логическом программировании]] поиск выполняется в дискретном пространстве правил. Дифференцируемые варианты задают шаблоны возможных правил и обучают непрерывные веса кандидатов, после чего могут извлечь дискретную программу. Например, система <tex>\partial</tex>ILP обучалась восстанавливать небольшие логические программы по примерам, в том числе при наличии шума.<ref name="dilp">{{статья |автор=Evans R., Grefenstette E. |заглавие=Learning Explanatory Rules from Noisy Data |издание=Journal of Artificial Intelligence Research |год=2018 |том=61 |страницы=1–64 |doi=10.1613/jair.5714}}</ref> | |
| - | + | Такой подход не устраняет комбинаторную сложность: язык предикатов, максимальная длина правила, допустимые переменные и другие ограничения пространства гипотез обычно задаются разработчиком. Чем выразительнее язык, тем больше кандидатов требуется различать. | |
| - | == Примеры | + | == Примеры архитектур == |
=== DeepProbLog === | === DeepProbLog === | ||
| - | DeepProbLog | + | DeepProbLog предназначен для задач, где неопределённые результаты восприятия должны участвовать в вероятностном логическом выводе. В исходной работе рассматривались распознавание и сложение изображённых цифр, логические задачи с вероятностями и ограниченные постановки индукции программ. Эти эксперименты показывают механизм интеграции, но не означают, что система автоматически открывает произвольные правила по необработанным данным.<ref name="deepproblog"/> |
=== Neural Logic Machines === | === Neural Logic Machines === | ||
| - | Neural Logic Machines | + | Neural Logic Machines (NLM) обрабатывают тензоры, соответствующие свойствам отдельных объектов и отношениям различной арности. Слои реализуют обучаемые аналоги подстановки, логических связок и квантификации. Авторы проверяли NLM на родственных отношениях, графовых задачах, сортировке, поиске кратчайших путей и планировании в мире блоков; в ряде синтетических экспериментов обучение на малых экземплярах переносилось на более крупные.<ref name="nlm">{{статья |автор=Dong H., Mao J., Lin T., Wang C., Li L., Zhou D. |заглавие=Neural Logic Machines |издание=International Conference on Learning Representations |год=2019 |ссылка=https://openreview.net/forum?id=B1xY-hRctX}}</ref> |
| + | |||
| + | NLM работают с заранее определёнными объектами и наборами предикатов. Поэтому эти результаты относятся к структурированным задачам и сами по себе не решают проблему выделения символов из реальных изображений или текста. | ||
=== Neuro-Symbolic Concept Learner === | === Neuro-Symbolic Concept Learner === | ||
| - | Neuro-Symbolic Concept Learner строит объектное представление сцены, переводит вопрос | + | Neuro-Symbolic Concept Learner (NS-CL) решает задачу ответа на вопросы по синтетическим изображениям CLEVR. Модель строит объектное представление сцены, переводит вопрос в исполнимую программу и выполняет её над объектами. Обучающий сигнал поступает из троек «изображение — вопрос — ответ» без прямой разметки визуальных понятий и программ разбора, заявленных в работе как изучаемые промежуточные компоненты.<ref name="nscl">{{статья |автор=Mao J., Gan C., Kohli P., Tenenbaum J. B., Wu J. |заглавие=The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision |издание=International Conference on Learning Representations |год=2019 |ссылка=https://openreview.net/forum?id=rJgMlhRctm}}</ref> |
| - | + | Архитектура демонстрирует совместное связывание слов, визуальных признаков и программ в контролируемой предметной области. Перенос этого результата на открытый мир затрудняют неоднозначность языка, неполный набор объектов и отношений и ошибки детектора. | |
| - | + | == Возможные преимущества == | |
| - | + | При подходящем интерфейсе между компонентами нейросимволическая система может дать: | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | * '''композиционное обобщение''' — применение известного правила к новым объектам или сочетаниям признаков; | |
| + | * '''использование фоновых знаний''' — учёт правил и ограничений, не восстанавливаемых надёжно из одной обучающей выборки; | ||
| + | * '''модульную диагностику''' — раздельную проверку восприятия, представления и вывода; | ||
| + | * '''контролируемость''' — возможность заменить правило или ограничить допустимую программу без полного переобучения всех компонентов; | ||
| + | * '''интерпретируемые промежуточные результаты''' — факты, правила или программы, которые можно исследовать отдельно. | ||
| + | |||
| + | Это возможности архитектуры, а не автоматические гарантии. Извлечённое правило может лишь приближать поведение нейросети, а понятная цепочка вывода не объясняет, почему модуль восприятия выдал исходные факты. Для заявлений об объяснимости необходимо проверять верность промежуточных символов, соответствие правила реальному вычислению и устойчивость объяснения. | ||
== Ограничения и открытые проблемы == | == Ограничения и открытые проблемы == | ||
| - | + | === Заземление символов === | |
| + | |||
| + | '''Проблема заземления символов''' (англ. ''symbol grounding problem'') состоит в том, как придать формальным знакам значение, связанное не только с другими знаками, но и с восприятием и действиями системы. Харнад предложил связывать элементарные символы с несимволическими и категориальными представлениями.<ref name="harnad">{{статья |автор=Harnad S. |заглавие=The Symbol Grounding Problem |издание=Physica D: Nonlinear Phenomena |год=1990 |том=42 |номер=1–3 |страницы=335–346 |doi=10.1016/0167-2789(90)90087-6}}</ref> Нейронный классификатор создаёт возможный канал такой связи, но не гарантирует, что понятие останется устойчивым при смене среды или действительно соответствует человеческому употреблению слова. | ||
| + | |||
| + | === Проектирование знаний и пространства поиска === | ||
| + | |||
| + | Онтологии, типы, предикаты, шаблоны правил и допустимая глубина вывода часто задаются вручную. Это сокращает объём данных, но переносит часть труда в инженерное проектирование. При расширении языка число заземлённых фактов и кандидатов в правила может расти комбинаторно. | ||
| + | |||
| + | === Ошибки и неопределённость === | ||
| + | |||
| + | Ошибки восприятия распространяются по цепочке рассуждения. Точный символический исполнитель не исправляет неверный исходный факт. Сохранение распределения вероятностей уменьшает потери информации, но усложняет вывод и требует корректной вероятностной семантики. | ||
| + | |||
| + | === Дискретность и дифференцируемость === | ||
| - | + | Точный выбор правила, ветвление программы и унификация дискретны, тогда как обучение нейросети обычно опирается на градиенты. Непрерывные релаксации удобны для оптимизации, но могут давать дробные решения, отличающиеся от дискретной программы. Альтернативные методы поиска и обучения с подкреплением также сталкиваются с большим пространством вариантов и разреженным сигналом качества. | |
| - | + | === Оценивание === | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | Высокая точность на синтетической задаче ещё не показывает устойчивость к новым понятиям, иной длине доказательства или шумному восприятию. Нужны раздельные проверки качества распознавания, правильности программ и правил, обобщения на новые размеры задачи и итоговой точности. Сравнение с обычной нейросетью и обычным символическим решателем необходимо, чтобы установить пользу именно интеграции. | |
== Связь с философией искусственного интеллекта == | == Связь с философией искусственного интеллекта == | ||
| - | Нейросимволический ИИ | + | Нейросимволический ИИ продолжает спор между символическим подходом и коннекционизмом, но не разрешает его простым соединением двух модулей. Явный символ делает структуру рассуждения доступной для проверки, однако его значение может зависеть от данных, разметки и действий системы. Непрерывное представление может быть обучено из опыта, однако само наличие вектора ещё не показывает, каким понятием он является и как это понятие используется в рассуждении. |
| - | + | Поэтому центральный философский вопрос касается не только формата вычисления, но и происхождения семантики: кто задал предикаты, чем они связаны с миром и при каких изменениях эта связь сохраняется. Нейросимволические модели дают техническую площадку для исследования этих вопросов, но не являются сами по себе доказательством понимания или наличия сильного искусственного интеллекта. | |
== См. также == | == См. также == | ||
* [[Искусственный интеллект]] | * [[Искусственный интеллект]] | ||
| + | * [[Машинное обучение]] | ||
* [[Нейронная сеть]] | * [[Нейронная сеть]] | ||
* [[Глубокое обучение]] | * [[Глубокое обучение]] | ||
* [[Обработка естественного языка]] | * [[Обработка естественного языка]] | ||
* [[Графовая нейронная сеть]] | * [[Графовая нейронная сеть]] | ||
| - | |||
| - | |||
| - | |||
== Примечания == | == Примечания == | ||
| - | + | <references /> | |
== Литература == | == Литература == | ||
| - | * {{книга |автор=Garcez A. S. | + | * {{книга |автор=Garcez A. S. d'Avila, Lamb L. C., Gabbay D. M. |заглавие=Neural-Symbolic Cognitive Reasoning |место=Berlin, Heidelberg |издательство=Springer |год=2009 |doi=10.1007/978-3-540-73246-4}} |
| - | * {{статья |автор=Manhaeve R., Dumančić S., Kimmig A., Demeester T., De Raedt L. |заглавие=DeepProbLog: Neural Probabilistic Logic Programming |издание=Advances in Neural Information Processing Systems |год=2018 |том=31 | + | * {{статья |автор=Garcez A. d'Avila, Lamb L. C. |заглавие=Neurosymbolic AI: The 3rd Wave |год=2020 |ссылка=https://arxiv.org/abs/2012.05876}} |
| - | * {{статья |автор=Dong H., Mao J., Lin T., Wang C., Li L., Zhou D. |заглавие=Neural Logic Machines |издание=International Conference on Learning Representations |год=2019 |ссылка=https:// | + | * {{статья |автор=Manhaeve R., Dumančić S., Kimmig A., Demeester T., De Raedt L. |заглавие=DeepProbLog: Neural Probabilistic Logic Programming |издание=Advances in Neural Information Processing Systems |год=2018 |том=31 |ссылка=https://proceedings.neurips.cc/paper/2018/hash/dc5d637ed5e62c36ecb73b654b05ba2a-Abstract.html}} |
| - | * {{статья |автор=Mao J., Gan C., Kohli P., Tenenbaum J. B., Wu J. |заглавие=The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision |издание=International Conference on Learning Representations |год=2019 |ссылка=https:// | + | * {{статья |автор=Dong H., Mao J., Lin T., Wang C., Li L., Zhou D. |заглавие=Neural Logic Machines |издание=International Conference on Learning Representations |год=2019 |ссылка=https://openreview.net/forum?id=B1xY-hRctX}} |
| + | * {{статья |автор=Mao J., Gan C., Kohli P., Tenenbaum J. B., Wu J. |заглавие=The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision |издание=International Conference on Learning Representations |год=2019 |ссылка=https://openreview.net/forum?id=rJgMlhRctm}} | ||
| + | * {{статья |автор=Harnad S. |заглавие=The Symbol Grounding Problem |издание=Physica D: Nonlinear Phenomena |год=1990 |том=42 |номер=1–3 |страницы=335–346 |doi=10.1016/0167-2789(90)90087-6}} | ||
| + | * {{статья |автор=Evans R., Grefenstette E. |заглавие=Learning Explanatory Rules from Noisy Data |издание=Journal of Artificial Intelligence Research |год=2018 |том=61 |страницы=1–64 |doi=10.1613/jair.5714}} | ||
| - | [[Категория: | + | {{DEFAULTSORT:Нейросимволический искусственный интеллект}} |
| + | [[Категория:Машинное обучение]] | ||
| + | [[Категория:Нейронные сети]] | ||
Текущая версия
| | Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 18:07, 11 июля 2026 (MSD).
Промпты и описание редакторской проверки приведены в Обсуждение:Нейросимволический искусственный интеллект. |
|
Нейросимволический искусственный интеллект (англ. neuro-symbolic artificial intelligence, neuro-symbolic AI) — направление искусственного интеллекта, в котором нейронное обучение сочетают с символическим представлением знаний и рассуждением. В зависимости от архитектуры символическая часть может быть базой фактов и правил, логической программой, онтологией, исполнимой программой либо набором ограничений, влияющих на обучение.
Нейросимволический ИИ не является одним алгоритмом. Этим термином называют как модульные системы, где нейронная сеть распознаёт объекты, а отдельный исполнитель применяет к ним правила, так и более тесно интегрированные модели, в которых вероятностный или приближённый логический вывод включён в обучение. Поэтому наличие на входе или выходе слов и других дискретных меток само по себе ещё не означает, что система выполняет символическое рассуждение.[1]
Мотивация
Нейронные модели умеют извлекать признаки из изображений, аудио и текста и оптимизируются по примерам. Их внутреннее знание обычно распределено по параметрам и непрерывным представлениям. Такое представление полезно для распознавания, но само по себе не задаёт явной процедуры логического вывода и не гарантирует соблюдение известных правил.
Символические системы, напротив, оперируют именованными объектами, предикатами, переменными и правилами. Пусть означает «
— родитель
». Тогда одно из правил для отношения «дедушка или бабушка» можно записать так:
Правило можно прочитать, проверить и применить к объектам, не встречавшимся при его формулировке. Однако символический исполнитель не определит по необработанной фотографии, кто на ней изображён, если система восприятия и связь её результатов с символами не заданы отдельно.
Нейросимволический подход пытается связать эти две стороны: научиться получать из данных пригодные для рассуждения сущности и одновременно использовать структуру предметной области при выводе или обучении.
Исторический контекст
В классическом символическом ИИ знания представляли правилами, логическими формулами, семантическими сетями и программами. Физическая символьная гипотеза Ньюэлла и Саймона связывала общие интеллектуальные действия со способностью системы создавать и преобразовывать символические структуры.[1]
Параллельно развивался коннекционизм, в котором вычисление и обучение описываются сетями простых взаимодействующих элементов и распределёнными представлениями. Противопоставление двух программ исследования не было абсолютным: способы переводить логические знания в нейронные сети и извлекать правила из сетей изучаются многие десятилетия. Современное направление продолжает эту линию с использованием глубокого обучения, вероятностного программирования и дифференцируемых вычислений.[1]
Нейронные и символические представления
Нейронная модель с параметрами обычно вычисляет прогноз или распределение
Понятия в такой модели могут соответствовать направлениям или областям непрерывного пространства, однако заранее установленное взаимно однозначное соответствие между отдельным нейроном и отдельным понятием обычно отсутствует.
В символическом представлении используются дискретные термы и отношения. Например, факты и
утверждают, что куб красный и расположен слева от шара. При принятой семантике пространственных отношений можно задать правило
После подстановки констант исполнитель получает новый факт . Такой вывод зависит не только от записей в базе, но и от выбранной логики: классической, вероятностной, нечёткой, немонотонной или иной. Поэтому «символическая часть» разных нейросимволических систем может иметь различную семантику и различные гарантии.
Основные схемы интеграции
Нейронное восприятие и символический исполнитель
В модульной схеме нейросеть выделяет объекты, их атрибуты и отношения, а символический исполнитель работает с полученным описанием сцены. Например, в задаче ответа на вопрос по изображению один модуль формирует объектное представление, другой переводит вопрос в программу наподобие «выбрать шары, оставить синие, посчитать», после чего программа исполняется над сценой.
Промежуточные представления облегчают диагностику: можно различить ошибку обнаружения объекта, неверный разбор вопроса и ошибку исполнения. Но интерфейс между модулями становится узким местом. Жёсткое решение на этапе восприятия может отбросить неопределённость, а ошибка одного предиката — изменить всю последующую цепочку вывода.
Логические знания как ограничения обучения
Вместо отдельного исполнителя формулы можно преобразовать в дифференцируемый штраф. Для этого атомам сопоставляют степени истинности из , а логическим связкам — непрерывные операции. Например, одна из возможных интерпретаций конъюнкции — произведение
Если известна формула , в функцию потерь можно добавить слагаемое, возрастающее при высокой оценке
и низкой оценке
. Конкретный штраф зависит от выбранной многозначной логики, способа агрегации кванторов и нормализации. Он направляет градиентный спуск, но обычно не равносилен точному доказательству формулы в классической логике. Такой принцип используется, в частности, в Logic Tensor Networks.[1]
Вероятностное логическое программирование
Вероятностная логическая программа задаёт распределение над возможными мирами или ответами на запросы, сохраняя структурированные правила. Нейросеть может выступать как нейронный предикат и выдавать распределение для фактов, которые трудно получить непосредственно из необработанных данных.
В DeepProbLog результат нейросети используется внутри языка ProbLog, а градиент ошибки запроса передаётся к параметрам нейронного компонента. В демонстрационной задаче сеть распознаёт изображения цифр, а программа выражает арифметическое отношение между ними. Система поддерживает совместное обучение нейронных предикатов и параметров вероятностной программы, но структура программы или пространство допустимых правил всё равно должны быть заданы.[1]
Дифференцируемое рассуждение
Дифференцируемые решатели заменяют некоторые дискретные операции — например, унификацию символов или выбор правила — гладкими функциями. Neural Theorem Provers строят вычисление по образцу обратного логического вывода, но сравнивают символы через близость их векторных представлений. Это позволяет обучать представления и параметры вывода по итоговой ошибке.[1]
Цена дифференцируемости — приближённая семантика и вычислительная сложность при большом числе фактов, правил и длинных цепочках доказательства. Высокая оценка запроса в такой модели не всегда означает существование доказательства в обычном логическом исчислении.
Индукция правил
Индукция правил — поиск логической программы, согласующейся с примерами и фоновыми знаниями. Для отношения предка возможна программа из двух дизъюнктов:
В индуктивном логическом программировании поиск выполняется в дискретном пространстве правил. Дифференцируемые варианты задают шаблоны возможных правил и обучают непрерывные веса кандидатов, после чего могут извлечь дискретную программу. Например, система ILP обучалась восстанавливать небольшие логические программы по примерам, в том числе при наличии шума.[1]
Такой подход не устраняет комбинаторную сложность: язык предикатов, максимальная длина правила, допустимые переменные и другие ограничения пространства гипотез обычно задаются разработчиком. Чем выразительнее язык, тем больше кандидатов требуется различать.
Примеры архитектур
DeepProbLog
DeepProbLog предназначен для задач, где неопределённые результаты восприятия должны участвовать в вероятностном логическом выводе. В исходной работе рассматривались распознавание и сложение изображённых цифр, логические задачи с вероятностями и ограниченные постановки индукции программ. Эти эксперименты показывают механизм интеграции, но не означают, что система автоматически открывает произвольные правила по необработанным данным.[1]
Neural Logic Machines
Neural Logic Machines (NLM) обрабатывают тензоры, соответствующие свойствам отдельных объектов и отношениям различной арности. Слои реализуют обучаемые аналоги подстановки, логических связок и квантификации. Авторы проверяли NLM на родственных отношениях, графовых задачах, сортировке, поиске кратчайших путей и планировании в мире блоков; в ряде синтетических экспериментов обучение на малых экземплярах переносилось на более крупные.[1]
NLM работают с заранее определёнными объектами и наборами предикатов. Поэтому эти результаты относятся к структурированным задачам и сами по себе не решают проблему выделения символов из реальных изображений или текста.
Neuro-Symbolic Concept Learner
Neuro-Symbolic Concept Learner (NS-CL) решает задачу ответа на вопросы по синтетическим изображениям CLEVR. Модель строит объектное представление сцены, переводит вопрос в исполнимую программу и выполняет её над объектами. Обучающий сигнал поступает из троек «изображение — вопрос — ответ» без прямой разметки визуальных понятий и программ разбора, заявленных в работе как изучаемые промежуточные компоненты.[1]
Архитектура демонстрирует совместное связывание слов, визуальных признаков и программ в контролируемой предметной области. Перенос этого результата на открытый мир затрудняют неоднозначность языка, неполный набор объектов и отношений и ошибки детектора.
Возможные преимущества
При подходящем интерфейсе между компонентами нейросимволическая система может дать:
- композиционное обобщение — применение известного правила к новым объектам или сочетаниям признаков;
- использование фоновых знаний — учёт правил и ограничений, не восстанавливаемых надёжно из одной обучающей выборки;
- модульную диагностику — раздельную проверку восприятия, представления и вывода;
- контролируемость — возможность заменить правило или ограничить допустимую программу без полного переобучения всех компонентов;
- интерпретируемые промежуточные результаты — факты, правила или программы, которые можно исследовать отдельно.
Это возможности архитектуры, а не автоматические гарантии. Извлечённое правило может лишь приближать поведение нейросети, а понятная цепочка вывода не объясняет, почему модуль восприятия выдал исходные факты. Для заявлений об объяснимости необходимо проверять верность промежуточных символов, соответствие правила реальному вычислению и устойчивость объяснения.
Ограничения и открытые проблемы
Заземление символов
Проблема заземления символов (англ. symbol grounding problem) состоит в том, как придать формальным знакам значение, связанное не только с другими знаками, но и с восприятием и действиями системы. Харнад предложил связывать элементарные символы с несимволическими и категориальными представлениями.[1] Нейронный классификатор создаёт возможный канал такой связи, но не гарантирует, что понятие останется устойчивым при смене среды или действительно соответствует человеческому употреблению слова.
Проектирование знаний и пространства поиска
Онтологии, типы, предикаты, шаблоны правил и допустимая глубина вывода часто задаются вручную. Это сокращает объём данных, но переносит часть труда в инженерное проектирование. При расширении языка число заземлённых фактов и кандидатов в правила может расти комбинаторно.
Ошибки и неопределённость
Ошибки восприятия распространяются по цепочке рассуждения. Точный символический исполнитель не исправляет неверный исходный факт. Сохранение распределения вероятностей уменьшает потери информации, но усложняет вывод и требует корректной вероятностной семантики.
Дискретность и дифференцируемость
Точный выбор правила, ветвление программы и унификация дискретны, тогда как обучение нейросети обычно опирается на градиенты. Непрерывные релаксации удобны для оптимизации, но могут давать дробные решения, отличающиеся от дискретной программы. Альтернативные методы поиска и обучения с подкреплением также сталкиваются с большим пространством вариантов и разреженным сигналом качества.
Оценивание
Высокая точность на синтетической задаче ещё не показывает устойчивость к новым понятиям, иной длине доказательства или шумному восприятию. Нужны раздельные проверки качества распознавания, правильности программ и правил, обобщения на новые размеры задачи и итоговой точности. Сравнение с обычной нейросетью и обычным символическим решателем необходимо, чтобы установить пользу именно интеграции.
Связь с философией искусственного интеллекта
Нейросимволический ИИ продолжает спор между символическим подходом и коннекционизмом, но не разрешает его простым соединением двух модулей. Явный символ делает структуру рассуждения доступной для проверки, однако его значение может зависеть от данных, разметки и действий системы. Непрерывное представление может быть обучено из опыта, однако само наличие вектора ещё не показывает, каким понятием он является и как это понятие используется в рассуждении.
Поэтому центральный философский вопрос касается не только формата вычисления, но и происхождения семантики: кто задал предикаты, чем они связаны с миром и при каких изменениях эта связь сохраняется. Нейросимволические модели дают техническую площадку для исследования этих вопросов, но не являются сами по себе доказательством понимания или наличия сильного искусственного интеллекта.
См. также
- Искусственный интеллект
- Машинное обучение
- Нейронная сеть
- Глубокое обучение
- Обработка естественного языка
- Графовая нейронная сеть
Примечания
Литература
- Garcez A. S. d'Avila, Lamb L. C., Gabbay D. M. Neural-Symbolic Cognitive Reasoning. — Berlin, Heidelberg: Springer, 2009.
- Garcez A. d'Avila, Lamb L. C. Neurosymbolic AI: The 3rd Wave. — 2020.
- Manhaeve R., Dumančić S., Kimmig A., Demeester T., De Raedt L. DeepProbLog: Neural Probabilistic Logic Programming // Advances in Neural Information Processing Systems. — 2018. — Т. 31.
- Dong H., Mao J., Lin T., Wang C., Li L., Zhou D. Neural Logic Machines // International Conference on Learning Representations. — 2019.
- Mao J., Gan C., Kohli P., Tenenbaum J. B., Wu J. The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision // International Conference on Learning Representations. — 2019.
- Harnad S. The Symbol Grounding Problem // Physica D: Nonlinear Phenomena. — 1990. — Т. 42. — № 1–3. — С. 335–346.
- Evans R., Grefenstette E. Learning Explanatory Rules from Noisy Data // Journal of Artificial Intelligence Research. — 2018. — Т. 61. — С. 1–64.

