Парадокс Моравека
Материал из MachineLearning.
| | Статья написана с использованием LLM Claude Fable 5 и проверена участником Iakov Poteкhin 21:23, 19 июля 2026 (MSD) |
Парадокс Моравека (англ. Moravec's paradox) — эмпирическое наблюдение в области искусственного интеллекта и робототехники: задачи, требующие от человека сознательных интеллектуальных усилий — логический вывод, игра в шахматы, символьные вычисления, — оказались сравнительно лёгкими для машин, тогда как сенсомоторные навыки и восприятие, которые человек выполняет без видимых усилий, — чрезвычайно трудными для воспроизведения. Наблюдение сформулировано в 1980-х годах робототехником Хансом Моравеком и независимо отмечалось Родни Бруксом и Марвином Минским. Парадокс до сих пор служит одним из главных ориентиров при оценке того, какие виды человеческой деятельности поддаются автоматизации, а какие — нет.
Содержание |
Мотивировка
Наблюдение называют парадоксом не потому, что оно содержит логическое противоречие, а потому, что оно опрокинуло интуицию основателей области. Пионеры ИИ 1950-х годов были в большинстве своём математиками и логиками; вершиной интеллекта им представлялись доказательство теорем, шахматы и алгебра — то, что даётся людям с трудом и лишь после долгого обучения. Ходьба, узнавание лиц или ловля мяча в этой картине мира вообще не считались «интеллектом»: раз с ними справляется любой ребёнок, задача казалась тривиальной.
Ожидания были соответствующими. Заявка 1955 года на проведение Дартмутского семинара исходила из гипотезы, что любой аспект обучения и интеллекта можно описать настолько точно, чтобы его смоделировала машина, и что заметного прогресса можно добиться за одно лето работы небольшой группы исследователей[1].
Символом этого оптимизма стала легенда о «летнем проекте по зрению»: в 1966 году Марвин Минский якобы поручил студенту Джеральду Сассману за лето подключить камеру к компьютеру и научить машину описывать увиденное. В таком виде история документально не подтверждена, но подтверждена её чуть более скромная и не менее показательная версия: в июле 1966 года Сеймур Пейперт выпустил меморандум MIT AI Memo № 100 «The Summer Vision Project», в котором построение существенной части системы машинного зрения — сегментация сцены, распознавание объектов — планировалось как летняя работа группы студентов MIT[1]. Компьютерное зрение потребовало в итоге не одного лета, а полувека, и остаётся активной областью исследований по сей день. Разрыв между этими ожиданиями и реальностью последующих десятилетий и есть то, что фиксирует парадокс Моравека.
Историческая справка
Каноническую формулировку дал Ханс Моравек (Hans Moravec), робототехник из Университета Карнеги — Меллона, в книге «Mind Children: The Future of Robot and Human Intelligence» (1988): сравнительно легко добиться от компьютера результатов взрослого человека в тестах на интеллект или игре в шашки, но трудно или невозможно дать машине навыки годовалого ребёнка в том, что касается восприятия и мобильности[1]. Моравек писал со знанием дела: в 1970-х он работал над Stanford Cart, одним из первых автономных мобильных роботов, которому пересечение комнаты, заставленной стульями, занимало часы машинного времени.
Параллельно к тем же выводам пришёл Родни Брукс (Rodney Brooks) из MIT. В статьях «Elephants Don't Play Chess» (1990) и «Intelligence Without Representation» (1991) он указывал: эволюция потратила миллиарды лет на восприятие и мобильность, а способность к абстрактному рассуждению появилась в последний момент — следовательно, трудным ядром интеллекта является именно телесное взаимодействие со средой, а не символьные манипуляции[1][1].
Ещё раньше Марвин Минский в «The Society of Mind» (1986) заметил, что мы менее всего осознаём то, что наш разум делает лучше всего: работа хорошо отлаженных когнитивных процессов скрыта от интроспекции, и потому кажется, будто её вовсе нет[1]. Стивен Пинкер в «The Language Instinct» (1994) назвал это главным уроком тридцати пяти лет исследований ИИ: трудные проблемы оказались лёгкими, а лёгкие — трудными[1].
Объяснение Моравека
Моравек предложил эволюционное объяснение. Сенсомоторные навыки — зрение, слух, координация движений, ориентация в пространстве — оттачивались естественным отбором сотни миллионов лет и реализованы в мозге огромными, высокооптимизированными параллельными структурами. Абстрактное мышление — символьная логика, счёт, долгосрочное планирование — эволюционно недавняя надстройка возрастом, по разным оценкам, в десятки или сотни тысяч лет: тонкий слой поверх древней машинерии. Новая способность не успела подвергнуться жёсткой оптимизации, выполняется медленно и последовательно, зато доступна интроспекции — и потому её сравнительно легко воспроизвести программно. Древние навыки, напротив, скрыты от сознания: мы не знаем, как мы видим, и потому не можем просто записать алгоритм зрения со слов эксперта.
В инженерной переформулировке парадокс звучит так: сознательная трудность задачи для человека — плохой предиктор её вычислительной сложности. Интроспективная лёгкость означает лишь то, что вычисления выполняются древней, непрозрачной для нас аппаратурой; реконструировать (в терминах обратной разработки) навык тем труднее, чем дольше эволюция его оптимизировала.
Родственное наблюдение известно в философии как парадокс Полани: «мы знаем больше, чем можем рассказать» — значительная часть человеческого умения существует в форме неявного знания, не поддающегося эксплицитной формализации[1]. Именно на неявном знании держатся восприятие и здравый смысл, а попытки формализовать здравый смысл в логике упираются в проблему фрейма — трудность компактно описать, что именно меняется и, главное, не меняется в мире при каждом действии[1].
Влияние на развитие ИИ
Первым практическим следствием парадокса стал кризис символьного подхода в робототехнике. Классическая архитектура «восприятие → построение модели мира → планирование → действие» оказалась безнадёжно медленной и хрупкой в реальной среде. Ответом Брукса стала поведенческая робототехника и субсумпционная архитектура: интеллект без центральной модели мира, собранный из простых замкнутых контуров «сенсор — действие». Из этой программы выросло целое направление — воплощённый ИИ (англ. embodied AI), рассматривающее тело и среду не как досадные помехи, а как конститутивную часть интеллекта.
Второе следствие — смещение от ручной формализации к обучению из данных. Восприятие не удалось запрограммировать, но его удалось выучить: переломным моментом считается победа свёрточной сети AlexNet в конкурсе ImageNet в 2012 году[1], после которой глубокое обучение за несколько лет радикально подняло качество машинного зрения и распознавания речи. В этом смысле парадокс частично «размылся» со стороны восприятия: пассивное распознавание образов перестало быть непреодолимым.
Однако манипуляция и ловкость (англ. dexterity) сопротивляются до сих пор. Надёжный захват незнакомых предметов, работа с тканью, жидкостями и деформируемыми объектами остаются открытыми проблемами; падающие гуманоиды финала DARPA Robotics Challenge 2015 года стали наглядной иллюстрацией разрыва. Даже точечные успехи дорого стоят: чтобы одна роботизированная кисть научилась собирать кубик Рубика, потребовались годы работы и тысячи лет симулированного опыта с рандомизацией доменов[1] — ради навыка, доступного школьнику после пары недель тренировок.
Парадокс Моравека в эпоху больших языковых моделей
Большие языковые модели не отменили парадокс, а заострили его. Модели уровня GPT-4 сдают профессиональные экзамены — в том числе адвокатский экзамен, по данным технического отчёта OpenAI, с результатом в верхней части распределения испытуемых[1], — пишут работающий код, резюмируют документы и ведут связный диалог. При этом ни один серийно выпускаемый робот не способен убрать незнакомую квартиру или приготовить ужин из содержимого случайного холодильника: то, что умеет почти любой взрослый, остаётся нерешённой исследовательской задачей.
Стандартное объяснение асимметрии — данные. Для языка существует интернет с триллионами токенов текста; «интернета физического взаимодействия» не существует, а демонстрации движений дороги и плохо переносимы между роботами. Добавляются требования реального времени, замкнутого контура «восприятие — действие — среда» и высокая цена ошибки: неудачный абзац можно перегенерировать, разбитую чашку — нет.
Для рынка труда это переворачивает привычные ожидания: под давлением автоматизации в первую очередь оказываются задачи «белых воротничков» — обработка текста, рутинный анализ, часть программирования, — тогда как профессии сантехника, электрика или сиделки защищены именно сенсомоторной составляющей. Экономист Дэвид Аутор ещё до эры больших языковых моделей связывал устойчивость ручного немаршрутизируемого труда с парадоксом Полани и трудностью кодификации неявных навыков[1]. Здесь важно разделять наблюдение и интерпретацию: сама асимметрия «текстовые задачи автоматизируются быстрее физических» — эмпирический факт середины 2020-х; любые прогнозы о сроках и масштабах замещения профессий остаются предметом споров.
Основная попытка перенести успех языковых моделей в робототехнику — визуально-языковые модели действий (англ. vision-language-action models, VLA). Модель RT-2 (Google DeepMind, 2023) дообучает предобученную визуально-языковую модель на траекториях робота, представляя команды управления как текстовые токены, и демонстрирует перенос семантических знаний из веба в управление манипулятором[1]; за ней последовали открытые и коммерческие аналоги. Ранние результаты обнадёживают, но по обобщающей способности и надёжности VLA-модели пока далеки от своих языковых прародителей — что само по себе является современной формулировкой парадокса.
Критика и уточнения
Строго говоря, парадокс Моравека — не закон природы, а обобщение исторической выборки задач, и в этом качестве он подвергался уточнениям с нескольких сторон. Во-первых, выборка смещена: ранний ИИ брался за формализуемые задачи не потому, что они репрезентативны для интеллекта, а потому, что только они были доступны на вычислительной технике 1960-х. Во-вторых, прогресс машинного зрения после 2012 года показал, что «трудность» восприятия не была принципиальной — она зависела от парадигмы (обучение вместо ручного программирования) и от объёма данных. Пассивное распознавание изображений и речи сегодня по многим тестам сопоставимо с человеческим, то есть часть исходной формулировки Моравека устарела.
В-третьих, продолжается дискуссия о том, где именно проходит граница трудности. Одна позиция: трудно восприятие как таковое, и оно постепенно сдаётся масштабированию данных. Другая, восходящая к Бруксу и воплощённому ИИ: трудна не перцепция, а связка восприятие–действие–среда — замкнутый контур в реальном времени, с частичной наблюдаемостью, необратимыми ошибками и хронической нехваткой обучающих данных о физическом взаимодействии. Судьба глубокого обучения скорее подтверждает вторую позицию: распознавание кошек на фотографиях решено, аккуратное перекладывание кошки с дивана — нет.
Современный консенсус формулирует парадокс осторожнее, чем в 1988 году: интроспективная лёгкость задачи для человека ничего не говорит о её вычислительной сложности, а практическая трудность автоматизации определяется эволюционной глубиной навыка и доступностью данных о нём. В этой ослабленной форме наблюдение Моравека пережило и символьную эпоху, и революцию глубокого обучения, и появление больших языковых моделей — редкая судьба для тезиса сорокалетней давности.
См. также
- Дартмутский семинар
- Воплощённый искусственный интеллект
- Проблема фрейма
- Китайская комната
- Компьютерное зрение
- Глубокое обучение
- Визуально-языковая модель действий
- Ортогональность интеллекта и целей
- Сверхинтеллект
Примечания
Литература
- Akkaya I., Andrychowicz M., Chociej M. et al. Solving Rubik's Cube with a Robot Hand // arXiv preprint arXiv:1910.07113. — 2019.
- Autor D. H. Polanyi's Paradox and the Shape of Employment Growth // NBER Working Paper No. 20485. — Cambridge, MA: National Bureau of Economic Research, 2014.
- Brohan A., Brown J., Carbajal J. et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control // arXiv preprint arXiv:2307.15818. — 2023.
- Brooks R. A. Elephants Don't Play Chess // Robotics and Autonomous Systems. — 1990. — Vol. 6, № 1–2. — P. 3–15.
- Brooks R. A. Intelligence Without Representation // Artificial Intelligence. — 1991. — Vol. 47, № 1–3. — P. 139–159.
- Krizhevsky A., Sutskever I., Hinton G. E. ImageNet Classification with Deep Convolutional Neural Networks // Advances in Neural Information Processing Systems 25 (NIPS 2012). — 2012. — P. 1097–1105.
- McCarthy J., Hayes P. J. Some Philosophical Problems from the Standpoint of Artificial Intelligence // Machine Intelligence 4 / Ed. by B. Meltzer, D. Michie. — Edinburgh: Edinburgh University Press, 1969. — P. 463–502.
- Minsky M. The Society of Mind. — New York: Simon & Schuster, 1986.
- Moravec H. Mind Children: The Future of Robot and Human Intelligence. — Cambridge, MA: Harvard University Press, 1988.
- Moravec H. Robot: Mere Machine to Transcendent Mind. — New York: Oxford University Press, 1998.
- OpenAI. GPT-4 Technical Report // arXiv preprint arXiv:2303.08774. — 2023.
- Papert S. The Summer Vision Project // MIT AI Memo No. 100. — Cambridge, MA: Massachusetts Institute of Technology, 1966.
- Pinker S. The Language Instinct: How the Mind Creates Language. — New York: William Morrow, 1994.
- Polanyi M. The Tacit Dimension. — Garden City, NY: Doubleday, 1966.

