Фундаментальная модель
Материал из MachineLearning.
| | Статья написана с использованием LLM ChatGPT 5.5 и проверена участником Liliia Davletova |
Фундаментальная модель
Фундаментальная модель (Foundation Model) — класс моделей машинного обучения, предварительно обученных на очень больших и разнообразных наборах данных, способных служить универсальной основой для решения широкого спектра прикладных задач посредством дообучения, обучения с инструкциями, контекстного обучения (in-context learning), RAG и других методов адаптации.
Термин был предложен исследователями Stanford Center for Research on Foundation Models в 2021 году в работе On the Opportunities and Risks of Foundation Models, ставшей одной из наиболее цитируемых обзорных работ по современной архитектуре систем искусственного интеллекта.
Определение
В классическом определении фундаментальная модель обладает двумя ключевыми свойствами:
- обучается на широкомасштабных данных общего назначения (broad data at scale);
- может быть адаптирована для множества различных последующих задач (downstream tasks) без обучения новой модели "с нуля".
Таким образом, фундаментальная модель представляет собой не законченное прикладное решение, а универсальную основу, из которой строятся специализированные модели.
История
До появления фундаментальных моделей большинство систем машинного обучения создавались под конкретную задачу:
В 2018–2020 годах стало очевидно, что масштабное предварительное обучение на неразмеченных данных позволяет получать универсальные представления объектов.
В области обработки естественного языка важную роль сыграли модели
Позже аналогичная парадигма распространилась на изображения (CLIP, DINO, SAM), мультимодальные данные (Flamingo, PaLI, GPT-4V) и биологические последовательности.
Обзор статьи «On the Opportunities and Risks of Foundation Models»
Статья Боммасани и соавторов, опубликованная в 2021 году коллективом из более чем ста исследователей Stanford University, стала не просто обзором существующих больших моделей, а попыткой сформулировать новую исследовательскую программу в области искусственного интеллекта. Авторы утверждают, что в развитии машинного обучения произошёл качественный переход: если раньше модели создавались для решения отдельных задач, то теперь центральным объектом исследования становятся универсальные модели, служащие фундаментом для большого числа приложений.[1]
От специализированных моделей к универсальным
Авторы рассматривают историю развития машинного обучения как последовательность нескольких этапов.
В ранних системах каждая задача — машинный перевод, распознавание речи, классификация изображений — требовала разработки собственной модели и собственного обучающего набора данных.
Позже широкое распространение получил перенос обучения, когда предварительно обученная модель могла использоваться как отправная точка для новой задачи. Однако даже в этом случае область применения модели обычно оставалась достаточно узкой.
Фундаментальные модели отличаются тем, что они обучаются не для некоторого семейства задач, а для моделирования структуры данных вообще. После такого предварительного обучения оказывается возможным решать широкий спектр задач посредством сравнительно дешёвой адаптации.
По мнению авторов, именно этот переход является главным изменением современной парадигмы искусственного интеллекта.
Почему масштаб оказался качественным фактором
Одной из центральных идей статьи является утверждение, что масштабирование моделей приводит не только к количественному росту качества, но и к появлению новых свойств.
Авторы связывают это с одновременным увеличением
- числа параметров;
- объёма обучающих данных;
- вычислительных ресурсов.
В результате модель начинает осваивать представления, пригодные для решения задач, которые не были явно сформулированы во время обучения.
Именно поэтому современные большие языковые модели способны выполнять перевод, реферирование, ответы на вопросы, генерацию программного кода и многие другие задачи без отдельного обучения для каждой из них.
Позднее данное наблюдение было подтверждено исследованиями по Scaling Laws и стало одной из основ современной практики разработки больших языковых моделей.
Эмерджентные способности
Особое внимание в статье уделяется явлению Emergence — возникновению новых способностей модели при достижении определённого масштаба.
Авторы подчёркивают, что некоторые навыки невозможно предсказать по результатам обучения меньших моделей. Они проявляются скачкообразно после увеличения числа параметров или объёма данных.
В качестве примеров рассматриваются
- обучение по нескольким примерам (few-shot learning);
- решение новых задач посредством текстовой инструкции;
- перенос знаний между различными предметными областями;
- способность выполнять цепочки логических преобразований.
В 2021 году происхождение этих способностей оставалось практически необъяснимым и было обозначено как одно из важнейших направлений дальнейших исследований.
Гомогенизация искусственного интеллекта
Одним из наиболее оригинальных понятий статьи является гомогенизация (homogenization).
Авторы отмечают, что по мере распространения фундаментальных моделей тысячи прикладных систем начинают использовать одну и ту же предварительно обученную модель.
Подобная унификация имеет двойственный характер.
С одной стороны,
- значительно сокращается стоимость разработки;
- ускоряется внедрение новых систем;
- улучшается воспроизводимость результатов;
- достижения одной исследовательской группы становятся доступны всему сообществу.
С другой стороны, ошибки фундаментальной модели автоматически наследуются всеми производными системами. Если предварительно обученная модель содержит смещения, уязвимости безопасности или фактические ошибки, они будут воспроизводиться во множестве приложений.
Авторы рассматривают гомогенизацию как одно из наиболее важных последствий современной архитектуры искусственного интеллекта.
Междисциплинарный характер проблемы
Значительная часть статьи посвящена не алгоритмам, а последствиям широкого распространения фундаментальных моделей.
Авторы подчёркивают, что подобные системы становятся инфраструктурой для экономики, образования, медицины, права и государственного управления. Поэтому их исследование невозможно ограничить исключительно вопросами точности моделей.
В докладе выделяются несколько взаимосвязанных направлений исследований:
- качество обучающих данных;
- интерпретируемость моделей;
- устойчивость к атакам;
- безопасность;
- влияние на рынок труда;
- экологические последствия масштабного обучения;
- правовые вопросы;
- вопросы справедливости и недискриминации.
Таким образом, фундаментальная модель рассматривается как социотехническая система, требующая сотрудничества специалистов по машинному обучению, информатике, экономике, юриспруденции и социальным наукам.
Развитие идей после 2021 года
После публикации статьи многие сформулированные в ней гипотезы получили экспериментальное подтверждение, а некоторые направления исследований существенно изменились.
Большие языковые модели как основной тип фундаментальных моделей
В 2021 году авторы рассматривали фундаментальные модели как общий класс систем, включающий модели языка, изображений, робототехники и биоинформатики.
Однако уже после появления ChatGPT в конце 2022 года именно большие языковые модели стали наиболее успешным представителем этого класса. Практически вся индустрия генеративного искусственного интеллекта стала строиться вокруг одной предварительно обученной языковой модели, дополненной этапами обучения с инструкциями, обучения с подкреплением по обратной связи человека (RLHF) и различными способами интеграции внешних знаний.
От fine-tuning к instruction tuning
В статье 2021 года основным способом адаптации фундаментальных моделей считалось дообучение.
Позднейшие исследования показали, что для больших языковых моделей значительно более эффективными оказываются
- instruction tuning;
- RLHF;
- Direct Preference Optimization (DPO);
- Parameter-Efficient Fine-Tuning (LoRA, QLoRA и др.).
В результате изменилось само представление о жизненном цикле фундаментальной модели: после масштабного предварительного обучения следует длительный этап post-training, определяющий поведение модели при взаимодействии с пользователем.
От языковых моделей к мультимодальным
Авторы статьи предполагали, что единая модель сможет работать сразу с несколькими типами данных.
В последующие годы эта идея получила практическое воплощение в мультимодальных фундаментальных моделях, одновременно обрабатывающих текст, изображения, звук, видео и программный код. Такие модели используют единое пространство представлений и позволяют переносить знания между различными модальностями.
Развитие открытых фундаментальных моделей
В 2021 году большинство наиболее мощных моделей были закрытыми.
После появления семейств Llama, Mistral, Gemma и других открытых моделей сформировалось самостоятельное направление исследований Open Foundation Models. В центре внимания оказались вопросы открытости весов моделей, воспроизводимости исследований и оценки рисков свободного распространения мощных моделей. Эти вопросы подробно рассматриваются в работе On the Societal Impact of Open Foundation Models (2024).
От технических вопросов к вопросам управления
Если статья 2021 года лишь обозначила необходимость исследования социальных последствий фундаментальных моделей, то в последующие годы именно эта тема стала одной из центральных.
Развитие фундаментальных моделей привело к появлению новых исследований в области
- регулирования генеративного искусственного интеллекта;
- оценки рисков;
- безопасности наиболее мощных моделей;
- прозрачности обучения;
- открытости моделей;
- конкуренции на рынке вычислительных ресурсов.
В частности, отдельные разделы, посвящённые фундаментальным моделям, появились в европейском AI Act и ряде национальных документов по регулированию искусственного интеллекта.
Современное понимание фундаментальных моделей
Если в 2021 году термин Foundation Model обозначал прежде всего новую научную концепцию, то к середине 2020-х годов он стал использоваться как обозначение базовой вычислительной инфраструктуры современного искусственного интеллекта.
Современные обзорные статьи рассматривают фундаментальные модели не только как большие языковые модели, но и как универсальную технологическую платформу для обработки текста, изображений, аудио, видео, молекулярных структур, биологических последовательностей и робототехнических систем. При этом основные идеи статьи 2021 года — масштабное предварительное обучение, универсальность, адаптация к множеству задач и необходимость комплексной оценки рисков — сохраняют свою актуальность и остаются основой современной исследовательской программы.
Основная идея
Фундаментальная модель обучается не решению одной конкретной задачи, а моделированию структуры большого массива данных.
В зависимости от модальности используются различные цели обучения:
- самоконтролируемое обучение;
- контрастивное обучение;
- маскирование токенов;
- авторегрессионная языковая модель;
- диффузионная модель.
После такого предварительного обучения модель можно адаптировать к новой задаче значительно дешевле, чем обучать новую модель.
Архитектуры
Наиболее распространёнными архитектурами фундаментальных моделей являются
- Transformer;
- Vision Transformer;
- Mixture of Experts;
- диффузионные модели;
- мультимодальные трансформеры.
Практически все современные большие языковые модели основаны на архитектуре Transformer.
Методы адаптации
После предварительного обучения фундаментальная модель может использоваться различными способами.
Полное дообучение
Все параметры модели обновляются на новой задаче.
Преимущества:
- высокая точность;
- максимальная адаптация.
Недостаток — высокая вычислительная стоимость.
Parameter-Efficient Fine-Tuning
В современных системах широко используются методы
Они позволяют обучать лишь небольшую часть параметров модели.
In-context learning
Некоторые фундаментальные модели способны решать новую задачу исключительно по нескольким примерам во входном запросе без изменения весов модели.
Это свойство стало одной из отличительных особенностей современных больших языковых моделей.
Масштабирование
Одной из причин успеха фундаментальных моделей являются так называемые законы масштабирования (Scaling Laws).
Экспериментально было показано, что увеличение
- числа параметров;
- объёма обучающих данных;
- вычислительных ресурсов
ведёт к предсказуемому улучшению качества модели в широком диапазоне задач.
Данное наблюдение легло в основу разработки современных больших языковых моделей.
Эмерджентные свойства
При увеличении размера модели начинают проявляться способности, отсутствовавшие у более компактных моделей:
- решение новых задач без специального обучения;
- многошаговые рассуждения;
- генерация программного кода;
- перенос знаний между предметными областями;
- мультимодальное понимание.
Такие свойства получили название эмерджентных (Emergent Abilities). Несмотря на большое количество эмпирических наблюдений, механизмы их возникновения остаются предметом активных исследований.
Примеры фундаментальных моделей
Язык
Компьютерное зрение
Генерация изображений
Мультимодальные модели
Преимущества
Фундаментальные модели изменили не только качество решения отдельных задач, но и саму организацию разработки систем искусственного интеллекта. Вместо обучения новой модели для каждого приложения стало возможным создавать универсальную модель, которая затем адаптируется к конкретным сценариям использования. Такой подход имеет ряд важных преимуществ.
Универсальность
Главной особенностью фундаментальной модели является её способность решать широкий круг задач без изменения базовой архитектуры.
Например, одна и та же языковая модель может использоваться для
- генерации текста;
- машинного перевода;
- автоматического реферирования;
- извлечения информации;
- генерации программного кода;
- ответов на вопросы;
- диалоговых систем.
Аналогично современные визуальные фундаментальные модели могут применяться для классификации изображений, сегментации, поиска похожих изображений и генерации описаний.
Таким образом, фундаментальная модель становится универсальной платформой, на основе которой строится множество специализированных приложений.[1]
Эффективное использование неразмеченных данных
Классическое обучение с учителем требует большого количества размеченных примеров, получение которых часто оказывается наиболее дорогим этапом разработки.
Фундаментальные модели обучаются преимущественно методами самоконтролируемого обучения, используя огромные массивы неразмеченных данных: тексты из Интернета, изображения, видеозаписи, программный код, аудио и другие источники.
Поскольку объём доступных неразмеченных данных значительно превышает объём размеченных корпусов, появляется возможность обучать модели существенно большего масштаба и получать более общие представления о структуре данных.
Перенос знаний между задачами
Во время предварительного обучения модель формирует внутренние представления, отражающие статистические закономерности предметной области.
Эти представления могут использоваться при решении новых задач, для которых имеется лишь небольшое количество обучающих примеров или они отсутствуют вовсе.
Подобный перенос знаний особенно важен для редких языков, специализированных предметных областей и задач, где сбор размеченных данных чрезвычайно дорог.
Высокая эффективность адаптации
После завершения предварительного обучения стоимость адаптации модели к новой задаче оказывается значительно ниже стоимости обучения новой модели.
Современные методы, такие как LoRA, QLoRA, Adapter и Prompt tuning, позволяют изменять лишь небольшую долю параметров модели, сохраняя большую часть предварительно полученных знаний.
Это существенно снижает требования к вычислительным ресурсам и делает возможным использование фундаментальных моделей небольшими исследовательскими группами и промышленными организациями.[1] :contentReference[oaicite:0]{index=0}
Возникновение новых способностей
Одним из наиболее интересных свойств фундаментальных моделей является появление способностей, которые не закладывались разработчиками явно.
По мере увеличения размера модели начинают возникать новые возможности:
- обучение по нескольким примерам (few-shot learning);
- решение задач по текстовому описанию;
- генерация программного кода;
- перенос знаний между различными предметными областями;
- построение сложных цепочек рассуждений.
Эти свойства получили название эмерджентных (emergent abilities). Несмотря на большое количество экспериментальных наблюдений, механизмы их возникновения пока недостаточно изучены.
Унификация разработки систем искусственного интеллекта
Одной из центральных идей статьи Боммасани и соавторов является понятие гомогенизации (homogenization).
Ранее каждая прикладная система создавалась практически независимо. Теперь множество приложений используют одну и ту же фундаментальную модель как общую основу.
Это приводит к формированию единой экосистемы инструментов, библиотек, методов адаптации и способов оценки качества. Разработка новых приложений значительно ускоряется, поскольку исследователи могут сосредоточиться на адаптации модели к конкретной задаче, а не на её полном обучении.
Формирование единой инфраструктуры искусственного интеллекта
Современные фундаментальные модели постепенно становятся инфраструктурой для других интеллектуальных систем.
Именно вокруг них строятся
- интеллектуальные агенты;
- поисковые системы с генерацией ответов;
- системы программирования;
- мультимодальные помощники;
- робототехнические платформы;
- научные ассистенты.
Таким образом, фундаментальная модель играет роль своеобразной «операционной системы» современного искусственного интеллекта.
Ограничения
Несмотря на впечатляющие возможности, фундаментальные модели обладают рядом фундаментальных ограничений, многие из которых были отмечены уже в статье 2021 года и остаются предметом активных исследований.
Высокая стоимость обучения
Обучение современных фундаментальных моделей требует колоссальных вычислительных ресурсов.
Крупнейшие модели обучаются на десятках тысяч графических процессоров в течение нескольких недель или месяцев. Стоимость обучения может составлять десятки и даже сотни миллионов долларов, что делает разработку фундаментальных моделей доступной лишь ограниченному числу крупных компаний и исследовательских центров.[1]
Это приводит к высокой концентрации вычислительных ресурсов и снижению воспроизводимости научных исследований.
Высокая стоимость эксплуатации
Даже после завершения обучения использование крупных моделей требует значительных вычислительных ресурсов.
Обработка длинных запросов, генерация больших объёмов текста и обслуживание миллионов пользователей требуют специализированной инфраструктуры, что существенно увеличивает стоимость эксплуатации.
Поэтому в последние годы активно развиваются методы сжатия моделей, квантования, дистилляции и эффективного вывода.[1]
Галлюцинации
Фундаментальные модели могут генерировать убедительно выглядящие, но полностью ложные утверждения.
Причина заключается в том, что цель обучения языковой модели состоит в предсказании наиболее вероятного продолжения текста, а не в проверке истинности сообщаемой информации.
Поэтому модель способна
- придумывать ссылки на несуществующие статьи;
- ошибочно цитировать документы;
- генерировать неверные математические доказательства;
- уверенно сообщать недостоверные факты.
Галлюцинации остаются одной из главных проблем практического применения фундаментальных моделей, особенно в медицине, праве и научных исследованиях.
Смещения обучающих данных
Фундаментальная модель наследует статистические закономерности обучающего корпуса.
Если обучающие данные содержат культурные, социальные или политические смещения, они могут проявляться и в поведении модели.
Кроме того, модель может воспроизводить стереотипы, содержащиеся в текстах Интернета, что делает необходимыми специальные методы оценки и уменьшения подобных эффектов.
Ограниченная интерпретируемость
Современные фундаментальные модели содержат миллиарды параметров, взаимодействие которых чрезвычайно сложно анализировать.
Хотя активно развивается направление Mechanistic Interpretability, внутренние механизмы формирования знаний и принятия решений остаются недостаточно понятными. Это затрудняет проверку корректности работы модели и поиск причин возникающих ошибок.
Отсутствие гарантированной надёжности
Фундаментальные модели являются вероятностными системами.
Они не обладают строгими гарантиями корректности вывода, поэтому даже при одинаковых входных данных могут генерировать различные ответы. Кроме того, небольшие изменения формулировки запроса иногда приводят к существенному изменению результата.
Подобная нестабильность ограничивает использование фундаментальных моделей в задачах, связанных с безопасностью и принятием критически важных решений.
Централизация технологий
Парадоксально, но универсальность фундаментальных моделей одновременно является и их слабой стороной.
Поскольку большое количество приложений строится на ограниченном числе базовых моделей, ошибки, уязвимости или смещения автоматически распространяются на множество производных систем.
Этот эффект, называемый гомогенизацией, был подробно рассмотрен ещё в статье 2021 года и сегодня считается одним из важнейших системных рисков развития искусственного интеллекта.[1]
Экологические последствия
Масштабное обучение фундаментальных моделей сопровождается значительным потреблением электроэнергии и требует крупных вычислительных центров.
Поэтому одним из активно развивающихся направлений исследований является создание более компактных, энергоэффективных и специализированных фундаментальных моделей, позволяющих снизить вычислительные и экологические издержки без существенной потери качества.
Современные направления исследований
Наиболее активно развиваются следующие направления:
- открытые фундаментальные модели;
- мультимодальные модели;
- агентные системы на основе фундаментальных моделей;
- методы эффективного дообучения;
- интерпретируемость;
- оценка безопасности;
- механистическая интерпретация нейронных сетей;
- обучение на синтетических данных.
См. также
- Машинное обучение
- Глубокое обучение
- Нейронная сеть
- Transformer
- Большая языковая модель
- Самоконтролируемое обучение
- Перенос обучения
- Дообучение
- LoRA
- Контекстное обучение
- Генеративный искусственный интеллект
Примечания
Литература
- Bommasani R., Hudson D. A., Adeli E. и др. On the Opportunities and Risks of Foundation Models // arXiv. — 2021.
- Brown T. B., Mann B., Ryder N. и др. Language Models are Few-Shot Learners // NeurIPS. — 2020.
- Kapoor S., Bommasani R. и др. On the Societal Impact of Open Foundation Models // arXiv. — 2024.
- Vaswani A., Shazeer N., Parmar N. и др. Attention Is All You Need // NeurIPS. — 2017.
- Goodfellow I., Bengio Y., Courville A. Deep Learning. — MIT Press, 2016.

