Большая языковая модель

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Исправлены формулы LaTeX)
(Доработка по замечанию: глубина, история вех, сравнение LLM, новый промпт)
Строка 1: Строка 1:
-
{{well|Статья написана с использованием LLM '''Claude Sonnet 4''' и проверена участником [[Участник:Emil Petrov|Emil Petrov]] 14:58, 16 июня 2026 (MSD)
+
{{well|Статья написана с использованием LLM '''Claude Sonnet 4''' и проверена участником [[Участник:Emil Petrov|Emil Petrov]] 19:45, 14 июля 2026 (MSD)
Промпт приводится полностью в [[Обсуждение:Большая языковая модель]]
Промпт приводится полностью в [[Обсуждение:Большая языковая модель]]
}}
}}
{{TOCright}}
{{TOCright}}
-
'''Больша́я языкова́я мо́дель''' (англ. large language model, LLM) — класс [[Нейронная сеть|нейронных сетей]], обученных на огромных корпусах текстов и способных генерировать, анализировать и преобразовывать текст на естественном языке. Современные LLM, как правило, строятся на архитектуре [[Трансформер (модель)|трансформера]] и содержат от нескольких миллиардов до триллионов параметров. Наиболее известные представители — серии GPT (OpenAI), Gemini (Google DeepMind), Claude (Anthropic) и LLaMA (Meta AI).
+
'''Больша́я языкова́я мо́дель''' (англ. large language model, LLM) — класс моделей [[Машинное обучение|машинного обучения]] на основе [[Глубокое обучение|глубоких нейронных сетей]], обученных на огромных корпусах текстов и способных понимать, генерировать и преобразовывать текст на естественном языке. Современные LLM, как правило, строятся на архитектуре [[Трансформер (модель)|трансформера]] и содержат от сотен миллионов до нескольких триллионов параметров. Благодаря самообучению на разнородных данных они умеют решать широкий круг задач без отдельного дообучения под каждую из них: перевод, ответы на вопросы, суммаризация, написание кода, ведение диалога.
-
== Определение и масштаб ==
+
LLM лежат в основе систем вроде GPT, Claude, Gemini, LLaMA, DeepSeek и Qwen и считаются ключевым компонентом современного [[Искусственный интеллект|искусственного интеллекта]].
-
Языковая модель формально задаёт вероятностное распределение над последовательностями токенов. Авторегрессионная модель факторизует вероятность последовательности как произведение условных вероятностей:
+
== Архитектура трансформера и механизм внимания ==
-
:<tex>P(x_1, x_2, \ldots, x_n) = \prod_{t=1}^{n} P(x_t \mid x_1, \ldots, x_{t-1}).</tex>
+
Основой большинства LLM служит [[Трансформер (модель)|трансформер]], предложенный в работе «Attention Is All You Need» (Vaswani et al., 2017)<ref name="vaswani2017">{{статья |автор=Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I. |заглавие=Attention Is All You Need |издание=Advances in Neural Information Processing Systems |год=2017 |том=30 |ссылка=https://arxiv.org/abs/1706.03762}}</ref>. Он отказался от рекуррентных и свёрточных слоёв и целиком построен на [[Механизм внимания|механизме внимания]]. Это позволило эффективнее обрабатывать длинные тексты и распараллеливать вычисления — критично при обучении на гигантских корпусах.
-
На каждом шаге <tex>t</tex> модель предсказывает распределение по словарю, из которого семплируется следующий токен.
+
=== Само-внимание (self-attention) ===
-
Понятие «большая» не имеет точной границы и исторически смещалось: модели, считавшиеся огромными в 2018 году (BERT 340 млн параметров), сегодня воспринимаются как небольшие.
+
Центральный элемент — '''многоголовое само-внимание''' (multi-head self-attention). Идею удобно пояснить аналогией с библиотекой: есть ''запрос'' (query), у каждой книги ''ключ'' (key, описание) и ''содержание'' (value, полный текст). Внимание сопоставляет запрос с ключами, оценивает релевантность и взвешенно суммирует содержимое.
-
== Предобучение ==
+
Формально для входных векторов (токенов) строятся матрицы запросов <tex>Q</tex>, ключей <tex>K</tex> и значений <tex>V</tex>:
-
=== Задачи предобучения ===
+
:<tex>\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V,</tex>
-
LLM обучаются методом самообучения (self-supervised learning): обучающий сигнал извлекается непосредственно из текстов без ручной разметки. Наиболее распространены две задачи:
+
где <tex>d_k</tex> — размерность ключей. Softmax по строке превращает скалярные произведения в веса; деление на <tex>\sqrt{d_k}</tex> стабилизирует градиенты.
-
* '''Языковое моделирование''' (causal language modeling, CLM) — предсказание следующего токена по всем предыдущим. Используется в моделях семейства GPT.
+
Иначе говоря, каждое слово «смотрит» на все остальные и решает, насколько они важны в данном контексте. Так модель улавливает дальние зависимости — например, связь местоимения с именем, упомянутым несколькими предложениями ранее.
-
* '''Маскированное языковое моделирование''' (masked language modeling, MLM) — предсказание замаскированных токенов по контексту слева и справа. Используется в BERT и его вариантах.
+
-
Корпус данных собирается из Common Crawl (веб-страницы), книг, научных статей, кода (GitHub), Википедии и других источников. Для GPT-4, LLaMA, Claude объём обучающих данных составляет от сотен миллиардов до нескольких триллионов токенов.
+
=== Многоголовое внимание и позиционное кодирование ===
-
=== Законы масштабирования ===
+
Вместо одного внимания используют несколько «голов»: каждая работает в своём подпространстве и следит за своим типом связей (синтаксис, семантика, кореференция). Выходы голов объединяют и линейно преобразуют.
-
Исследования Kaplan et al. (2020) и Hoffmann et al. (2022, «Chinchilla») установили, что потери языковой модели убывают как степенная функция от числа параметров <tex>N</tex> и объёма обучающих данных <tex>D</tex>:
+
Сам по себе attention не знает порядка слов (он перестановочно инвариантен), поэтому к встраиваниям токенов добавляют '''позиционные кодировки'''. В оригинале — синусоидальные; позже — обучаемые; в современных LLM часто '''вращающиеся''' (RoPE), лучше обобщающиеся на длинный контекст.
-
:<tex>L(N, D) \approx A \cdot N^{-\alpha} + B \cdot D^{-\beta} + L_\infty,</tex>
+
=== Энкодер, декодер и современные варианты ===
-
где <tex>\alpha \approx \beta \approx 0{,}5</tex>, а <tex>L_\infty</tex> нижняя граница ошибки, обусловленная шумом данных. Модели Chinchilla показали, что при фиксированном бюджете вычислений оптимально иметь меньшую модель, обученную на бо́льшем объёме данных.
+
Классический трансформер энкодер + декодер. В LLM чаще используют '''только декодер''' (decoder-only), как в GPT: модель предсказывает следующий токен по предыдущим с ''маскированным'' само-вниманием, запрещающим «заглядывать вперёд». Такой режим естественно подходит для генерации и легче масштабируется.
-
== Тонкая настройка (fine-tuning) ==
+
Авторегрессионная модель факторизует вероятность последовательности:
-
Предобученная LLM часто дообучается под конкретные задачи. Наиболее влиятельным методом стало '''обучение с подкреплением из обратной связи человека''' ([[Обучение с подкреплением из обратной связи человека|RLHF]]), включающее:
+
:<tex>P(x_1,\ldots,x_n)=\prod_{t=1}^{n} P(x_t\mid x_1,\ldots,x_{t-1}).</tex>
-
# Дообучение с учителем (SFT) на демонстрациях правильного поведения.
+
== История развития больших языковых моделей ==
-
# Обучение модели вознаграждения (reward model) на попарных предпочтениях людей.
+
-
# Оптимизацию политики с помощью алгоритма PPO или аналогов.
+
-
Альтернативные методы: LoRA (Low-Rank Adaptation), QLoRA, DPO (Direct Preference Optimization), prefix-tuning — позволяют дообучать модели с меньшим числом параметров.
+
=== Появление термина LLM ===
-
== Возникающие способности ==
+
Точное авторство термина «Large Language Model» установить сложно: он появлялся описательно по мере роста моделей. В академической литературе закрепился после GPT-2 (Radford et al., 2019) и особенно GPT-3 (Brown et al., 2020) с 175 млрд параметров<ref name="brown2020">{{статья |автор=Brown T. et al. |заглавие=Language Models are Few-Shot Learners |издание=Advances in Neural Information Processing Systems |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.14165}}</ref>. К 2020–2021 году LLM стало общепринятым названием для трансформерных моделей, предобученных на огромных корпусах и насчитывающих миллиарды параметров. Понятие «большая» исторически смещалось: BERT-Large (340 млн, 2018) когда-то казался огромным.
-
При увеличении числа параметров LLM демонстрируют '''возникающие способности''' (emergent abilities) — возможности, неожиданно появляющиеся при достижении определённого масштаба:
+
=== Основные вехи развития ===
-
* Решение многошаговых логических задач через цепочку рассуждений (Chain-of-Thought, CoT).
+
'''Ранние языковые модели (2013–2018).''' Практический старт дали статические [[Нейросетевое встраивание|встраивания]] Word2Vec и GloVe, затем контекстные ELMo и BERT с предобучением и fine-tuning.
-
* Обучение по нескольким примерам в контексте (few-shot in-context learning) без обновления весов.
+
-
* Выполнение инструкций, не встречавшихся при обучении (instruction following).
+
-
== Применения ==
+
'''GPT, T5 и эра масштабирования (2018–2020).''' GPT-1/2 — decoder-only трансформеры на предсказании следующего слова. T5 унифицировал задачи в формате «текст → текст». GPT-3 продемонстрировал ''in-context learning'': решение новых задач по нескольким примерам в промпте без обновления весов — и фактически запустил индустрию LLM.
-
LLM нашли применение в широком спектре задач:
+
'''InstructGPT и выравнивание (2022).''' Метод [[Обучение с подкреплением из обратной связи человека (RLHF)|RLHF]] позволил настраивать модели под инструкции и предпочтения людей. InstructGPT показал: относительно небольшая выровненная модель даёт более полезные и безопасные ответы, чем сырая крупная GPT-3. На этом подходе вырос ChatGPT<ref name="ouyang2022">{{статья |автор=Ouyang L. et al. |заглавие=Training language models to follow instructions with human feedback |издание=Advances in Neural Information Processing Systems |год=2022 |том=35 |ссылка=https://arxiv.org/abs/2203.02155}}</ref>.
-
* '''Генерация текста''' — написание статей, кода, рекламных материалов, сценариев.
+
'''LoRA и эффективная адаптация (2021–2022).''' Полное дообучение гигантских моделей дорого. LoRA добавляет низкоранговые обучаемые матрицы к замороженным весам, резко снижая стоимость адаптации и открывая массовый community fine-tuning<ref name="lora2022">{{статья |автор=Hu E. J. et al. |заглавие=LoRA: Low-Rank Adaptation of Large Language Models |издание=ICLR |год=2022 |ссылка=https://arxiv.org/abs/2106.09685}}</ref>.
-
* '''Вопросно-ответные системы''' — поиск с семантическим пониманием запроса (retrieval-augmented generation, RAG).
+
-
* '''Программирование''' — автодополнение кода (GitHub Copilot), генерация тестов, объяснение кода.
+
-
* '''Мультимодальные системы''' — понимание и генерация изображений совместно с текстом.
+
-
== Ограничения и риски ==
+
'''Рассуждения и цепочка мыслей (2022–2025).''' Chain-of-Thought (Wei et al., 2022) показал: если модель явно пишет промежуточные шаги, качество сложных задач растёт. Дальше появились модели, специально обученные «думать» дольше на этапе вывода (o1, DeepSeek-R1): больше compute на инференсе вместо только на обучении.
-
* '''Галлюцинации''' — модели уверенно генерируют фактически неверные утверждения.
+
'''Смесь экспертов (MoE).''' В [[Смесь экспертов|MoE]] для каждого токена активируется лишь часть «экспертов» (параллельных FFN). Ёмкость модели растёт при умеренной стоимости инференса. Подход используют GPT-4, Gemini, Mixtral, DeepSeek-V2/V3, Qwen-MoE.
-
* '''Предвзятости''' (bias) — LLM воспроизводят и усиливают предвзятости обучающих данных.
+
-
* '''Безопасность''' — возможность злоупотреблений: дезинформация, фишинг, вредоносный контент.
+
-
* '''Непрозрачность''' — механизм принятия решений остаётся слабо интерпретируемым.
+
-
== Исторические вехи ==
+
'''RAG (2020).''' Retrieval-Augmented Generation соединяет генерацию с поиском по внешней базе: модель опирается на найденные документы, снижает галлюцинации и даёт актуальные ответы без переобучения — основа корпоративных QA-систем<ref name="rag2020">{{статья |автор=Lewis P. et al. |заглавие=Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks |издание=Advances in Neural Information Processing Systems |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.11401}}</ref>.
 +
 
 +
'''Внешняя / дифференцируемая память.''' Направление вроде Engram и родственных memory-модулей дополняет параметрическую «память в весах» внешним хранилищем фактов — чтобы точнее извлекать знания и лучше контролировать, что модель «помнит».
 +
 
 +
'''Диффузионные языковые модели (LLDM).''' Классические LLM генерируют текст авторегрессивно. Альтернатива — [[Диффузионная модель|диффузионные]] языковые модели (например, LLaDA): генерация из зашумлённой последовательности с итеративным «очищением». Это даёт параллелизм и иную управляемость генерации.
 +
 
 +
=== Законы масштабирования ===
 +
 
 +
Kaplan et al. (2020) и Hoffmann et al. (2022, Chinchilla) показали: потери убывают степенным образом от числа параметров <tex>N</tex> и объёма данных <tex>D</tex>:
 +
 
 +
:<tex>L(N,D)\approx A N^{-\alpha}+B D^{-\beta}+L_\infty.</tex>
 +
 
 +
При фиксированном compute-бюджете оптимальна не «максимально огромная» модель, а баланс размера и числа токенов обучения.
 +
 
 +
== Современные мировые LLM: сравнение ==
 +
 
 +
По состоянию на 2026 год лидеры различаются открытостью, мультимодальностью, длиной контекста и специализацией.
{| class="wikitable"
{| class="wikitable"
 +
|+ Сравнение ведущих LLM (ориентировочно, 2026)
|-
|-
-
! Год !! Модель !! Параметры !! Организация
+
! Модель !! Организация !! Открытость !! Мультимодальность !! Сильные стороны
|-
|-
-
| 2018 || BERT-Large || 340 млн || Google
+
| GPT-4o / o-серия || OpenAI || Проприетарная || Текст, изображение, аудио || Экосистема, инструменты, универсальность
|-
|-
-
| 2019 || GPT-2 || 1,5 млрд || OpenAI
+
| Claude 4 || Anthropic || Проприетарная || Текст, изображение || Длинный контекст, аккуратность, код и анализ документов
|-
|-
-
| 2020 || GPT-3 || 175 млрд || OpenAI
+
| Gemini 2.x Pro || Google DeepMind || Проприетарная || Текст, изображение, аудио, видео || Очень длинный контекст, связь с поиском, научные задачи
|-
|-
-
| 2022 || ChatGPT (GPT-3.5) || ~175 млрд || OpenAI
+
| Llama 4 || Meta || Открытые веса || Текст, изображение || Локальный деплой, дообучение, сообщество
|-
|-
-
| 2023 || GPT-4 || ~1 трлн (оценка) || OpenAI
+
| DeepSeek-V3 / R1 || DeepSeek || Открытые веса || Текст (и расширяющиеся модальности) || Эффективность MoE, сильные рассуждения, низкая стоимость
|-
|-
-
| 2023 || LLaMA 2 || 70 млрд || Meta AI
+
| Qwen3 || Alibaba || Открытые веса || Текст, изображение, аудио, видео || Мультиязычность, размерный ряд, мультимодальность
-
|-
+
-
| 2024 || Claude 3 Opus || неизвестно || Anthropic
+
|}
|}
 +
 +
'''Практический вывод для новичка:''' закрытые API удобны «из коробки»; открытые веса нужны, если важны контроль данных, дообучение и стоимость на своём железе. '''Для профессионала:''' выбирать стоит не по маркетинговому названию, а по связке «задача → длина контекста → latency/cost → возможность RAG/tool-use → требования к приватности».
 +
 +
== Ограничения и риски ==
 +
 +
* '''Галлюцинации''' — уверенные, но ложные утверждения; лечатся RAG, верификацией и отказом «выдумывать».
 +
* '''Предвзятости''' обучающих данных — модель их воспроизводит и усиливает.
 +
* '''Злоупотребления''' — дезинформация, фишинг, вредоносный код.
 +
* '''Непрозрачность''' — внутренние решения плохо интерпретируемы; внимание ≠ объяснение.
 +
* '''Стоимость и экология''' — обучение и инференс крупных моделей дороги по compute и энергии.
 +
 +
Качество ответа сильно зависит от [[Промпт-инжиниринг|промпт-инжиниринга]]: ясная роль, задача, формат и ограничители часто важнее «сырой» мощности модели.
== См. также ==
== См. также ==
* [[Трансформер (модель)]]
* [[Трансформер (модель)]]
* [[Механизм внимания]]
* [[Механизм внимания]]
-
* [[Обучение с подкреплением из обратной связи человека]]
+
* [[Обучение с подкреплением из обратной связи человека (RLHF)]]
* [[Промпт-инжиниринг]]
* [[Промпт-инжиниринг]]
* [[Нейросетевое встраивание]]
* [[Нейросетевое встраивание]]
-
* [[Машинное обучение]]
+
* [[Диффузионная модель]]
 +
* [[Смесь экспертов]]
== Примечания ==
== Примечания ==
Строка 102: Строка 119:
== Литература ==
== Литература ==
-
* {{статья |автор=Kaplan J., McCandlish S., Henighan T. et al. |заглавие=Scaling Laws for Neural Language Models |издание=arXiv preprint |год=2020 |ссылка=https://arxiv.org/abs/2001.08361}}
+
* {{статья |автор=Vaswani A. et al. |заглавие=Attention Is All You Need |издание=NeurIPS |год=2017 |том=30 |ссылка=https://arxiv.org/abs/1706.03762}}
 +
* {{статья |автор=Brown T. et al. |заглавие=Language Models are Few-Shot Learners |издание=NeurIPS |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.14165}}
 +
* {{статья |автор=Kaplan J. et al. |заглавие=Scaling Laws for Neural Language Models |издание=arXiv preprint |год=2020 |ссылка=https://arxiv.org/abs/2001.08361}}
* {{статья |автор=Hoffmann J. et al. |заглавие=Training Compute-Optimal Large Language Models |издание=arXiv preprint |год=2022 |ссылка=https://arxiv.org/abs/2203.15556}}
* {{статья |автор=Hoffmann J. et al. |заглавие=Training Compute-Optimal Large Language Models |издание=arXiv preprint |год=2022 |ссылка=https://arxiv.org/abs/2203.15556}}
-
* {{статья |автор=Brown T. et al. |заглавие=Language Models are Few-Shot Learners |издание=Advances in Neural Information Processing Systems |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.14165}}
+
* {{статья |автор=Ouyang L. et al. |заглавие=Training language models to follow instructions with human feedback |издание=NeurIPS |год=2022 |том=35 |ссылка=https://arxiv.org/abs/2203.02155}}
-
* {{статья |автор=Wei J. et al. |заглавие=Emergent Abilities of Large Language Models |издание=Transactions on Machine Learning Research |год=2022 |ссылка=https://arxiv.org/abs/2206.07682}}
+
* {{статья |автор=Hu E. J. et al. |заглавие=LoRA: Low-Rank Adaptation of Large Language Models |издание=ICLR |год=2022 |ссылка=https://arxiv.org/abs/2106.09685}}
 +
* {{статья |автор=Lewis P. et al. |заглавие=Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks |издание=NeurIPS |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.11401}}
 +
* {{статья |автор=Wei J. et al. |заглавие=Chain-of-Thought Prompting Elicits Reasoning in Large Language Models |издание=NeurIPS |год=2022 |ссылка=https://arxiv.org/abs/2201.11903}}
 +
* {{статья |автор=DeepSeek-AI |заглавие=DeepSeek-V3 Technical Report |издание=arXiv preprint |год=2024 |ссылка=https://arxiv.org/abs/2412.19437}}
[[Категория:Машинное обучение]]
[[Категория:Машинное обучение]]
[[Категория:Нейронные сети]]
[[Категория:Нейронные сети]]
[[Категория:Обработка естественного языка]]
[[Категория:Обработка естественного языка]]
 +
[[Категория:Глубокое обучение]]

Версия 16:48, 14 июля 2026

Статья написана с использованием LLM Claude Sonnet 4 и проверена участником Emil Petrov 19:45, 14 июля 2026 (MSD)

Промпт приводится полностью в Обсуждение:Большая языковая модель


Содержание

Больша́я языкова́я мо́дель (англ. large language model, LLM) — класс моделей машинного обучения на основе глубоких нейронных сетей, обученных на огромных корпусах текстов и способных понимать, генерировать и преобразовывать текст на естественном языке. Современные LLM, как правило, строятся на архитектуре трансформера и содержат от сотен миллионов до нескольких триллионов параметров. Благодаря самообучению на разнородных данных они умеют решать широкий круг задач без отдельного дообучения под каждую из них: перевод, ответы на вопросы, суммаризация, написание кода, ведение диалога.

LLM лежат в основе систем вроде GPT, Claude, Gemini, LLaMA, DeepSeek и Qwen и считаются ключевым компонентом современного искусственного интеллекта.

Архитектура трансформера и механизм внимания

Основой большинства LLM служит трансформер, предложенный в работе «Attention Is All You Need» (Vaswani et al., 2017)[1]. Он отказался от рекуррентных и свёрточных слоёв и целиком построен на механизме внимания. Это позволило эффективнее обрабатывать длинные тексты и распараллеливать вычисления — критично при обучении на гигантских корпусах.

Само-внимание (self-attention)

Центральный элемент — многоголовое само-внимание (multi-head self-attention). Идею удобно пояснить аналогией с библиотекой: есть запрос (query), у каждой книги — ключ (key, описание) и содержание (value, полный текст). Внимание сопоставляет запрос с ключами, оценивает релевантность и взвешенно суммирует содержимое.

Формально для входных векторов (токенов) строятся матрицы запросов Q, ключей K и значений V:

\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V,

где d_k — размерность ключей. Softmax по строке превращает скалярные произведения в веса; деление на \sqrt{d_k} стабилизирует градиенты.

Иначе говоря, каждое слово «смотрит» на все остальные и решает, насколько они важны в данном контексте. Так модель улавливает дальние зависимости — например, связь местоимения с именем, упомянутым несколькими предложениями ранее.

Многоголовое внимание и позиционное кодирование

Вместо одного внимания используют несколько «голов»: каждая работает в своём подпространстве и следит за своим типом связей (синтаксис, семантика, кореференция). Выходы голов объединяют и линейно преобразуют.

Сам по себе attention не знает порядка слов (он перестановочно инвариантен), поэтому к встраиваниям токенов добавляют позиционные кодировки. В оригинале — синусоидальные; позже — обучаемые; в современных LLM часто вращающиеся (RoPE), лучше обобщающиеся на длинный контекст.

Энкодер, декодер и современные варианты

Классический трансформер — энкодер + декодер. В LLM чаще используют только декодер (decoder-only), как в GPT: модель предсказывает следующий токен по предыдущим с маскированным само-вниманием, запрещающим «заглядывать вперёд». Такой режим естественно подходит для генерации и легче масштабируется.

Авторегрессионная модель факторизует вероятность последовательности:

P(x_1,\ldots,x_n)=\prod_{t=1}^{n} P(x_t\mid x_1,\ldots,x_{t-1}).

История развития больших языковых моделей

Появление термина LLM

Точное авторство термина «Large Language Model» установить сложно: он появлялся описательно по мере роста моделей. В академической литературе закрепился после GPT-2 (Radford et al., 2019) и особенно GPT-3 (Brown et al., 2020) с 175 млрд параметров[1]. К 2020–2021 году LLM стало общепринятым названием для трансформерных моделей, предобученных на огромных корпусах и насчитывающих миллиарды параметров. Понятие «большая» исторически смещалось: BERT-Large (340 млн, 2018) когда-то казался огромным.

Основные вехи развития

Ранние языковые модели (2013–2018). Практический старт дали статические встраивания Word2Vec и GloVe, затем контекстные ELMo и BERT с предобучением и fine-tuning.

GPT, T5 и эра масштабирования (2018–2020). GPT-1/2 — decoder-only трансформеры на предсказании следующего слова. T5 унифицировал задачи в формате «текст → текст». GPT-3 продемонстрировал in-context learning: решение новых задач по нескольким примерам в промпте без обновления весов — и фактически запустил индустрию LLM.

InstructGPT и выравнивание (2022). Метод RLHF позволил настраивать модели под инструкции и предпочтения людей. InstructGPT показал: относительно небольшая выровненная модель даёт более полезные и безопасные ответы, чем сырая крупная GPT-3. На этом подходе вырос ChatGPT[1].

LoRA и эффективная адаптация (2021–2022). Полное дообучение гигантских моделей дорого. LoRA добавляет низкоранговые обучаемые матрицы к замороженным весам, резко снижая стоимость адаптации и открывая массовый community fine-tuning[1].

Рассуждения и цепочка мыслей (2022–2025). Chain-of-Thought (Wei et al., 2022) показал: если модель явно пишет промежуточные шаги, качество сложных задач растёт. Дальше появились модели, специально обученные «думать» дольше на этапе вывода (o1, DeepSeek-R1): больше compute на инференсе вместо только на обучении.

Смесь экспертов (MoE). В MoE для каждого токена активируется лишь часть «экспертов» (параллельных FFN). Ёмкость модели растёт при умеренной стоимости инференса. Подход используют GPT-4, Gemini, Mixtral, DeepSeek-V2/V3, Qwen-MoE.

RAG (2020). Retrieval-Augmented Generation соединяет генерацию с поиском по внешней базе: модель опирается на найденные документы, снижает галлюцинации и даёт актуальные ответы без переобучения — основа корпоративных QA-систем[1].

Внешняя / дифференцируемая память. Направление вроде Engram и родственных memory-модулей дополняет параметрическую «память в весах» внешним хранилищем фактов — чтобы точнее извлекать знания и лучше контролировать, что модель «помнит».

Диффузионные языковые модели (LLDM). Классические LLM генерируют текст авторегрессивно. Альтернатива — диффузионные языковые модели (например, LLaDA): генерация из зашумлённой последовательности с итеративным «очищением». Это даёт параллелизм и иную управляемость генерации.

Законы масштабирования

Kaplan et al. (2020) и Hoffmann et al. (2022, Chinchilla) показали: потери убывают степенным образом от числа параметров N и объёма данных D:

L(N,D)\approx A N^{-\alpha}+B D^{-\beta}+L_\infty.

При фиксированном compute-бюджете оптимальна не «максимально огромная» модель, а баланс размера и числа токенов обучения.

Современные мировые LLM: сравнение

По состоянию на 2026 год лидеры различаются открытостью, мультимодальностью, длиной контекста и специализацией.

Сравнение ведущих LLM (ориентировочно, 2026)
Модель Организация Открытость Мультимодальность Сильные стороны
GPT-4o / o-серия OpenAI Проприетарная Текст, изображение, аудио Экосистема, инструменты, универсальность
Claude 4 Anthropic Проприетарная Текст, изображение Длинный контекст, аккуратность, код и анализ документов
Gemini 2.x Pro Google DeepMind Проприетарная Текст, изображение, аудио, видео Очень длинный контекст, связь с поиском, научные задачи
Llama 4 Meta Открытые веса Текст, изображение Локальный деплой, дообучение, сообщество
DeepSeek-V3 / R1 DeepSeek Открытые веса Текст (и расширяющиеся модальности) Эффективность MoE, сильные рассуждения, низкая стоимость
Qwen3 Alibaba Открытые веса Текст, изображение, аудио, видео Мультиязычность, размерный ряд, мультимодальность

Практический вывод для новичка: закрытые API удобны «из коробки»; открытые веса нужны, если важны контроль данных, дообучение и стоимость на своём железе. Для профессионала: выбирать стоит не по маркетинговому названию, а по связке «задача → длина контекста → latency/cost → возможность RAG/tool-use → требования к приватности».

Ограничения и риски

  • Галлюцинации — уверенные, но ложные утверждения; лечатся RAG, верификацией и отказом «выдумывать».
  • Предвзятости обучающих данных — модель их воспроизводит и усиливает.
  • Злоупотребления — дезинформация, фишинг, вредоносный код.
  • Непрозрачность — внутренние решения плохо интерпретируемы; внимание ≠ объяснение.
  • Стоимость и экология — обучение и инференс крупных моделей дороги по compute и энергии.

Качество ответа сильно зависит от промпт-инжиниринга: ясная роль, задача, формат и ограничители часто важнее «сырой» мощности модели.

См. также

Примечания

Литература

  • Vaswani A. et al. Attention Is All You Need // NeurIPS. — 2017. — Т. 30.
  • Brown T. et al. Language Models are Few-Shot Learners // NeurIPS. — 2020. — Т. 33.
  • Kaplan J. et al. Scaling Laws for Neural Language Models // arXiv preprint. — 2020.
  • Hoffmann J. et al. Training Compute-Optimal Large Language Models // arXiv preprint. — 2022.
  • Ouyang L. et al. Training language models to follow instructions with human feedback // NeurIPS. — 2022. — Т. 35.
  • Hu E. J. et al. LoRA: Low-Rank Adaptation of Large Language Models // ICLR. — 2022.
  • Lewis P. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks // NeurIPS. — 2020. — Т. 33.
  • Wei J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models // NeurIPS. — 2022.
  • DeepSeek-AI DeepSeek-V3 Technical Report // arXiv preprint. — 2024.