Большая языковая модель

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Доработка по замечанию: глубина, история вех, сравнение LLM, новый промпт)
(глубина как у эталона, сравнение LLM по разделам, второй промпт)
 
Строка 4: Строка 4:
{{TOCright}}
{{TOCright}}
-
'''Больша́я языкова́я мо́дель''' (англ. large language model, LLM) — класс моделей [[Машинное обучение|машинного обучения]] на основе [[Глубокое обучение|глубоких нейронных сетей]], обученных на огромных корпусах текстов и способных понимать, генерировать и преобразовывать текст на естественном языке. Современные LLM, как правило, строятся на архитектуре [[Трансформер (модель)|трансформера]] и содержат от сотен миллионов до нескольких триллионов параметров. Благодаря самообучению на разнородных данных они умеют решать широкий круг задач без отдельного дообучения под каждую из них: перевод, ответы на вопросы, суммаризация, написание кода, ведение диалога.
+
'''Больша́я языкова́я мо́дель''' (англ. ''large language model'', LLM) — класс моделей [[Машинное обучение|машинного обучения]] на основе [[Глубокое обучение|глубоких нейронных сетей]], обученных на чрезвычайно больших корпусах текстов и способных понимать, генерировать и преобразовывать текст на [[Естественный язык|естественном языке]]. Современные LLM, как правило, строятся на архитектуре [[Трансформер (модель)|трансформера]] и содержат от сотен миллионов до нескольких триллионов параметров. Благодаря самообучению на разнородных данных они приобретают способность решать широкий круг задач без отдельного дообучения под каждую из них: машинный перевод, ответы на вопросы, суммаризация, написание программного кода, ведение диалога и многое другое.
-
LLM лежат в основе систем вроде GPT, Claude, Gemini, LLaMA, DeepSeek и Qwen и считаются ключевым компонентом современного [[Искусственный интеллект|искусственного интеллекта]].
+
LLM лежат в основе таких систем, как GPT, Claude, Gemini, Llama, DeepSeek и Qwen. Они рассматриваются как ключевой компонент современного [[Искусственный интеллект|искусственного интеллекта]] и движущая сила генеративных технологий. Для новичка полезно думать о LLM как о «очень большой статистической машине следующего слова», которая, благодаря масштабу данных и параметров, неожиданно научилась имитировать рассуждение, стиль и знание фактов; для практика важны уже детали: decoder-only vs encoder–decoder, длина контекста, стоимость токена, наличие tool-use и RAG, открытость весов.
== Архитектура трансформера и механизм внимания ==
== Архитектура трансформера и механизм внимания ==
-
 
+
Основой подавляющего большинства больших языковых моделей служит архитектура [[Трансформер (модель)|трансформера]], предложенная в работе «Attention Is All You Need» (Vaswani et al., 2017)<ref name="vaswani2017">{{статья|автор=Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I.|заглавие=Attention Is All You Need|издание=Advances in Neural Information Processing Systems|год=2017|том=30|ссылка=https://arxiv.org/abs/1706.03762}}</ref>. Трансформер отказался от рекуррентных и свёрточных слоёв, использовавшихся ранее для обработки последовательностей, и полностью построен на [[Механизм внимания|механизме внимания]] (attention). Это позволило эффективнее обрабатывать длинные тексты и распараллеливать вычисления — критично при обучении на гигантских корпусах.
-
Основой большинства LLM служит [[Трансформер (модель)|трансформер]], предложенный в работе «Attention Is All You Need» (Vaswani et al., 2017)<ref name="vaswani2017">{{статья |автор=Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I. |заглавие=Attention Is All You Need |издание=Advances in Neural Information Processing Systems |год=2017 |том=30 |ссылка=https://arxiv.org/abs/1706.03762}}</ref>. Он отказался от рекуррентных и свёрточных слоёв и целиком построен на [[Механизм внимания|механизме внимания]]. Это позволило эффективнее обрабатывать длинные тексты и распараллеливать вычисления — критично при обучении на гигантских корпусах.
+
=== Само-внимание (self-attention) ===
=== Само-внимание (self-attention) ===
 +
Центральный элемент трансформера — '''многоголовое само-внимание''' (multi-head self-attention). Его идею удобно пояснить аналогией с поиском в библиотеке: у вас есть ''запрос'' (query), у каждой книги — ''ключ'' (key, краткое описание) и ''содержание'' (value, полный текст). Внимание сопоставляет запрос с ключами всех книг, оценивает релевантность и на её основе взвешенно суммирует содержимое.
-
Центральный элемент — '''многоголовое само-внимание''' (multi-head self-attention). Идею удобно пояснить аналогией с библиотекой: есть ''запрос'' (query), у каждой книги — ''ключ'' (key, описание) и ''содержание'' (value, полный текст). Внимание сопоставляет запрос с ключами, оценивает релевантность и взвешенно суммирует содержимое.
+
Формально для последовательности входных векторов (токенов) строятся матрицы запросов <tex>Q</tex>, ключей <tex>K</tex> и значений <tex>V</tex>. Выход внимания:
-
 
+
-
Формально для входных векторов (токенов) строятся матрицы запросов <tex>Q</tex>, ключей <tex>K</tex> и значений <tex>V</tex>:
+
:<tex>\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V,</tex>
:<tex>\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V,</tex>
-
где <tex>d_k</tex> — размерность ключей. Softmax по строке превращает скалярные произведения в веса; деление на <tex>\sqrt{d_k}</tex> стабилизирует градиенты.
+
где <tex>d_k</tex> — размерность ключей. Softmax по строке превращает скалярные произведения в вероятностные веса; деление на <tex>\sqrt{d_k}</tex> предотвращает слишком резкие градиенты при больших размерностях.
-
Иначе говоря, каждое слово «смотрит» на все остальные и решает, насколько они важны в данном контексте. Так модель улавливает дальние зависимости — например, связь местоимения с именем, упомянутым несколькими предложениями ранее.
+
Иными словами, каждое слово в предложении «смотрит» на все остальные и решает, насколько они важны для его понимания в данном контексте. Так модель улавливает дальние зависимости — например, связь местоимения с именем, упомянутым несколькими предложениями ранее. Сложность наивного внимания квадратична по длине последовательности: <tex>O(n^2 d)</tex>, что объясняет, почему длина контекста — не только «удобство пользователя», но и жёсткое инженерное ограничение.
=== Многоголовое внимание и позиционное кодирование ===
=== Многоголовое внимание и позиционное кодирование ===
 +
Вместо одного внимания используют несколько «голов» (heads): каждая работает в своём подпространстве и следит за своим типом отношений (синтаксис, семантика, кореференция). Выходы голов объединяют и линейно преобразуют:
-
Вместо одного внимания используют несколько «голов»: каждая работает в своём подпространстве и следит за своим типом связей (синтаксис, семантика, кореференция). Выходы голов объединяют и линейно преобразуют.
+
:<tex>\text{MultiHead}(Q,K,V)=\text{Concat}(\text{head}_1,\ldots,\text{head}_h)W^O.</tex>
-
Сам по себе attention не знает порядка слов (он перестановочно инвариантен), поэтому к встраиваниям токенов добавляют '''позиционные кодировки'''. В оригинале — синусоидальные; позже — обучаемые; в современных LLM часто '''вращающиеся''' (RoPE), лучше обобщающиеся на длинный контекст.
+
Сам по себе механизм внимания перестановочно инвариантен: он не знает порядка слов. Поэтому к [[Нейросетевое встраивание|встраиваниям]] токенов добавляют '''позиционные кодировки''' (positional encodings). В оригинальной работе — синусоидальные функции; позже — обучаемые позиционные представления; в современных LLM часто '''вращающиеся''' позиционные кодировки (RoPE), которые лучше обобщаются на длинные контексты.
=== Энкодер, декодер и современные варианты ===
=== Энкодер, декодер и современные варианты ===
-
 
+
Классический трансформер состоит из '''энкодера''' (сжимает вход в контекстное представление) и '''декодера''' (порождает выход). В больших языковых моделях чаще применяют ''только декодер'' (decoder-only), как в серии GPT: модель предсказывает следующий токен по предыдущим, используя каузальное (маскированное) само-внимание, запрещающее «заглядывать вперёд». Такой режим естественно подходит для генерации и легче масштабируется.
-
Классический трансформер — энкодер + декодер. В LLM чаще используют '''только декодер''' (decoder-only), как в GPT: модель предсказывает следующий токен по предыдущим с ''маскированным'' само-вниманием, запрещающим «заглядывать вперёд». Такой режим естественно подходит для генерации и легче масштабируется.
+
Авторегрессионная модель факторизует вероятность последовательности:
Авторегрессионная модель факторизует вероятность последовательности:
Строка 38: Строка 36:
:<tex>P(x_1,\ldots,x_n)=\prod_{t=1}^{n} P(x_t\mid x_1,\ldots,x_{t-1}).</tex>
:<tex>P(x_1,\ldots,x_n)=\prod_{t=1}^{n} P(x_t\mid x_1,\ldots,x_{t-1}).</tex>
-
== История развития больших языковых моделей ==
+
Обучение обычно минимизирует кросс-энтропию (отрицательное логарифмическое правдоподобие) следующего токена. Encoder–decoder-архитектуры (T5, классический перевод) сильнее в задачах «вход → выход», где вход и ответ структурно различны; decoder-only выигрывает универсальностью и масштабируемостью при генерации.
 +
== История ==
=== Появление термина LLM ===
=== Появление термина LLM ===
-
 
+
Точное авторство термина «Large Language Model» установить сложно: описательно он применялся по мере роста нейросетевых языковых моделей. В академической литературе словосочетание широко закрепилось после выхода GPT-2 (Radford et al., 2019) и особенно GPT-3 (Brown et al., 2020) с 175 млрд параметров<ref name="brown2020">{{статья|автор=Brown T. B., Mann B., Ryder N. и др.|заглавие=Language Models are Few-Shot Learners|издание=Advances in Neural Information Processing Systems|год=2020|том=33|ссылка=https://arxiv.org/abs/2005.14165}}</ref>. К 2020–2021 году LLM стало общепринятым названием для трансформерных моделей, предобученных на огромных текстовых корпусах и насчитывающих миллиарды параметров. Понятие «большая» исторически смещалось: BERT-Large (340 млн параметров, 2018) когда-то казался огромным.
-
Точное авторство термина «Large Language Model» установить сложно: он появлялся описательно по мере роста моделей. В академической литературе закрепился после GPT-2 (Radford et al., 2019) и особенно GPT-3 (Brown et al., 2020) с 175 млрд параметров<ref name="brown2020">{{статья |автор=Brown T. et al. |заглавие=Language Models are Few-Shot Learners |издание=Advances in Neural Information Processing Systems |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.14165}}</ref>. К 2020–2021 году LLM стало общепринятым названием для трансформерных моделей, предобученных на огромных корпусах и насчитывающих миллиарды параметров. Понятие «большая» исторически смещалось: BERT-Large (340 млн, 2018) когда-то казался огромным.
+
=== Основные вехи развития ===
=== Основные вехи развития ===
 +
'''Ранние языковые модели (2013–2018).''' Практический старт дали статические [[Нейросетевое встраивание|нейросетевые встраивания]] Word2Vec (Mikolov et al., 2013) и GloVe (Pennington et al., 2014). Затем появились контекстные модели: ELMo (Peters et al., 2018) и BERT (Devlin et al., 2019) — предобучение на больших корпусах и тонкая настройка (fine-tuning) под конкретные задачи. BERT уже имел сотни миллионов параметров и на момент создания считался «большим».
-
'''Ранние языковые модели (2013–2018).''' Практический старт дали статические [[Нейросетевое встраивание|встраивания]] Word2Vec и GloVe, затем контекстные ELMo и BERT с предобучением и fine-tuning.
+
'''GPT, T5 и эра масштабирования (2018–2020).''' OpenAI выпустила GPT-1 (2018) и GPT-2 (2019) — decoder-only трансформеры, обученные на предсказании следующего слова. GPT-2 с 1,5 млрд параметров показал, что модели могут генерировать связные тексты, иногда почти неотличимые от человеческих. T5 (Raffel et al., 2020) унифицировал задачи в формате «текст → текст». GPT-3 продемонстрировал феномен ''in-context learning'' — способность решать новые задачи по нескольким примерам в промпте без обновления весов — и фактически дал старт индустрии LLM.
-
'''GPT, T5 и эра масштабирования (2018–2020).''' GPT-1/2 — decoder-only трансформеры на предсказании следующего слова. T5 унифицировал задачи в формате «текст → текст». GPT-3 продемонстрировал ''in-context learning'': решение новых задач по нескольким примерам в промпте без обновления весов — и фактически запустил индустрию LLM.
+
'''Законы масштабирования.''' Kaplan et al. (2020) показали степенную зависимость потерь от размера модели и данных<ref name="kaplan2020">{{статья|автор=Kaplan J., McCandlish S., Henighan T. и др.|заглавие=Scaling Laws for Neural Language Models|издание=arXiv preprint|год=2020|ссылка=https://arxiv.org/abs/2001.08361}}</ref>. Hoffmann et al. (2022, Chinchilla) уточнили: при фиксированном compute-бюджете оптимальна не «максимально огромная» модель, а баланс числа параметров <tex>N</tex> и объёма данных <tex>D</tex><ref name="hoffmann2022">{{статья|автор=Hoffmann J., Borgeaud S., Mensch A. и др.|заглавие=Training Compute-Optimal Large Language Models|издание=arXiv preprint|год=2022|ссылка=https://arxiv.org/abs/2203.15556}}</ref>:
-
'''InstructGPT и выравнивание (2022).''' Метод [[Обучение с подкреплением из обратной связи человека (RLHF)|RLHF]] позволил настраивать модели под инструкции и предпочтения людей. InstructGPT показал: относительно небольшая выровненная модель даёт более полезные и безопасные ответы, чем сырая крупная GPT-3. На этом подходе вырос ChatGPT<ref name="ouyang2022">{{статья |автор=Ouyang L. et al. |заглавие=Training language models to follow instructions with human feedback |издание=Advances in Neural Information Processing Systems |год=2022 |том=35 |ссылка=https://arxiv.org/abs/2203.02155}}</ref>.
+
:<tex>L(N,D)\approx A N^{-\alpha}+B D^{-\beta}+L_\infty.</tex>
-
'''LoRA и эффективная адаптация (2021–2022).''' Полное дообучение гигантских моделей дорого. LoRA добавляет низкоранговые обучаемые матрицы к замороженным весам, резко снижая стоимость адаптации и открывая массовый community fine-tuning<ref name="lora2022">{{статья |автор=Hu E. J. et al. |заглавие=LoRA: Low-Rank Adaptation of Large Language Models |издание=ICLR |год=2022 |ссылка=https://arxiv.org/abs/2106.09685}}</ref>.
+
Практический вывод: «просто добавить параметров» без достаточного числа токенов обучения — пустая трата compute.
-
'''Рассуждения и цепочка мыслей (2022–2025).''' Chain-of-Thought (Wei et al., 2022) показал: если модель явно пишет промежуточные шаги, качество сложных задач растёт. Дальше появились модели, специально обученные «думать» дольше на этапе вывода (o1, DeepSeek-R1): больше compute на инференсе вместо только на обучении.
+
'''InstructGPT и выравнивание (2022).''' Метод [[Обучение с подкреплением из обратной связи человека (RLHF)|RLHF]] позволил настраивать языковые модели под инструкции и предпочтения человека. InstructGPT (Ouyang et al., 2022), построенный на GPT-3, показал: относительно небольшая выровненная модель даёт более полезные и безопасные ответы, чем намного более крупная «сырая» GPT-3. Этот подход лёг в основу ChatGPT и последующих диалоговых систем<ref name="ouyang2022">{{статья|автор=Ouyang L., Wu J., Jiang X. и др.|заглавие=Training language models to follow instructions with human feedback|издание=Advances in Neural Information Processing Systems|год=2022|том=35|ссылка=https://arxiv.org/abs/2203.02155}}</ref>.
-
'''Смесь экспертов (MoE).''' В [[Смесь экспертов|MoE]] для каждого токена активируется лишь часть «экспертов» (параллельных FFN). Ёмкость модели растёт при умеренной стоимости инференса. Подход используют GPT-4, Gemini, Mixtral, DeepSeek-V2/V3, Qwen-MoE.
+
'''LoRA и эффективная адаптация (2021–2022).''' С ростом моделей полное дообучение стало дорогостоящим. Метод LoRA (Hu et al., 2021) адаптирует LLM, добавляя лишь небольшое число обучаемых параметров в виде низкоранговых матриц к замороженным весам, что радикально снизило вычислительные затраты и открыло массовый community-driven fine-tuning<ref name="lora2022">{{статья|автор=Hu E. J., Shen Y., Wallis P. и др.|заглавие=LoRA: Low-Rank Adaptation of Large Language Models|издание=Proceedings of the International Conference on Learning Representations (ICLR)|год=2022|ссылка=https://arxiv.org/abs/2106.09685}}</ref>.
-
'''RAG (2020).''' Retrieval-Augmented Generation соединяет генерацию с поиском по внешней базе: модель опирается на найденные документы, снижает галлюцинации и даёт актуальные ответы без переобучения — основа корпоративных QA-систем<ref name="rag2020">{{статья |автор=Lewis P. et al. |заглавие=Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks |издание=Advances in Neural Information Processing Systems |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.11401}}</ref>.
+
'''Рассуждения и цепочка мыслей (2022–2025).''' Приём chain-of-thought (Wei et al., 2022) показал: LLM заметно лучше решают сложные задачи, если им дать возможность генерировать промежуточные шаги рассуждения<ref name="wei2022">{{статья|автор=Wei J., Wang X., Schuurmans D. и др.|заглавие=Chain-of-Thought Prompting Elicits Reasoning in Large Language Models|издание=Advances in Neural Information Processing Systems|год=2022|ссылка=https://arxiv.org/abs/2201.11903}}</ref>. Эта линия усилилась в GPT-4, Claude 3/4, Gemini. Следующим шагом стали модели, специально обученные «думать дольше» на этапе вывода — OpenAI o-серия (с 2024) и DeepSeek-R1 (2025): больше compute на инференсе для проверки и корректировки собственных цепочек мыслей.
-
'''Внешняя / дифференцируемая память.''' Направление вроде Engram и родственных memory-модулей дополняет параметрическую «память в весах» внешним хранилищем фактов — чтобы точнее извлекать знания и лучше контролировать, что модель «помнит».
+
'''Смесь экспертов (MoE, 2023–2025).''' Архитектура [[Смесь экспертов|смеси экспертов]] (Mixture of Experts) давно изучалась (Shazeer et al., 2017), но массовое внедрение в открытые LLM произошло с Mixtral 8×7B (Mistral AI, 2023) и далее DeepSeek-V2/V3, Qwen-MoE. В MoE модель содержит множество «экспертов» — параллельных feed-forward подсетей; для каждого токена активируется лишь часть из них. Это даёт высокую ёмкость при умеренных затратах на инференс.
-
'''Диффузионные языковые модели (LLDM).''' Классические LLM генерируют текст авторегрессивно. Альтернатива — [[Диффузионная модель|диффузионные]] языковые модели (например, LLaDA): генерация из зашумлённой последовательности с итеративным «очищением». Это даёт параллелизм и иную управляемость генерации.
+
'''Retrieval-Augmented Generation (RAG, 2020).''' RAG (Lewis et al., 2020) объединяет генеративную модель с модулем поиска по внешней базе знаний: во время генерации подбираются релевантные документы, на которые модель опирается. Это позволяет давать актуальные фактологические ответы без переобучения и снижает галлюцинации; RAG стал основой корпоративных QA-систем и чат-ботов с приватными данными<ref name="rag2020">{{статья|автор=Lewis P., Perez E., Piktus A. и др.|заглавие=Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks|издание=Advances in Neural Information Processing Systems|год=2020|том=33|ссылка=https://arxiv.org/abs/2005.11401}}</ref>.
-
=== Законы масштабирования ===
+
'''Внешняя и дифференцируемая память.''' Отдельная линия исследований дополняет параметрическую «память в весах» внешним или дифференцируемым хранилищем фактов (в духе Neural Turing Machine, Memory Networks и более поздних memory-модулей). Цель — точнее извлекать знания, уменьшать галлюцинации и контролировать, что именно модель «помнит», не впечатывая все факты в параметры. Направление пока фрагментировано: промышленный стандарт ближе к RAG и tool-use, чем к единой «универсальной памяти».
-
Kaplan et al. (2020) и Hoffmann et al. (2022, Chinchilla) показали: потери убывают степенным образом от числа параметров <tex>N</tex> и объёма данных <tex>D</tex>:
+
'''Диффузионные языковые модели (2024–2025).''' Классические LLM генерируют текст авторегрессивно — токен за токеном. Альтернатива — [[Диффузионная модель|диффузионные]] языковые модели (Large Language Diffusion Models): порождение начинается с зашумлённой последовательности и итеративно «очищается» денойзинг-сетью (например, LLaDA). Это даёт естественный параллелизм и иную управляемость генерации, открывая отдельную ветвь развития рядом с авторегрессией.
-
:<tex>L(N,D)\approx A N^{-\alpha}+B D^{-\beta}+L_\infty.</tex>
+
== Современные мировые LLM ==
 +
По состоянию на середину 2026 года рынок больших языковых моделей представлен несколькими ведущими семействами, различающимися по архитектуре, доступности весов, мультимодальности и специализации.
 +
 
 +
=== GPT-4o и o-серия (OpenAI) ===
 +
Флагманская линейка OpenAI: GPT-4o — мультимодальная модель (текст, изображение, аудио) с низкой задержкой и развитой экосистемой (ChatGPT, API, плагины, tool-use). o-серия специализируется на рассуждениях: модель тратит заметный бюджет вычислений на этапе вывода, чтобы строить и проверять цепочки мыслей. Сильные стороны — универсальность, экосистема, интеграция с инструментами и кодом. Ограничения — проприетарность, стоимость доступа к максимальным версиям, закрытость деталей обучения.
-
При фиксированном compute-бюджете оптимальна не «максимально огромная» модель, а баланс размера и числа токенов обучения.
+
=== Claude 4 (Anthropic) ===
 +
Семейство моделей с упором на безопасность и «честность» (Constitutional AI). Claude 4 предлагает очень длинный контекст (сотни тысяч токенов), высокую точность в аналитике и программировании, особенно на длинных документах. Конкурентное преимущество — надёжность, относительно низкая склонность к вредному контенту и аккуратная работа с большими объёмами текста. Модели проприетарны, доступны через API и веб-интерфейс.
-
== Современные мировые LLM: сравнение ==
+
=== Gemini (Google DeepMind) ===
 +
Мультимодальные модели, тесно интегрированные с поиском Google и облачной инфраструктурой. Gemini отличается очень большим контекстным окном (порядка миллиона и более токенов в старших версиях), нативной обработкой видео и аудио, сильными математическими и научными рассуждениями. Преимущество — доступ к свежей информации через поисковый индекс, аппаратная база TPU, широкий набор сервисов Google. Модель проприетарна.
-
По состоянию на 2026 год лидеры различаются открытостью, мультимодальностью, длиной контекста и специализацией.
+
=== Llama 4 (Meta) ===
 +
Открытое (open-weight) семейство моделей Meta, продолжающее линию Llama 2 и 3. Llama 4 доступна в широком диапазоне размеров, поддерживает мультимодальность и многоязычие. Главное преимущество — открытость: исследователи и компании могут загружать, дообучать и развёртывать модель на своём оборудовании. Качество лучших закрытых систем по ряду бенчмарков всё ещё выше, но отставание быстро сокращается, а экосистема производных моделей огромна.
 +
=== DeepSeek-V3 и DeepSeek-R1 (DeepSeek) ===
 +
Китайские модели с выдающейся эффективностью. DeepSeek-V3 — MoE-архитектура, обученная с использованием multi-token prediction и относительно экономичным бюджетом; DeepSeek-R1 специализируется на рассуждениях и конкурирует с o-серией при меньшей стоимости инференса. Открытые веса и подробные технические отчёты делают их привлекательными для академических исследований и коммерческого внедрения с контролируемым бюджетом<ref name="deepseekv3">{{статья|автор=DeepSeek-AI|заглавие=DeepSeek-V3 Technical Report|издание=arXiv preprint|год=2024|ссылка=https://arxiv.org/abs/2412.19437}}</ref>.
 +
 +
=== Qwen3 (Alibaba) ===
 +
Серия открытых мультимодальных моделей, охватывающая текст, изображения, аудио и видео. Qwen3 отличается широкой поддержкой языков (особенно азиатских), хорошей производительностью в генерации кода и визуальном понимании. Модели доступны в широком размерном ряде (включая MoE-варианты), что позволяет развёртывать их и на ограниченных ресурсах. Конкурентное преимущество — открытость, мультимодальность и развитая экосистема инструментов.
 +
 +
=== Сравнительная таблица ===
{| class="wikitable"
{| class="wikitable"
-
|+ Сравнение ведущих LLM (ориентировочно, 2026)
+
|+ Сравнение ведущих LLM (ориентировочно, середина 2026)
|-
|-
-
! Модель !! Организация !! Открытость !! Мультимодальность !! Сильные стороны
+
! Модель !! Организация !! Открытость !! Мультимодальность !! Контекст (макс.) !! Сильные стороны
|-
|-
-
| GPT-4o / o-серия || OpenAI || Проприетарная || Текст, изображение, аудио || Экосистема, инструменты, универсальность
+
| GPT-4o / o-серия || OpenAI || Проприетарная || Текст, изображение, аудио || ~128k токенов || Экосистема, инструменты, универсальность, reasoning
|-
|-
-
| Claude 4 || Anthropic || Проприетарная || Текст, изображение || Длинный контекст, аккуратность, код и анализ документов
+
| Claude 4 || Anthropic || Проприетарная || Текст, изображение || ~200–500k токенов || Безопасность, длинные документы, код и анализ
|-
|-
-
| Gemini 2.x Pro || Google DeepMind || Проприетарная || Текст, изображение, аудио, видео || Очень длинный контекст, связь с поиском, научные задачи
+
| Gemini || Google DeepMind || Проприетарная || Текст, изображение, аудио, видео || ~1–2M токенов || Поиск, научные задачи, очень длинный контекст
|-
|-
-
| Llama 4 || Meta || Открытые веса || Текст, изображение || Локальный деплой, дообучение, сообщество
+
| Llama 4 || Meta || Открытые веса || Текст, изображение || ~128k–1M (вариативно) || Локальный деплой, дообучение, сообщество
|-
|-
-
| DeepSeek-V3 / R1 || DeepSeek || Открытые веса || Текст (и расширяющиеся модальности) || Эффективность MoE, сильные рассуждения, низкая стоимость
+
| DeepSeek-V3 / R1 || DeepSeek || Открытые веса || Текст || ~128k токенов || Эффективность MoE, сильное рассуждение, низкая стоимость
|-
|-
-
| Qwen3 || Alibaba || Открытые веса || Текст, изображение, аудио, видео || Мультиязычность, размерный ряд, мультимодальность
+
| Qwen3 || Alibaba || Открытые веса || Текст, изображение, аудио, видео || до ~1M токенов || Мультиязычность, размерный ряд, мультимодальность
|}
|}
-
'''Практический вывод для новичка:''' закрытые API удобны «из коробки»; открытые веса нужны, если важны контроль данных, дообучение и стоимость на своём железе. '''Для профессионала:''' выбирать стоит не по маркетинговому названию, а по связке «задача → длина контекста → latency/cost → возможность RAG/tool-use → требования к приватности».
+
'''Практический вывод.''' Для новичка: закрытые API удобны «из коробки»; открытые веса нужны, если важны контроль данных, дообучение и стоимость на своём железе. Для профессионала: выбирать стоит не по маркетинговому названию, а по связке «задача → длина контекста → latency/cost → RAG/tool-use → приватность».
== Ограничения и риски ==
== Ограничения и риски ==
 +
Несмотря на впечатляющие результаты, LLM сохраняют принципиальные ограничения.
-
* '''Галлюцинации''' — уверенные, но ложные утверждения; лечатся RAG, верификацией и отказом «выдумывать».
+
* '''Галлюцинации''' — уверенные, но ложные утверждения. Модель оптимизирует правдоподобие следующего токена, а не истинность факта. Частично лечатся RAG, верификацией, tool-use и явным отказом «выдумывать».
-
* '''Предвзятости''' обучающих данных — модель их воспроизводит и усиливает.
+
* '''Предвзятости данных''' — модель воспроизводит и усиливает статистические искажения обучающего корпуса (пол, раса, язык, домен).
-
* '''Злоупотребления''' — дезинформация, фишинг, вредоносный код.
+
* '''Злоупотребления''' — генерация дезинформации, фишинга, вредоносного кода; jailbreak-атаки на фильтры безопасности.
-
* '''Непрозрачность''' — внутренние решения плохо интерпретируемы; внимание ≠ объяснение.
+
* '''Непрозрачность''' — внутренние решения плохо интерпретируемы; карты внимания ≠ объяснение для пользователя.
-
* '''Стоимость и экология''' — обучение и инференс крупных моделей дороги по compute и энергии.
+
* '''Хрупкость к формулировке''' — качество ответа сильно зависит от промпта; небольшая перефразировка может резко изменить результат.
 +
* '''Стоимость и экология''' — обучение и инференс крупных моделей дороги по compute и энергии; MoE и квантизация снижают, но не снимают проблему.
 +
* '''Устаревание знаний''' — параметрическая память «заморожена» на дату обучения; без поиска и инструментов модель не знает свежих событий.
-
Качество ответа сильно зависит от [[Промпт-инжиниринг|промпт-инжиниринга]]: ясная роль, задача, формат и ограничители часто важнее «сырой» мощности модели.
+
Качество ответа на практике часто определяется не только «сырой» мощностью модели, но и [[Промпт-инжиниринг|промпт-инжинирингом]]: ясная роль, задача, формат вывода, примеры и ограничители нередко важнее перехода на соседнюю по рейтингу модель. Для сложных задач полезны цепочки рассуждений, разбиение на подзадачи и внешняя проверка фактов.
== См. также ==
== См. также ==
* [[Трансформер (модель)]]
* [[Трансформер (модель)]]
* [[Механизм внимания]]
* [[Механизм внимания]]
 +
* [[Нейросетевое встраивание]]
* [[Обучение с подкреплением из обратной связи человека (RLHF)]]
* [[Обучение с подкреплением из обратной связи человека (RLHF)]]
* [[Промпт-инжиниринг]]
* [[Промпт-инжиниринг]]
-
* [[Нейросетевое встраивание]]
 
* [[Диффузионная модель]]
* [[Диффузионная модель]]
* [[Смесь экспертов]]
* [[Смесь экспертов]]
Строка 119: Строка 135:
== Литература ==
== Литература ==
-
* {{статья |автор=Vaswani A. et al. |заглавие=Attention Is All You Need |издание=NeurIPS |год=2017 |том=30 |ссылка=https://arxiv.org/abs/1706.03762}}
+
* {{статья|автор=Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I.|заглавие=Attention Is All You Need|издание=Advances in Neural Information Processing Systems|год=2017|том=30|ссылка=https://arxiv.org/abs/1706.03762}}
-
* {{статья |автор=Brown T. et al. |заглавие=Language Models are Few-Shot Learners |издание=NeurIPS |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.14165}}
+
* {{статья|автор=Mikolov T., Chen K., Corrado G., Dean J.|заглавие=Efficient Estimation of Word Representations in Vector Space|издание=arXiv preprint|год=2013|ссылка=https://arxiv.org/abs/1301.3781}}
-
* {{статья |автор=Kaplan J. et al. |заглавие=Scaling Laws for Neural Language Models |издание=arXiv preprint |год=2020 |ссылка=https://arxiv.org/abs/2001.08361}}
+
* {{статья|автор=Devlin J., Chang M.-W., Lee K., Toutanova K.|заглавие=BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding|издание=Proceedings of NAACL-HLT|год=2019|ссылка=https://arxiv.org/abs/1810.04805}}
-
* {{статья |автор=Hoffmann J. et al. |заглавие=Training Compute-Optimal Large Language Models |издание=arXiv preprint |год=2022 |ссылка=https://arxiv.org/abs/2203.15556}}
+
* {{статья|автор=Radford A., Wu J., Child R., Luan D., Amodei D., Sutskever I.|заглавие=Language Models are Unsupervised Multitask Learners|издание=OpenAI Technical Report|год=2019}}
-
* {{статья |автор=Ouyang L. et al. |заглавие=Training language models to follow instructions with human feedback |издание=NeurIPS |год=2022 |том=35 |ссылка=https://arxiv.org/abs/2203.02155}}
+
* {{статья|автор=Brown T. B., Mann B., Ryder N. и др.|заглавие=Language Models are Few-Shot Learners|издание=Advances in Neural Information Processing Systems|год=2020|том=33|ссылка=https://arxiv.org/abs/2005.14165}}
-
* {{статья |автор=Hu E. J. et al. |заглавие=LoRA: Low-Rank Adaptation of Large Language Models |издание=ICLR |год=2022 |ссылка=https://arxiv.org/abs/2106.09685}}
+
* {{статья|автор=Kaplan J., McCandlish S., Henighan T. и др.|заглавие=Scaling Laws for Neural Language Models|издание=arXiv preprint|год=2020|ссылка=https://arxiv.org/abs/2001.08361}}
-
* {{статья |автор=Lewis P. et al. |заглавие=Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks |издание=NeurIPS |год=2020 |том=33 |ссылка=https://arxiv.org/abs/2005.11401}}
+
* {{статья|автор=Lewis P., Perez E., Piktus A. и др.|заглавие=Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks|издание=Advances in Neural Information Processing Systems|год=2020|том=33|ссылка=https://arxiv.org/abs/2005.11401}}
-
* {{статья |автор=Wei J. et al. |заглавие=Chain-of-Thought Prompting Elicits Reasoning in Large Language Models |издание=NeurIPS |год=2022 |ссылка=https://arxiv.org/abs/2201.11903}}
+
* {{статья|автор=Raffel C., Shazeer N., Roberts A. и др.|заглавие=Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer|издание=Journal of Machine Learning Research|год=2020|том=21|ссылка=https://arxiv.org/abs/1910.10683}}
-
* {{статья |автор=DeepSeek-AI |заглавие=DeepSeek-V3 Technical Report |издание=arXiv preprint |год=2024 |ссылка=https://arxiv.org/abs/2412.19437}}
+
* {{статья|автор=Hu E. J., Shen Y., Wallis P. и др.|заглавие=LoRA: Low-Rank Adaptation of Large Language Models|издание=ICLR|год=2022|ссылка=https://arxiv.org/abs/2106.09685}}
 +
* {{статья|автор=Ouyang L., Wu J., Jiang X. и др.|заглавие=Training language models to follow instructions with human feedback|издание=Advances in Neural Information Processing Systems|год=2022|том=35|ссылка=https://arxiv.org/abs/2203.02155}}
 +
* {{статья|автор=Hoffmann J., Borgeaud S., Mensch A. и др.|заглавие=Training Compute-Optimal Large Language Models|издание=arXiv preprint|год=2022|ссылка=https://arxiv.org/abs/2203.15556}}
 +
* {{статья|автор=Wei J., Wang X., Schuurmans D. и др.|заглавие=Chain-of-Thought Prompting Elicits Reasoning in Large Language Models|издание=Advances in Neural Information Processing Systems|год=2022|ссылка=https://arxiv.org/abs/2201.11903}}
 +
* {{статья|автор=Shazeer N., Mirhoseini A., Maziarz K. и др.|заглавие=Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer|издание=ICLR|год=2017|ссылка=https://arxiv.org/abs/1701.06538}}
 +
* {{статья|автор=DeepSeek-AI|заглавие=DeepSeek-V3 Technical Report|издание=arXiv preprint|год=2024|ссылка=https://arxiv.org/abs/2412.19437}}
[[Категория:Машинное обучение]]
[[Категория:Машинное обучение]]

Текущая версия

Статья написана с использованием LLM Claude Sonnet 4 и проверена участником Emil Petrov 19:45, 14 июля 2026 (MSD)

Промпт приводится полностью в Обсуждение:Большая языковая модель


Содержание

Больша́я языкова́я мо́дель (англ. large language model, LLM) — класс моделей машинного обучения на основе глубоких нейронных сетей, обученных на чрезвычайно больших корпусах текстов и способных понимать, генерировать и преобразовывать текст на естественном языке. Современные LLM, как правило, строятся на архитектуре трансформера и содержат от сотен миллионов до нескольких триллионов параметров. Благодаря самообучению на разнородных данных они приобретают способность решать широкий круг задач без отдельного дообучения под каждую из них: машинный перевод, ответы на вопросы, суммаризация, написание программного кода, ведение диалога и многое другое.

LLM лежат в основе таких систем, как GPT, Claude, Gemini, Llama, DeepSeek и Qwen. Они рассматриваются как ключевой компонент современного искусственного интеллекта и движущая сила генеративных технологий. Для новичка полезно думать о LLM как о «очень большой статистической машине следующего слова», которая, благодаря масштабу данных и параметров, неожиданно научилась имитировать рассуждение, стиль и знание фактов; для практика важны уже детали: decoder-only vs encoder–decoder, длина контекста, стоимость токена, наличие tool-use и RAG, открытость весов.

Архитектура трансформера и механизм внимания

Основой подавляющего большинства больших языковых моделей служит архитектура трансформера, предложенная в работе «Attention Is All You Need» (Vaswani et al., 2017)[1]. Трансформер отказался от рекуррентных и свёрточных слоёв, использовавшихся ранее для обработки последовательностей, и полностью построен на механизме внимания (attention). Это позволило эффективнее обрабатывать длинные тексты и распараллеливать вычисления — критично при обучении на гигантских корпусах.

Само-внимание (self-attention)

Центральный элемент трансформера — многоголовое само-внимание (multi-head self-attention). Его идею удобно пояснить аналогией с поиском в библиотеке: у вас есть запрос (query), у каждой книги — ключ (key, краткое описание) и содержание (value, полный текст). Внимание сопоставляет запрос с ключами всех книг, оценивает релевантность и на её основе взвешенно суммирует содержимое.

Формально для последовательности входных векторов (токенов) строятся матрицы запросов Q, ключей K и значений V. Выход внимания:

\text{Attention}(Q, K, V) = \text{softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right) V,

где d_k — размерность ключей. Softmax по строке превращает скалярные произведения в вероятностные веса; деление на \sqrt{d_k} предотвращает слишком резкие градиенты при больших размерностях.

Иными словами, каждое слово в предложении «смотрит» на все остальные и решает, насколько они важны для его понимания в данном контексте. Так модель улавливает дальние зависимости — например, связь местоимения с именем, упомянутым несколькими предложениями ранее. Сложность наивного внимания квадратична по длине последовательности: O(n^2 d), что объясняет, почему длина контекста — не только «удобство пользователя», но и жёсткое инженерное ограничение.

Многоголовое внимание и позиционное кодирование

Вместо одного внимания используют несколько «голов» (heads): каждая работает в своём подпространстве и следит за своим типом отношений (синтаксис, семантика, кореференция). Выходы голов объединяют и линейно преобразуют:

\text{MultiHead}(Q,K,V)=\text{Concat}(\text{head}_1,\ldots,\text{head}_h)W^O.

Сам по себе механизм внимания перестановочно инвариантен: он не знает порядка слов. Поэтому к встраиваниям токенов добавляют позиционные кодировки (positional encodings). В оригинальной работе — синусоидальные функции; позже — обучаемые позиционные представления; в современных LLM часто вращающиеся позиционные кодировки (RoPE), которые лучше обобщаются на длинные контексты.

Энкодер, декодер и современные варианты

Классический трансформер состоит из энкодера (сжимает вход в контекстное представление) и декодера (порождает выход). В больших языковых моделях чаще применяют только декодер (decoder-only), как в серии GPT: модель предсказывает следующий токен по предыдущим, используя каузальное (маскированное) само-внимание, запрещающее «заглядывать вперёд». Такой режим естественно подходит для генерации и легче масштабируется.

Авторегрессионная модель факторизует вероятность последовательности:

P(x_1,\ldots,x_n)=\prod_{t=1}^{n} P(x_t\mid x_1,\ldots,x_{t-1}).

Обучение обычно минимизирует кросс-энтропию (отрицательное логарифмическое правдоподобие) следующего токена. Encoder–decoder-архитектуры (T5, классический перевод) сильнее в задачах «вход → выход», где вход и ответ структурно различны; decoder-only выигрывает универсальностью и масштабируемостью при генерации.

История

Появление термина LLM

Точное авторство термина «Large Language Model» установить сложно: описательно он применялся по мере роста нейросетевых языковых моделей. В академической литературе словосочетание широко закрепилось после выхода GPT-2 (Radford et al., 2019) и особенно GPT-3 (Brown et al., 2020) с 175 млрд параметров[1]. К 2020–2021 году LLM стало общепринятым названием для трансформерных моделей, предобученных на огромных текстовых корпусах и насчитывающих миллиарды параметров. Понятие «большая» исторически смещалось: BERT-Large (340 млн параметров, 2018) когда-то казался огромным.

Основные вехи развития

Ранние языковые модели (2013–2018). Практический старт дали статические нейросетевые встраивания Word2Vec (Mikolov et al., 2013) и GloVe (Pennington et al., 2014). Затем появились контекстные модели: ELMo (Peters et al., 2018) и BERT (Devlin et al., 2019) — предобучение на больших корпусах и тонкая настройка (fine-tuning) под конкретные задачи. BERT уже имел сотни миллионов параметров и на момент создания считался «большим».

GPT, T5 и эра масштабирования (2018–2020). OpenAI выпустила GPT-1 (2018) и GPT-2 (2019) — decoder-only трансформеры, обученные на предсказании следующего слова. GPT-2 с 1,5 млрд параметров показал, что модели могут генерировать связные тексты, иногда почти неотличимые от человеческих. T5 (Raffel et al., 2020) унифицировал задачи в формате «текст → текст». GPT-3 продемонстрировал феномен in-context learning — способность решать новые задачи по нескольким примерам в промпте без обновления весов — и фактически дал старт индустрии LLM.

Законы масштабирования. Kaplan et al. (2020) показали степенную зависимость потерь от размера модели и данных[1]. Hoffmann et al. (2022, Chinchilla) уточнили: при фиксированном compute-бюджете оптимальна не «максимально огромная» модель, а баланс числа параметров N и объёма данных D[1]:

L(N,D)\approx A N^{-\alpha}+B D^{-\beta}+L_\infty.

Практический вывод: «просто добавить параметров» без достаточного числа токенов обучения — пустая трата compute.

InstructGPT и выравнивание (2022). Метод RLHF позволил настраивать языковые модели под инструкции и предпочтения человека. InstructGPT (Ouyang et al., 2022), построенный на GPT-3, показал: относительно небольшая выровненная модель даёт более полезные и безопасные ответы, чем намного более крупная «сырая» GPT-3. Этот подход лёг в основу ChatGPT и последующих диалоговых систем[1].

LoRA и эффективная адаптация (2021–2022). С ростом моделей полное дообучение стало дорогостоящим. Метод LoRA (Hu et al., 2021) адаптирует LLM, добавляя лишь небольшое число обучаемых параметров в виде низкоранговых матриц к замороженным весам, что радикально снизило вычислительные затраты и открыло массовый community-driven fine-tuning[1].

Рассуждения и цепочка мыслей (2022–2025). Приём chain-of-thought (Wei et al., 2022) показал: LLM заметно лучше решают сложные задачи, если им дать возможность генерировать промежуточные шаги рассуждения[1]. Эта линия усилилась в GPT-4, Claude 3/4, Gemini. Следующим шагом стали модели, специально обученные «думать дольше» на этапе вывода — OpenAI o-серия (с 2024) и DeepSeek-R1 (2025): больше compute на инференсе для проверки и корректировки собственных цепочек мыслей.

Смесь экспертов (MoE, 2023–2025). Архитектура смеси экспертов (Mixture of Experts) давно изучалась (Shazeer et al., 2017), но массовое внедрение в открытые LLM произошло с Mixtral 8×7B (Mistral AI, 2023) и далее DeepSeek-V2/V3, Qwen-MoE. В MoE модель содержит множество «экспертов» — параллельных feed-forward подсетей; для каждого токена активируется лишь часть из них. Это даёт высокую ёмкость при умеренных затратах на инференс.

Retrieval-Augmented Generation (RAG, 2020). RAG (Lewis et al., 2020) объединяет генеративную модель с модулем поиска по внешней базе знаний: во время генерации подбираются релевантные документы, на которые модель опирается. Это позволяет давать актуальные фактологические ответы без переобучения и снижает галлюцинации; RAG стал основой корпоративных QA-систем и чат-ботов с приватными данными[1].

Внешняя и дифференцируемая память. Отдельная линия исследований дополняет параметрическую «память в весах» внешним или дифференцируемым хранилищем фактов (в духе Neural Turing Machine, Memory Networks и более поздних memory-модулей). Цель — точнее извлекать знания, уменьшать галлюцинации и контролировать, что именно модель «помнит», не впечатывая все факты в параметры. Направление пока фрагментировано: промышленный стандарт ближе к RAG и tool-use, чем к единой «универсальной памяти».

Диффузионные языковые модели (2024–2025). Классические LLM генерируют текст авторегрессивно — токен за токеном. Альтернатива — диффузионные языковые модели (Large Language Diffusion Models): порождение начинается с зашумлённой последовательности и итеративно «очищается» денойзинг-сетью (например, LLaDA). Это даёт естественный параллелизм и иную управляемость генерации, открывая отдельную ветвь развития рядом с авторегрессией.

Современные мировые LLM

По состоянию на середину 2026 года рынок больших языковых моделей представлен несколькими ведущими семействами, различающимися по архитектуре, доступности весов, мультимодальности и специализации.

GPT-4o и o-серия (OpenAI)

Флагманская линейка OpenAI: GPT-4o — мультимодальная модель (текст, изображение, аудио) с низкой задержкой и развитой экосистемой (ChatGPT, API, плагины, tool-use). o-серия специализируется на рассуждениях: модель тратит заметный бюджет вычислений на этапе вывода, чтобы строить и проверять цепочки мыслей. Сильные стороны — универсальность, экосистема, интеграция с инструментами и кодом. Ограничения — проприетарность, стоимость доступа к максимальным версиям, закрытость деталей обучения.

Claude 4 (Anthropic)

Семейство моделей с упором на безопасность и «честность» (Constitutional AI). Claude 4 предлагает очень длинный контекст (сотни тысяч токенов), высокую точность в аналитике и программировании, особенно на длинных документах. Конкурентное преимущество — надёжность, относительно низкая склонность к вредному контенту и аккуратная работа с большими объёмами текста. Модели проприетарны, доступны через API и веб-интерфейс.

Gemini (Google DeepMind)

Мультимодальные модели, тесно интегрированные с поиском Google и облачной инфраструктурой. Gemini отличается очень большим контекстным окном (порядка миллиона и более токенов в старших версиях), нативной обработкой видео и аудио, сильными математическими и научными рассуждениями. Преимущество — доступ к свежей информации через поисковый индекс, аппаратная база TPU, широкий набор сервисов Google. Модель проприетарна.

Llama 4 (Meta)

Открытое (open-weight) семейство моделей Meta, продолжающее линию Llama 2 и 3. Llama 4 доступна в широком диапазоне размеров, поддерживает мультимодальность и многоязычие. Главное преимущество — открытость: исследователи и компании могут загружать, дообучать и развёртывать модель на своём оборудовании. Качество лучших закрытых систем по ряду бенчмарков всё ещё выше, но отставание быстро сокращается, а экосистема производных моделей огромна.

DeepSeek-V3 и DeepSeek-R1 (DeepSeek)

Китайские модели с выдающейся эффективностью. DeepSeek-V3 — MoE-архитектура, обученная с использованием multi-token prediction и относительно экономичным бюджетом; DeepSeek-R1 специализируется на рассуждениях и конкурирует с o-серией при меньшей стоимости инференса. Открытые веса и подробные технические отчёты делают их привлекательными для академических исследований и коммерческого внедрения с контролируемым бюджетом[1].

Qwen3 (Alibaba)

Серия открытых мультимодальных моделей, охватывающая текст, изображения, аудио и видео. Qwen3 отличается широкой поддержкой языков (особенно азиатских), хорошей производительностью в генерации кода и визуальном понимании. Модели доступны в широком размерном ряде (включая MoE-варианты), что позволяет развёртывать их и на ограниченных ресурсах. Конкурентное преимущество — открытость, мультимодальность и развитая экосистема инструментов.

Сравнительная таблица

Сравнение ведущих LLM (ориентировочно, середина 2026)
Модель Организация Открытость Мультимодальность Контекст (макс.) Сильные стороны
GPT-4o / o-серия OpenAI Проприетарная Текст, изображение, аудио ~128k токенов Экосистема, инструменты, универсальность, reasoning
Claude 4 Anthropic Проприетарная Текст, изображение ~200–500k токенов Безопасность, длинные документы, код и анализ
Gemini Google DeepMind Проприетарная Текст, изображение, аудио, видео ~1–2M токенов Поиск, научные задачи, очень длинный контекст
Llama 4 Meta Открытые веса Текст, изображение ~128k–1M (вариативно) Локальный деплой, дообучение, сообщество
DeepSeek-V3 / R1 DeepSeek Открытые веса Текст ~128k токенов Эффективность MoE, сильное рассуждение, низкая стоимость
Qwen3 Alibaba Открытые веса Текст, изображение, аудио, видео до ~1M токенов Мультиязычность, размерный ряд, мультимодальность

Практический вывод. Для новичка: закрытые API удобны «из коробки»; открытые веса нужны, если важны контроль данных, дообучение и стоимость на своём железе. Для профессионала: выбирать стоит не по маркетинговому названию, а по связке «задача → длина контекста → latency/cost → RAG/tool-use → приватность».

Ограничения и риски

Несмотря на впечатляющие результаты, LLM сохраняют принципиальные ограничения.

  • Галлюцинации — уверенные, но ложные утверждения. Модель оптимизирует правдоподобие следующего токена, а не истинность факта. Частично лечатся RAG, верификацией, tool-use и явным отказом «выдумывать».
  • Предвзятости данных — модель воспроизводит и усиливает статистические искажения обучающего корпуса (пол, раса, язык, домен).
  • Злоупотребления — генерация дезинформации, фишинга, вредоносного кода; jailbreak-атаки на фильтры безопасности.
  • Непрозрачность — внутренние решения плохо интерпретируемы; карты внимания ≠ объяснение для пользователя.
  • Хрупкость к формулировке — качество ответа сильно зависит от промпта; небольшая перефразировка может резко изменить результат.
  • Стоимость и экология — обучение и инференс крупных моделей дороги по compute и энергии; MoE и квантизация снижают, но не снимают проблему.
  • Устаревание знаний — параметрическая память «заморожена» на дату обучения; без поиска и инструментов модель не знает свежих событий.

Качество ответа на практике часто определяется не только «сырой» мощностью модели, но и промпт-инжинирингом: ясная роль, задача, формат вывода, примеры и ограничители нередко важнее перехода на соседнюю по рейтингу модель. Для сложных задач полезны цепочки рассуждений, разбиение на подзадачи и внешняя проверка фактов.

См. также

Примечания

Литература

  • Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I. Attention Is All You Need // Advances in Neural Information Processing Systems. — 2017. — Т. 30.
  • Mikolov T., Chen K., Corrado G., Dean J. Efficient Estimation of Word Representations in Vector Space // arXiv preprint. — 2013.
  • Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding // Proceedings of NAACL-HLT. — 2019.
  • Radford A., Wu J., Child R., Luan D., Amodei D., Sutskever I. Language Models are Unsupervised Multitask Learners // OpenAI Technical Report. — 2019.
  • Brown T. B., Mann B., Ryder N. и др. Language Models are Few-Shot Learners // Advances in Neural Information Processing Systems. — 2020. — Т. 33.
  • Kaplan J., McCandlish S., Henighan T. и др. Scaling Laws for Neural Language Models // arXiv preprint. — 2020.
  • Lewis P., Perez E., Piktus A. и др. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks // Advances in Neural Information Processing Systems. — 2020. — Т. 33.
  • Raffel C., Shazeer N., Roberts A. и др. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer // Journal of Machine Learning Research. — 2020. — Т. 21.
  • Hu E. J., Shen Y., Wallis P. и др. LoRA: Low-Rank Adaptation of Large Language Models // ICLR. — 2022.
  • Ouyang L., Wu J., Jiang X. и др. Training language models to follow instructions with human feedback // Advances in Neural Information Processing Systems. — 2022. — Т. 35.
  • Hoffmann J., Borgeaud S., Mensch A. и др. Training Compute-Optimal Large Language Models // arXiv preprint. — 2022.
  • Wei J., Wang X., Schuurmans D. и др. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models // Advances in Neural Information Processing Systems. — 2022.
  • Shazeer N., Mirhoseini A., Maziarz K. и др. Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer // ICLR. — 2017.
  • DeepSeek-AI DeepSeek-V3 Technical Report // arXiv preprint. — 2024.
Личные инструменты