Распознавание образов
Материал из MachineLearning.
| | Статья написана с использованием LLM ChatGPT, GPT-5.6 Thinking и проверена участником Vadim Iamaletdinov 21:00, 19 июля 2026 (MSD) |
Распознавание образов (англ. pattern recognition) — область машинного обучения, математической статистики и искусственного интеллекта, изучающая методы автоматического отнесения наблюдаемых объектов к классам, описания их структуры или принятия решений по данным. Объектом распознавания может быть не только изображение: это может быть звук, текст, медицинская запись, временной ряд, сигнал датчика, поведение пользователя или любой другой набор наблюдаемых признаков.
Простейший пример — распознавание рукописной цифры. На вход алгоритму подаётся изображение, а на выходе требуется получить один из десяти ответов: от 0 до 9. Однако реальная задача включает не только выбор алгоритма. Необходимо определить классы, собрать и разметить данные, выбрать представление объектов, задать критерий ошибки, провести обучение и проверить, сохраняется ли качество на новых данных.
В широком смысле распознавание образов объединяет постановку задачи, представление данных, построение решающего правила и оценивание его обобщающей способности. Поэтому оно тесно связано с классификацией, кластеризацией, компьютерным зрением, обработкой речи, анализом текстов и статистической теорией обучения.[1]
Что называют образом
Слово образ в данном термине не означает только зрительную картинку. Образом называют наблюдаемое описание объекта, по которому требуется сделать вывод. Одному физическому объекту могут соответствовать разные представления:
- фотография детали;
- набор измерений температуры и давления;
- спектр сигнала;
- последовательность слов;
- вектор характеристик пациента;
- фрагмент сетевого трафика.
Пусть множество допустимых объектов обозначено , а множество классов —
. Требуется построить алгоритм
который каждому объекту ставит в соответствие номер класса
.
Во многих задачах исходный объект сначала преобразуется в вектор признаков
Признаками могут быть измеренные величины, частоты слов, характеристики формы, значения пикселей или представления, автоматически построенные нейронной сетью. Качество признакового описания нередко влияет на результат не меньше, чем выбор классификатора.
Основные постановки задач
Классификация
В задаче классификации каждому объекту назначается один класс из конечного множества. Различают:
- бинарную классификацию, например разделение писем на обычные и нежелательные;
- многоклассовую классификацию, например распознавание цифр;
- многометочную классификацию, когда объект может одновременно иметь несколько меток;
- классификацию с отказом, когда алгоритм вправе не принимать решение при недостаточной уверенности;
- распознавание открытого множества, когда во время работы могут появляться объекты неизвестных классов.
Обнаружение и локализация
В задачах обнаружения требуется не только определить тип объекта, но и найти его положение в сигнале или изображении. Например, система может обнаруживать несколько автомобилей на фотографии и возвращать ограничивающие прямоугольники.
Сегментация и структурированное распознавание
При сегментации метка назначается каждой части объекта: пикселю изображения, отсчёту сигнала или элементу последовательности. В структурированном распознавании ответы взаимосвязаны. Так, при распознавании текста последовательность букв должна согласовываться с моделью языка.
Кластеризация
Если правильные классы заранее неизвестны, объекты можно разделять на группы по сходству. Кластеризация не является распознаванием заранее заданных классов в строгом смысле, но часто используется для разведочного анализа данных, подготовки разметки и обнаружения новых типов объектов.
Обучение по прецедентам
При обучении с учителем дана выборка размеченных объектов
где — объект, а
— правильный ответ. Метод обучения строит по выборке алгоритм
.
Для измерения ошибки задаётся функция потерь . В простейшей классификации используется индикатор ошибки:
Средняя ошибка на обучающей выборке называется эмпирическим риском:
Малая ошибка на известных примерах сама по себе недостаточна. Алгоритм должен правильно работать на новых объектах из той же прикладной задачи. Это свойство называют обобщающей способностью. Слишком сложная модель может запомнить обучающую выборку и потерять качество на новых данных; такое явление называется переобучением.
Этапы построения системы распознавания
Типичная система распознавания строится не как один изолированный алгоритм, а как последовательность связанных этапов.
Постановка задачи
Необходимо определить:
- что является объектом;
- какие ответы должна выдавать система;
- какие ошибки наиболее опасны;
- допустим ли отказ от решения;
- каковы требования к скорости, памяти и интерпретируемости.
Например, в медицинской диагностике пропуск заболевания и ложная тревога имеют разную цену. Поэтому простая доля правильных ответов может быть недостаточным критерием.
Сбор и разметка данных
Выборка должна отражать условия будущего применения. Если обучающие фотографии сделаны только при хорошем освещении, система может оказаться ненадёжной ночью. Разметка также содержит ошибки и неоднозначности: эксперты могут расходиться во мнениях, а некоторые объекты объективно принадлежат пограничным случаям.
Предобработка
Предобработка уменьшает влияние несущественных изменений. В зависимости от типа данных применяются нормализация масштаба, фильтрация шума, выравнивание, приведение текста к единому виду, удаление пропусков и стандартизация числовых признаков.
Предобработка не должна использовать информацию из проверочной части выборки. Иначе возникает утечка данных, приводящая к завышенной оценке качества.
Построение признаков
В классическом распознавании признаки проектируются исследователем. Для изображений это могут быть контуры, углы, текстуры и гистограммы направлений; для речи — спектральные характеристики; для текста — частоты слов.
В глубоком обучении представление часто строится самой моделью. Последовательные слои преобразуют исходные данные в признаки, удобные для решения задачи. Такое обучение представлений уменьшает объём ручного конструирования признаков, но обычно требует больших выборок и вычислительных ресурсов.
Обучение решающего правила
По признаковому описанию строится модель, связывающая объект с классом или вероятностями классов. После обучения выбирается правило принятия решения, а при необходимости — порог уверенности или отказа.
Проверка качества
Качество оценивают на данных, не использованных при обучении и настройке модели. При небольших выборках применяют скользящий контроль. Для объективного сравнения алгоритмов желательно использовать несколько задач и повторять эксперименты на разных разбиениях данных.
Эта идея лежит в основе проектов систематического сравнения методов, таких как Полигон алгоритмов, где результаты удобно представлять таблицей «задачи × алгоритмы». Общедоступные коллекции, например Репозиторий UCI, помогают другим исследователям воспроизводить эксперименты.
Вероятностное распознавание
В вероятностном подходе модель оценивает апостериорные вероятности классов
Если все ошибки имеют одинаковую цену, выбирается наиболее вероятный класс:
При разных ценах ошибок используется матрица потерь , где
— цена решения
, если истинный класс равен
. Оптимальное по Байесу решение минимизирует условный риск:
Вероятностный ответ полезен, когда требуется оценивать уверенность, задавать порог отказа или учитывать различную стоимость ошибок. Однако числовой выход модели не всегда является хорошо откалиброванной вероятностью. Калибровку следует проверять отдельно.
Основные семейства методов
Байесовские и дискриминантные методы
Байесовский классификатор использует вероятностные модели классов и правило минимального риска. В простых случаях распределения задаются явно, например многомерными нормальными распределениями.
Линейный дискриминант Фишера ищет направление, в котором классы хорошо разделены относительно внутриклассового разброса. Работа Р. Фишера 1936 года стала одним из ранних примеров формального статистического распознавания по нескольким измерениям.[1]
Метрические методы
Метод ближайших соседей относит новый объект к классу близких обучающих примеров. Метод почти не требует этапа построения модели, но качество сильно зависит от метрики, масштаба признаков и плотности выборки.
Т. Ковер и П. Харт исследовали статистические свойства правила ближайшего соседа и показали его связь с оптимальной байесовской ошибкой.[1]
Линейные классификаторы
Линейный классификатор разделяет пространство признаков гиперплоскостью. Для бинарной задачи решение может иметь вид
К линейным методам относятся Персептрон, логистическая регрессия и линейный метод опорных векторов. Они сравнительно просты, хорошо масштабируются и часто служат сильной базовой моделью.
Ф. Розенблатт описал персептрон как обучаемую модель распознавания в 1958 году.[1]
Метод опорных векторов строит разделяющую поверхность с максимальным зазором и позволяет получать нелинейные границы с помощью ядер.[1]
Деревья решений и композиции
Решающие деревья последовательно проверяют условия над признаками. Они удобны для интерпретации, но отдельное глубокое дерево легко переобучается.
Композиции деревьев — случайный лес и градиентный бустинг — объединяют множество моделей. Они особенно эффективны на табличных данных, допускают нелинейные зависимости и взаимодействия признаков.
Нейронные сети
Нейронные сети обучают последовательность преобразований от исходного объекта к ответу. Для изображений широко применяются свёрточные сети, использующие локальность и повторяемость визуальных признаков. Для последовательностей, изображений и мультимодальных данных также применяются модели внимания и трансформеры.
Система распознавания документов LeNet показала практическую эффективность свёрточных сетей и совместного градиентного обучения компонентов распознавания.[1]
Глубокие модели могут автоматически строить многоуровневые признаки, однако их высокая точность не отменяет требований к качеству данных, корректному эксперименту и анализу ошибок.
Пример: распознавание рукописных цифр
Пусть объектом является изображение рукописной цифры, а множеством ответов — классы от 0 до 9.
Простейший вариант системы состоит из следующих шагов:
- привести изображение к фиксированному размеру;
- нормировать яркость;
- представить изображение вектором пикселей или извлечённых признаков;
- обучить классификатор по размеченным изображениям;
- получить оценки десяти классов;
- выбрать класс с наибольшей оценкой;
- проверить качество на независимых изображениях.
Ошибки часто возникают не случайно. Например, цифры 3 и 5 могут быть похожи по форме, а необычный наклон или толщина линии могут отсутствовать в обучающей выборке. Анализ таких ошибок подсказывает, нужно ли собирать новые данные, менять предобработку, улучшать признаки или выбирать другую модель.
Этот пример показывает важный принцип: система распознавания включает данные, процедуру измерения качества и правила применения, а не только обученный классификатор.
Оценивание качества
Матрица ошибок
Для многоклассовой классификации строится матрица ошибок . Элемент
показывает, сколько объектов истинного класса
было отнесено алгоритмом к классу
.
Матрица ошибок помогает увидеть, какие классы смешиваются между собой. Одна итоговая цифра такого различия не показывает.
Доля правильных ответов
В бинарной классификации доля правильных ответов определяется как
Здесь и
— соответственно верные положительные и верные отрицательные решения, а
и
— ложные срабатывания и пропущенные положительные объекты.
Эта мера подходит при сопоставимых размерах классов и одинаковой цене ошибок. При сильном дисбалансе классов она может вводить в заблуждение. Если 99 % операций законны, алгоритм, всегда отвечающий «законная операция», получит 99 % правильных ответов, но не обнаружит ни одного мошенничества.
Точность, полнота и F-мера
Для выбранного положительного класса используются величины:
Точность показывает, какая доля положительных решений алгоритма верна. Полнота показывает, какая доля действительно положительных объектов найдена. F-мера объединяет обе характеристики в одну величину.
Пороговые и вероятностные меры
Если модель выдаёт числовую уверенность, качество исследуют при разных порогах решения. Применяются ROC-кривая, площадь под ROC-кривой, precision-recall-кривая и показатели калибровки.
Выбор меры должен следовать из прикладной цели. Для системы безопасности важна цена пропуска угрозы; для автоматической модерации — также цена ошибочной блокировки.
Корректный вычислительный эксперимент
Надёжное сравнение методов требует разделять три типа данных:
- обучающие данные — для оценки параметров модели;
- проверочные данные — для выбора модели и гиперпараметров;
- тестовые данные — для окончательной оценки.
Тестовую выборку нельзя многократно использовать при разработке: иначе решения постепенно подстраиваются под неё, и оценка перестаёт быть независимой.
При сравнении алгоритмов важно:
- использовать одинаковые разбиения данных;
- настраивать каждый метод по заранее заданной процедуре;
- предотвращать утечку данных;
- сообщать не только среднее качество, но и разброс;
- оценивать время обучения, время распознавания и память;
- публиковать данные, код и параметры, когда это возможно;
- исследовать несколько задач, а не одну удачно выбранную выборку.
Именно поэтому полигоны алгоритмов и общедоступные репозитории важны не только как программные проекты. Они задают культуру воспроизводимого сравнения: вывод об алгоритме должен основываться на серии контролируемых экспериментов.
Распознавание образов и смежные области
| Область | Основной вопрос | Пример |
|---|---|---|
| Распознавание образов | Как по наблюдениям принять решение о классе или структуре объекта? | Распознать цифру, заболевание или тип сигнала |
| Машинное обучение | Как построить модель по данным и обеспечить её работу на новых примерах? | Обучить классификатор, регрессию или генеративную модель |
| Компьютерное зрение | Как извлекать информацию из изображений и видео? | Найти объекты и описать сцену |
| Обработка изображений | Как преобразовать или улучшить изображение? | Удалить шум, повысить резкость |
| Кластеризация | Как найти группы без заранее заданных меток? | Выделить типы поведения пользователей |
Границы между областями исторически менялись. Многие задачи, которые раньше относили к распознаванию образов, сегодня рассматриваются как стандартные задачи машинного обучения. Термин «распознавание образов» подчёркивает полный путь от наблюдаемого объекта до решения и особенно распространён в задачах анализа сигналов и изображений.[1]
Ограничения и открытые проблемы
Сдвиг распределения
Обучающая и рабочая выборки могут различаться из-за нового оборудования, сезона, страны, поведения пользователей или изменения среды. Высокая тестовая точность не гарантирует устойчивость после такого сдвига.
Неизвестные классы
Классический классификатор выбирает один из известных классов даже для совершенно нового объекта. В критических приложениях необходимо обнаруживать неизвестные случаи, оценивать неопределённость и уметь отказываться от решения.
Шум и неоднозначность разметки
Разметка может быть субъективной. В медицине, биологии и анализе естественного языка разные эксперты нередко дают разные ответы. В таких случаях полезно хранить несколько мнений и учитывать степень согласия.
Смещения данных
Если некоторые группы объектов представлены хуже, модель может иметь неодинаковое качество для разных подгрупп. Систему следует проверять не только по среднему показателю, но и по условиям применения, источникам данных и значимым подгруппам.
Интерпретируемость
В областях с высокой ценой ошибки одного правильного ответа может быть недостаточно. Пользователю может потребоваться объяснение, какие признаки повлияли на решение и насколько оно устойчиво к изменению входа.
Уязвимость к возмущениям
Небольшие изменения объекта способны изменить решение модели. Иногда это естественная чувствительность вблизи границы классов, а иногда — специально подобранная атака. Робастность должна проверяться на реалистичных и неблагоприятных условиях.
Вычислительные ограничения
Большие модели требуют памяти, энергии и специализированных ускорителей. В системах реального времени важны задержка и предсказуемость, поэтому наиболее точная модель не всегда является лучшей инженерной системой.
Применения
Распознавание образов применяется в следующих областях:
- распознавание речи, говорящего и акустических событий;
- анализ медицинских изображений и сигналов;
- биометрическая идентификация;
- оптическое распознавание символов и документов;
- поиск объектов на спутниковых снимках;
- техническая диагностика и контроль качества;
- фильтрация нежелательных сообщений;
- анализ тональности и классификация текстов;
- кредитный скоринг и выявление мошенничества;
- обнаружение вредоносного программного обеспечения;
- распознавание действий и событий в видео;
- анализ биологических последовательностей.
Прикладная ценность системы определяется не только точностью классификации, но и тем, как она встроена в рабочий процесс: кто проверяет спорные решения, как обнаруживаются отказы, как обновляется модель и как контролируется изменение качества.
История
Распознавание образов возникло на пересечении статистики, теории связи, кибернетики и исследований восприятия.
В 1930-х годах появились статистические методы разделения классов по нескольким измерениям, включая дискриминантный анализ Фишера.[1] В 1950-х годах развивались теория статистических решений и обучаемые модели, среди которых заметное место занял персептрон Розенблатта.[1]
В 1960–1990-х годах сформировались метрические методы, распознавание по признакам, деревья решений, вероятностные модели, нейронные сети и методы с максимальным зазором.[1][1]
С конца 1990-х годов свёрточные сети успешно применялись к промышленному распознаванию документов.[1] Рост вычислительных ресурсов, объёма размеченных данных и развитие глубокого обучения затем расширили возможности распознавания изображений, речи, текста и мультимодальных объектов.
История области показывает, что развитие происходило не как последовательная замена «старых» методов «новыми». Линейные, вероятностные, метрические и нейросетевые модели решают разные задачи и остаются полезными при соответствующих данных и ограничениях.
См. также
- Машинное обучение
- Классификация
- Обучение по прецедентам
- Признак
- Функция потерь
- Переобучение
- Скользящий контроль
- Матрица ошибок
- Метод ближайших соседей
- Метод опорных векторов
- Персептрон
- Нейронная сеть
- Компьютерное зрение
- Кластеризация
- Полигон алгоритмов
- Репозиторий UCI
Примечания
Литература
- Bishop C. M. Pattern Recognition and Machine Learning. — New York: Springer, 2006. — 778 с. — ISBN 978-0-387-31073-2
- Duda R. O., Hart P. E., Stork D. G. Pattern Classification. — 2-е изд.. — New York: Wiley, 2000. — 656 с. — ISBN 978-0-471-05669-0
- Мерков А. Б. Распознавание образов. Введение в методы статистического обучения. — М.: Едиториал УРСС, 2011. — 256 с.
- Мерков А. Б. Распознавание образов. Построение и обучение вероятностных моделей. — М.: Ленанд, 2014. — 238 с.
- Hastie T., Tibshirani R., Friedman J. The Elements of Statistical Learning: Data Mining, Inference, and Prediction. — 2-е изд.. — New York: Springer, 2009. — 745 с. — ISBN 978-0-387-84857-0

