Обсуждение участника:Mariia Shubina

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Полностью удалено содержимое страницы)
 
Строка 1: Строка 1:
-
{{well|Статья написана с использованием LLM ChatGPT (GPT-5.6 Sol) и проверена участником [[Участник:Mariia Shubina|Mariia Shubina]] 23:00, 17 июля 2026 (MSD)}}
 
-
{{TOCright}}
 
-
 
-
== Неравенство Рао — Крамера ==
 
-
 
-
'''Неравенство Рао — Крамера''' (англ. ''Cramér–Rao inequality''), также известное как '''информационное неравенство''' или '''неравенство Крамера — Рао''', — фундаментальное утверждение в [[Математическая статистика|математической статистике]] и [[Теория оценивания|теории оценивания]], устанавливающее нижнюю границу для [[Дисперсия|дисперсии]] [[Несмещённая оценка|несмещённых оценок]] неизвестных параметров вероятностных моделей. Эта граница выражается через [[Фишеровская информация|информацию Фишера]] и определяет теоретический предел точности, достижимый при оценивании параметра по конечной выборке.
 
-
 
-
Неравенство играет центральную роль в обосновании [[Метод максимального правдоподобия|метода максимального правдоподобия]], служит инструментом для сравнения оценок и позволяет характеризовать асимптотическую эффективность процедур оценивания. Впервые аналогичные неравенства были получены независимо М. Фреше (1943), [[Крамер, Харальд|Х. Крамером]] (1946) и [[Рао, Кальямпуди Радхакришна|К. Р. Рао]] (1945), причём работа Рао содержала наиболее общую формулировку в терминах информации Фишера<ref name="rao1945">Rao, C. R. (1945). Information and the accuracy attainable in the estimation of statistical parameters. ''Bulletin of the Calcutta Mathematical Society'', 37, 81–89.</ref><ref name="cramer1946">Cramér, H. (1946). ''Mathematical Methods of Statistics''. Princeton University Press.</ref>.
 
-
 
-
=== Основные понятия ===
 
-
 
-
Пусть <tex>X_1, \ldots, X_n</tex> — независимая выборка из распределения, принадлежащего параметрическому семейству <tex>\{P_\theta, \theta \in \Theta \subseteq \mathbb{R}\}</tex>. Предполагается, что плотность (или функция вероятности) каждого наблюдения имеет вид <tex>f(x; \theta)</tex> и удовлетворяет условиям регулярности, обеспечивающим возможность дифференцирования по параметру под знаком интеграла.
 
-
 
-
* '''[[Статистическая оценка]]''' — функция <tex>\hat{\theta} = g(X_1, \ldots, X_n)</tex> от выборочных данных, используемая для приближения истинного значения параметра <tex>\theta</tex>.
 
-
* '''[[Несмещённая оценка]]''' — оценка, для которой <tex>\mathbb{E}_\theta[\hat{\theta}] = \theta</tex> для всех <tex>\theta \in \Theta</tex>. Иными словами, в среднем оценка не отклоняется от оцениваемого параметра.
 
-
* '''[[Дисперсия]] оценки''' — <tex>\mathbb{D}_\theta[\hat{\theta}] = \mathbb{E}_\theta[(\hat{\theta} - \theta)^2]</tex>, характеризующая разброс оценки вокруг истинного значения.
 
-
* '''[[Функция правдоподобия]]''' для выборки объёма <tex>n</tex> определяется как
 
-
<tex> L(\theta; X_1, \ldots, X_n) = \prod_{i=1}^n f(X_i; \theta)</tex>.
 
-
Логарифмическая функция правдоподобия: <tex>\ell(\theta) = \ln L(\theta)</tex>.
 
-
* '''[[Фишеровская информация]]''' — мера количества информации, которую выборка несёт о неизвестном параметре. Для одного наблюдения:
 
-
<tex> I(\theta) = \mathbb{E}_\theta \left[ \left( \frac{\partial}{\partial \theta} \ln f(X; \theta) \right)^2 \right] = - \mathbb{E}_\theta \left[ \frac{\partial^2}{\partial \theta^2} \ln f(X; \theta) \right],</tex>
 
-
при условии, что вторая производная существует и операция дифференцирования и интегрирования перестановочны. Для выборки объёма <tex>n</tex> в силу независимости наблюдений <tex>I_n(\theta) = n I(\theta)</tex>.
 
-
 
-
=== Формулировка неравенства ===
 
-
 
-
'''Классическая форма'''. Пусть <tex>\hat{\theta}_n</tex> — несмещённая оценка параметра <tex>\theta</tex>, построенная по выборке объёма <tex>n</tex>. Тогда при выполнении условий регулярности
 
-
<tex>
 
-
\mathbb{D}_\theta[\hat{\theta}_n] \ge \frac{1}{I_n(\theta)} = \frac{1}{n I(\theta)}.
 
-
</tex>
 
-
 
-
'''Пояснение членов''':
 
-
 
-
* <tex>\mathbb{D}_\theta[\hat{\theta}_n]</tex> — дисперсия оценки, которую мы стремимся минимизировать.
 
-
* <tex>I_n(\theta)</tex> — количество информации Фишера во всей выборке.
 
-
* Граница <tex>1/I_n(\theta)</tex> называется '''границей Рао — Крамера''' (или информационной границей). Она показывает минимальную возможную дисперсию несмещённой оценки в данной модели.
 
-
 
-
Для многомерного случая, когда <tex>\theta \in \mathbb{R}^d</tex>, неравенство обобщается на матрицы ковариации: разность между ковариационной матрицей несмещённой оценки и обратной матрицей Фишера является неотрицательно определённой матрицей.
 
-
 
-
=== Условия регулярности ===
 
-
 
-
Неравенство справедливо не для всех распределений. Необходимы следующие условия (достаточные, но не строго необходимые):
 
-
 
-
# '''Носитель распределения''' не зависит от параметра <tex>\theta</tex>, то есть множество <tex>\{x: f(x; \theta) > 0\}</tex> одинаково для всех <tex>\theta \in \Theta</tex>.
 
-
# Функция правдоподобия дважды дифференцируема по <tex>\theta</tex>.
 
-
# Операция дифференцирования по <tex>\theta</tex> может быть вынесена за знак интеграла (или суммы), в частности,
 
-
<tex>\frac{\partial}{\partial \theta} \int f(x; \theta) dx = \int \frac{\partial}{\partial \theta} f(x; \theta) dx</tex>,
 
-
и аналогично для второй производной.
 
-
# Информация Фишера <tex>I(\theta)</tex> конечна и положительна для всех <tex>\theta \in \Theta</tex>.
 
-
 
-
Нарушение первого условия (зависимость носителя от параметра) часто приводит к тому, что дисперсия некоторых оценок убывает быстрее, чем <tex>1/n</tex>, и неравенство Рао — Крамера становится неинформативным (например, для равномерного распределения <tex>U(0, \theta)</tex>). В таких случаях используются обобщения — например, неравенство Бхаттачарии или неравенство Чепмена — Роббинса.
 
-
 
-
=== Эффективные оценки ===
 
-
 
-
Оценка <tex>\hat{\theta}_n</tex>, для которой неравенство Рао — Крамера обращается в равенство при всех <tex>\theta</tex>, называется '''эффективной''' оценкой. В этом случае <tex>\mathbb{D}_\theta[\hat{\theta}_n] = 1/I_n(\theta)</tex>. Эффективные оценки являются несмещёнными и достигают минимально возможной дисперсии в классе несмещённых оценок. Важно различать эффективность и состоятельность: эффективная оценка всегда состоятельна (при выполнении регулярных условий), но не всякая состоятельная оценка эффективна.
 
-
 
-
'''Критерий эффективности''' (равенство в неравенстве Рао — Крамера) эквивалентен тому, что [[Скоринг-функция|производная логарифма правдоподобия]] может быть представлена в виде
 
-
<tex>
 
-
\frac{\partial \ell(\theta)}{\partial \theta} = I_n(\theta) (\hat{\theta}_n - \theta).
 
-
</tex>
 
-
Это условие выполняется для [[Экспоненциальное семейство|экспоненциальных семейств]] с естественной параметризацией, где оценка максимального правдоподобия часто оказывается эффективной.
 
-
 
-
=== Связь с методом максимального правдоподобия и асимптотической нормальностью ===
 
-
 
-
Неравенство Рао — Крамера тесно связано с асимптотической теорией оценивания. При выполнении регулярных условий [[Оценка максимального правдоподобия|оценка максимального правдоподобия (ОМП)]] <tex>\hat{\theta}_{MLE}</tex> является:
 
-
* состоятельной;
 
-
* асимптотически нормальной:
 
-
<tex>\sqrt{n}(\hat{\theta}_{MLE} - \theta) \xrightarrow{d} \mathcal{N}\left(0, \frac{1}{I(\theta)}\right)</tex>;
 
-
* асимптотически эффективной, то есть её асимптотическая дисперсия достигает границы Рао — Крамера <tex>1/(n I(\theta))</tex>.
 
-
 
-
Это означает, что среди всех ''регулярных'' оценок ОМП является наилучшей в асимптотическом смысле. Более того, [[Фишеровская информация]] определяет кривизну логарифма правдоподобия и, следовательно, точность оценивания: чем больше информации, тем уже асимптотическое распределение ОМП.
 
-
 
-
=== Классические примеры ===
 
-
 
-
==== Нормальное распределение ====
 
-
 
-
Пусть <tex>X \sim \mathcal{N}(\mu, \sigma^2)</tex>, параметр <tex>\theta = \mu</tex>, <tex>\sigma^2</tex> известно. Плотность:
 
-
<tex>f(x; \mu) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)</tex>.
 
-
Логарифм правдоподобия для одного наблюдения: <tex>\ell(\mu) = -\frac{1}{2}\ln(2\pi\sigma^2) - \frac{(x-\mu)^2}{2\sigma^2}</tex>.
 
-
Вторая производная: <tex>\partial^2 \ell / \partial \mu^2 = -1/\sigma^2</tex>.
 
-
Информация Фишера: <tex>I(\mu) = 1/\sigma^2</tex>.
 
-
Для выборки объёма <tex>n</tex>: <tex>I_n(\mu) = n/\sigma^2</tex>.
 
-
Граница Рао — Крамера: <tex>\sigma^2/n</tex>.
 
-
Оценка <tex>\hat{\mu} = \bar{X}</tex> имеет дисперсию <tex>\sigma^2/n</tex> — равенство достигается, оценка эффективна.
 
-
 
-
Если <tex>\theta = \sigma^2</tex>, <tex>\mu</tex> известно, то <tex>I(\sigma^2) = 1/(2\sigma^4)</tex>, граница <tex>2\sigma^4/n</tex>. Несмещённая оценка <tex>\hat{\sigma}^2 = \frac{1}{n}\sum (X_i - \mu)^2</tex> имеет дисперсию <tex>2\sigma^4/n</tex> — эффективна.
 
-
 
-
==== Распределение Бернулли ====
 
-
 
-
Пусть <tex>X \sim \text{Bernoulli}(p)</tex>, <tex>p \in (0,1)</tex>. Функция вероятности: <tex>f(x; p) = p^x (1-p)^{1-x}</tex>, <tex>x \in \{0,1\}</tex>.
 
-
Логарифм: <tex>\ell(p) = x \ln p + (1-x) \ln(1-p)</tex>.
 
-
Вторая производная: <tex>\partial^2 \ell / \partial p^2 = -x/p^2 - (1-x)/(1-p)^2</tex>.
 
-
Информация Фишера: <tex>I(p) = 1/[p(1-p)]</tex>.
 
-
Для выборки: <tex>I_n(p) = n/[p(1-p)]</tex>.
 
-
Граница: <tex>p(1-p)/n</tex>.
 
-
Оценка <tex>\hat{p} = \bar{X}</tex> имеет дисперсию <tex>p(1-p)/n</tex> — эффективна.
 
-
 
-
==== Распределение Пуассона ====
 
-
 
-
Пусть <tex>X \sim \text{Poisson}(\lambda)</tex>, <tex>\lambda > 0</tex>. Функция вероятности: <tex>f(x; \lambda) = e^{-\lambda} \lambda^x / x!</tex>.
 
-
Логарифм: <tex>\ell(\lambda) = -\lambda + x \ln \lambda - \ln x!</tex>.
 
-
Вторая производная: <tex>\partial^2 \ell / \partial \lambda^2 = -x/\lambda^2</tex>.
 
-
Информация: <tex>I(\lambda) = \mathbb{E}[X]/\lambda^2 = 1/\lambda</tex>.
 
-
Граница: <tex>\lambda/n</tex>.
 
-
Оценка <tex>\hat{\lambda} = \bar{X}</tex> имеет дисперсию <tex>\lambda/n</tex> — эффективна.
 
-
 
-
==== Экспоненциальное распределение ====
 
-
 
-
Пусть <tex>X \sim \text{Exp}(\theta)</tex> с плотностью <tex>f(x; \theta) = \theta e^{-\theta x}</tex>, <tex>x > 0</tex>, <tex>\theta > 0</tex> (параметр интенсивности).
 
-
Логарифм: <tex>\ell(\theta) = \ln \theta - \theta x</tex>.
 
-
Вторая производная: <tex>\partial^2 \ell / \partial \theta^2 = -1/\theta^2</tex>.
 
-
Информация: <tex>I(\theta) = 1/\theta^2</tex>.
 
-
Граница: <tex>\theta^2/n</tex>.
 
-
Оценка <tex>\hat{\theta} = 1/\bar{X}</tex> является ОМП, но она смещённая. Несмещённая оценка для <tex>\theta</tex> существует (например, <tex>(n-1)/(n \bar{X})</tex>) и её дисперсия равна <tex>\theta^2/(n-2)</tex> для <tex>n>2</tex>, что больше границы <tex>\theta^2/n</tex>. Таким образом, эффективной несмещённой оценки не существует.
 
-
 
-
=== Применение в машинном обучении и анализе данных ===
 
-
 
-
Неравенство Рао — Крамера находит прямое применение в следующих областях:
 
-
 
-
* '''Оценивание параметров вероятностных моделей'''. При построении генеративных моделей (например, наивный байесовский классификатор, скрытые марковские модели) знание границы Рао — Крамера позволяет оценить, насколько велика может быть ошибка оценивания параметров при заданном объёме выборки, и, следовательно, планировать необходимый размер обучающей выборки.
 
-
 
-
* '''Анализ метода максимального правдоподобия'''. В [[Логистическая регрессия|логистической регрессии]] и других обобщённых линейных моделях (GLM) асимптотическая ковариационная матрица оценок коэффициентов аппроксимируется обратной матрицей информации Фишера. На практике стандартные ошибки коэффициентов вычисляются именно на основе этой аппроксимации, что оправдано неравенством Рао — Крамера и свойством асимптотической эффективности ОМП.
 
-
 
-
* '''Байесовская статистика'''. В асимптотическом режиме (большие выборки) апостериорное распределение приближается нормальным со средним, равным ОМП, и дисперсией, равной обратной информации Фишера (теорема Бернштейна — фон Мизеса). Это прямое следствие эффективности ОМП и информационной границы.
 
-
 
-
* '''Проектирование экспериментов'''. В активном обучении и оптимальном планировании эксперимента критерии D-оптимальности и A-оптимальности основаны на максимизации информации Фишера, что эквивалентно минимизации объёма эллипсоида ошибок, ограниченного снизу границей Рао — Крамера.
 
-
 
-
=== Ограничения и типичные ошибки ===
 
-
 
-
'''Ограничения:'''
 
-
 
-
# '''Несмещённость'''. Неравенство применимо только к несмещённым оценкам. Для смещённых оценок существует обобщённое неравенство Рао — Крамера, учитывающее градиент смещения:
 
-
<tex>
 
-
\mathbb{D}_\theta[\hat{\theta}_n] \ge \frac{(1 + b'(\theta))^2}{I_n(\theta)},
 
-
</tex>
 
-
где <tex>b(\theta) = \mathbb{E}[\hat{\theta}_n] - \theta</tex>.
 
-
Однако многие полезные оценки (например, регуляризованные, байесовские) смещены, и прямое применение классической формы некорректно.
 
-
 
-
# '''Регулярность'''. В случае распределений с параметром, влияющим на носитель, неравенство может давать слишком слабую границу или вообще не выполняться. Пример — равномерное распределение <tex>U(0, \theta)</tex>, где дисперсия оценки <tex>\frac{n+1}{n} X_{(n)}</tex> пропорциональна <tex>1/n^2</tex>, что меньше <tex>1/n</tex>.
 
-
 
-
# '''Конечность информации'''. Если информация Фишера обращается в бесконечность или равна нулю, граница становится тривиальной.
 
-
 
-
# '''Многомерные обобщения'''. В многомерном случае неравенство имеет матричный вид, и его интерпретация требует осторожности: граница определяется обратной матрицей Фишера, но не любая несмещённая оценка имеет ковариационную матрицу, сравнимую с этой границей в смысле неотрицательной определённости.
 
-
 
-
'''Типичные ошибки:'''
 
-
 
-
* '''Путаница дисперсии и среднеквадратичной ошибки (MSE)'''. Для смещённых оценок MSE = дисперсия + квадрат смещения; неравенство Рао — Крамера не даёт нижней границы для MSE напрямую. Использование классической границы для оценки MSE смещённой оценки — грубая ошибка.
 
-
 
-
* '''Игнорирование условий регулярности'''. Применение неравенства к моделям с зависящим от параметра носителем (например, <tex>U(0, \theta)</tex>) без проверки условий приводит к неверным выводам.
 
-
 
-
* '''Смешение эффективности и состоятельности'''. Эффективная оценка всегда состоятельна, но обратное неверно. Утверждение «оценка состоятельна, значит, она эффективна» ошибочно.
 
-
 
-
* '''Неправильная интерпретация информации Фишера'''. Иногда полагают, что <tex>I_n(\theta)</tex> — это дисперсия ОМП, хотя на самом деле это теоретическая граница, которая достигается только для эффективных оценок.
 
-
 
-
=== Резюме ===
 
-
 
-
Неравенство Рао — Крамера является краеугольным камнем параметрической теории оценивания. Оно даёт абсолютный нижний предел для дисперсии несмещённых оценок, выражаемый через [[Фишеровская информация|информацию Фишера]], и служит эталоном для сравнения процедур оценивания. Особую ценность неравенство приобретает в контексте [[Метод максимального правдоподобия|метода максимального правдоподобия]], поскольку оценки максимального правдоподобия являются асимптотически эффективными, то есть достигают этой границы при больших выборках.
 
-
 
-
Наиболее полезно неравенство в следующих ситуациях:
 
-
 
-
* при анализе точности несмещённых оценок в параметрических моделях;
 
-
* при обосновании асимптотических свойств ОМП и вычислении стандартных ошибок;
 
-
* при планировании экспериментов и определении минимального объёма выборки для достижения требуемой точности;
 
-
* в многомерных задачах — для анализа корреляционных структур оценок.
 
-
 
-
Важно помнить об ограничениях: неравенство не применимо к смещённым оценкам без модификации и требует выполнения условий регулярности, которые нарушаются в ряде практически важных моделей. Тем не менее, в широком классе задач оно остаётся незаменимым инструментом теоретического и прикладного анализа данных.
 
-
 
-
== Литература ==
 
-
 
-
<references/>
 
-
 
-
* {{книга
 
-
| автор = Крамер Х.
 
-
| заглавие = Математические методы статистики
 
-
| издательство = Мир
 
-
| год = 1975
 
-
| издание = 2-е
 
-
| страниц = 648
 
-
| isbn =
 
-
}}
 
-
* {{книга
 
-
| автор = Rao, C. R.
 
-
| заглавие = Linear Statistical Inference and Its Applications
 
-
| издательство = John Wiley & Sons
 
-
| год = 1973
 
-
| издание = 2nd
 
-
| страниц = 656
 
-
| isbn = 0-471-70823-2
 
-
}}
 
-
* {{книга
 
-
| автор = Lehmann, E. L., Casella, G.
 
-
| заглавие = Theory of Point Estimation
 
-
| издательство = Springer
 
-
| год = 1998
 
-
| издание = 2nd
 
-
| страниц = 588
 
-
| isbn = 0-387-98502-6
 
-
}}
 
-
* {{статья
 
-
| автор = Fisher, R. A.
 
-
| заглавие = On the mathematical foundations of theoretical statistics
 
-
| издание = Philosophical Transactions of the Royal Society A
 
-
| год = 1922
 
-
| том = 222
 
-
| страницы = 309–368
 
-
| doi = 10.1098/rsta.1922.0009
 
-
}}
 
-
* {{статья
 
-
| автор = Cramér, H.
 
-
| заглавие = A contribution to the theory of statistical estimation
 
-
| издание = Skandinavisk Aktuarietidskrift
 
-
| год = 1946
 
-
| том = 29
 
-
| страницы = 85–94
 
-
}}
 
-
* {{статья
 
-
| автор = Rao, C. R.
 
-
| заглавие = Information and the accuracy attainable in the estimation of statistical parameters
 
-
| издание = Bulletin of the Calcutta Mathematical Society
 
-
| год = 1945
 
-
| том = 37
 
-
| страницы = 81–89
 
-
}}
 
-
 
-
[[Категория:Математическая статистика]]
 
-
[[Категория:Теория оценивания]]
 
-
[[Категория:Машинное обучение]]
 
-
[[Категория:Энциклопедия анализа данных]]
 

Текущая версия

Личные инструменты