Обсуждение участника:Mariia Shubina
Материал из MachineLearning.
| Строка 1: | Строка 1: | ||
| - | {{ | + | {{well|Статья написана с использованием LLM ChatGPT (GPT-5.6 Sol) и проверена участником [[Участник:Mariia Shubina|Mariia Shubina]] 23:00, 17 июля 2026 (MSD)}} |
| - | + | ||
| - | + | {{TOCright}} | |
| - | + | == Неравенство Рао — Крамера == | |
| - | + | '''Неравенство Рао — Крамера''' (англ. ''Cramér–Rao inequality''), также известное как '''информационное неравенство''' или '''неравенство Крамера — Рао''', — фундаментальное утверждение в [[Математическая статистика|математической статистике]] и [[Теория оценивания|теории оценивания]], устанавливающее нижнюю границу для [[Дисперсия|дисперсии]] [[Несмещённая оценка|несмещённых оценок]] неизвестных параметров вероятностных моделей. Эта граница выражается через [[Фишеровская информация|информацию Фишера]] и определяет теоретический предел точности, достижимый при оценивании параметра по конечной выборке. | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | Неравенство играет центральную роль в обосновании [[Метод максимального правдоподобия|метода максимального правдоподобия]], служит инструментом для сравнения оценок и позволяет характеризовать асимптотическую эффективность процедур оценивания. Впервые аналогичные неравенства были получены независимо М. Фреше (1943), [[Крамер, Харальд|Х. Крамером]] (1946) и [[Рао, Кальямпуди Радхакришна|К. Р. Рао]] (1945), причём работа Рао содержала наиболее общую формулировку в терминах информации Фишера<ref name="rao1945">Rao, C. R. (1945). Information and the accuracy attainable in the estimation of statistical parameters. ''Bulletin of the Calcutta Mathematical Society'', 37, 81–89.</ref><ref name="cramer1946">Cramér, H. (1946). ''Mathematical Methods of Statistics''. Princeton University Press.</ref>. | |
| - | + | === Основные понятия === | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | Пусть <tex>X_1, \ldots, X_n</tex> — независимая выборка из распределения, принадлежащего параметрическому семейству <tex>\{P_\theta, \theta \in \Theta \subseteq \mathbb{R}\}</tex>. Предполагается, что плотность (или функция вероятности) каждого наблюдения имеет вид <tex>f(x; \theta)</tex> и удовлетворяет условиям регулярности, обеспечивающим возможность дифференцирования по параметру под знаком интеграла. | |
| - | * | + | * '''[[Статистическая оценка]]''' — функция <tex>\hat{\theta} = g(X_1, \ldots, X_n)</tex> от выборочных данных, используемая для приближения истинного значения параметра <tex>\theta</tex>. |
| - | * | + | * '''[[Несмещённая оценка]]''' — оценка, для которой <tex>\mathbb{E}_\theta[\hat{\theta}] = \theta</tex> для всех <tex>\theta \in \Theta</tex>. Иными словами, в среднем оценка не отклоняется от оцениваемого параметра. |
| - | + | * '''[[Дисперсия]] оценки''' — <tex>\mathbb{D}_\theta[\hat{\theta}] = \mathbb{E}_\theta[(\hat{\theta} - \theta)^2]</tex>, характеризующая разброс оценки вокруг истинного значения. | |
| + | * '''[[Функция правдоподобия]]''' для выборки объёма <tex>n</tex> определяется как | ||
| + | <tex> L(\theta; X_1, \ldots, X_n) = \prod_{i=1}^n f(X_i; \theta)</tex>. | ||
| + | Логарифмическая функция правдоподобия: <tex>\ell(\theta) = \ln L(\theta)</tex>. | ||
| + | * '''[[Фишеровская информация]]''' — мера количества информации, которую выборка несёт о неизвестном параметре. Для одного наблюдения: | ||
| + | <tex> I(\theta) = \mathbb{E}_\theta \left[ \left( \frac{\partial}{\partial \theta} \ln f(X; \theta) \right)^2 \right] = - \mathbb{E}_\theta \left[ \frac{\partial^2}{\partial \theta^2} \ln f(X; \theta) \right],</tex> | ||
| + | при условии, что вторая производная существует и операция дифференцирования и интегрирования перестановочны. Для выборки объёма <tex>n</tex> в силу независимости наблюдений <tex>I_n(\theta) = n I(\theta)</tex>. | ||
| - | + | === Формулировка неравенства === | |
| - | + | '''Классическая форма'''. Пусть <tex>\hat{\theta}_n</tex> — несмещённая оценка параметра <tex>\theta</tex>, построенная по выборке объёма <tex>n</tex>. Тогда при выполнении условий регулярности | |
| - | + | <tex> | |
| - | + | \mathbb{D}_\theta[\hat{\theta}_n] \ge \frac{1}{I_n(\theta)} = \frac{1}{n I(\theta)}. | |
| - | + | </tex> | |
| - | + | '''Пояснение членов''': | |
| - | + | * <tex>\mathbb{D}_\theta[\hat{\theta}_n]</tex> — дисперсия оценки, которую мы стремимся минимизировать. | |
| + | * <tex>I_n(\theta)</tex> — количество информации Фишера во всей выборке. | ||
| + | * Граница <tex>1/I_n(\theta)</tex> называется '''границей Рао — Крамера''' (или информационной границей). Она показывает минимальную возможную дисперсию несмещённой оценки в данной модели. | ||
| - | { | + | Для многомерного случая, когда <tex>\theta \in \mathbb{R}^d</tex>, неравенство обобщается на матрицы ковариации: разность между ковариационной матрицей несмещённой оценки и обратной матрицей Фишера является неотрицательно определённой матрицей. |
| - | {{ | + | === Условия регулярности === |
| + | |||
| + | Неравенство справедливо не для всех распределений. Необходимы следующие условия (достаточные, но не строго необходимые): | ||
| + | |||
| + | # '''Носитель распределения''' не зависит от параметра <tex>\theta</tex>, то есть множество <tex>\{x: f(x; \theta) > 0\}</tex> одинаково для всех <tex>\theta \in \Theta</tex>. | ||
| + | # Функция правдоподобия дважды дифференцируема по <tex>\theta</tex>. | ||
| + | # Операция дифференцирования по <tex>\theta</tex> может быть вынесена за знак интеграла (или суммы), в частности, | ||
| + | <tex>\frac{\partial}{\partial \theta} \int f(x; \theta) dx = \int \frac{\partial}{\partial \theta} f(x; \theta) dx</tex>, | ||
| + | и аналогично для второй производной. | ||
| + | # Информация Фишера <tex>I(\theta)</tex> конечна и положительна для всех <tex>\theta \in \Theta</tex>. | ||
| + | |||
| + | Нарушение первого условия (зависимость носителя от параметра) часто приводит к тому, что дисперсия некоторых оценок убывает быстрее, чем <tex>1/n</tex>, и неравенство Рао — Крамера становится неинформативным (например, для равномерного распределения <tex>U(0, \theta)</tex>). В таких случаях используются обобщения — например, неравенство Бхаттачарии или неравенство Чепмена — Роббинса. | ||
| + | |||
| + | === Эффективные оценки === | ||
| + | |||
| + | Оценка <tex>\hat{\theta}_n</tex>, для которой неравенство Рао — Крамера обращается в равенство при всех <tex>\theta</tex>, называется '''эффективной''' оценкой. В этом случае <tex>\mathbb{D}_\theta[\hat{\theta}_n] = 1/I_n(\theta)</tex>. Эффективные оценки являются несмещёнными и достигают минимально возможной дисперсии в классе несмещённых оценок. Важно различать эффективность и состоятельность: эффективная оценка всегда состоятельна (при выполнении регулярных условий), но не всякая состоятельная оценка эффективна. | ||
| + | |||
| + | '''Критерий эффективности''' (равенство в неравенстве Рао — Крамера) эквивалентен тому, что [[Скоринг-функция|производная логарифма правдоподобия]] может быть представлена в виде | ||
| + | <tex> | ||
| + | \frac{\partial \ell(\theta)}{\partial \theta} = I_n(\theta) (\hat{\theta}_n - \theta). | ||
| + | </tex> | ||
| + | Это условие выполняется для [[Экспоненциальное семейство|экспоненциальных семейств]] с естественной параметризацией, где оценка максимального правдоподобия часто оказывается эффективной. | ||
| + | |||
| + | === Связь с методом максимального правдоподобия и асимптотической нормальностью === | ||
| + | |||
| + | Неравенство Рао — Крамера тесно связано с асимптотической теорией оценивания. При выполнении регулярных условий [[Оценка максимального правдоподобия|оценка максимального правдоподобия (ОМП)]] <tex>\hat{\theta}_{MLE}</tex> является: | ||
| + | * состоятельной; | ||
| + | * асимптотически нормальной: | ||
| + | <tex>\sqrt{n}(\hat{\theta}_{MLE} - \theta) \xrightarrow{d} \mathcal{N}\left(0, \frac{1}{I(\theta)}\right)</tex>; | ||
| + | * асимптотически эффективной, то есть её асимптотическая дисперсия достигает границы Рао — Крамера <tex>1/(n I(\theta))</tex>. | ||
| + | |||
| + | Это означает, что среди всех ''регулярных'' оценок ОМП является наилучшей в асимптотическом смысле. Более того, [[Фишеровская информация]] определяет кривизну логарифма правдоподобия и, следовательно, точность оценивания: чем больше информации, тем уже асимптотическое распределение ОМП. | ||
| + | |||
| + | === Классические примеры === | ||
| + | |||
| + | ==== Нормальное распределение ==== | ||
| + | |||
| + | Пусть <tex>X \sim \mathcal{N}(\mu, \sigma^2)</tex>, параметр <tex>\theta = \mu</tex>, <tex>\sigma^2</tex> известно. Плотность: | ||
| + | <tex>f(x; \mu) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)</tex>. | ||
| + | Логарифм правдоподобия для одного наблюдения: <tex>\ell(\mu) = -\frac{1}{2}\ln(2\pi\sigma^2) - \frac{(x-\mu)^2}{2\sigma^2}</tex>. | ||
| + | Вторая производная: <tex>\partial^2 \ell / \partial \mu^2 = -1/\sigma^2</tex>. | ||
| + | Информация Фишера: <tex>I(\mu) = 1/\sigma^2</tex>. | ||
| + | Для выборки объёма <tex>n</tex>: <tex>I_n(\mu) = n/\sigma^2</tex>. | ||
| + | Граница Рао — Крамера: <tex>\sigma^2/n</tex>. | ||
| + | Оценка <tex>\hat{\mu} = \bar{X}</tex> имеет дисперсию <tex>\sigma^2/n</tex> — равенство достигается, оценка эффективна. | ||
| + | |||
| + | Если <tex>\theta = \sigma^2</tex>, <tex>\mu</tex> известно, то <tex>I(\sigma^2) = 1/(2\sigma^4)</tex>, граница <tex>2\sigma^4/n</tex>. Несмещённая оценка <tex>\hat{\sigma}^2 = \frac{1}{n}\sum (X_i - \mu)^2</tex> имеет дисперсию <tex>2\sigma^4/n</tex> — эффективна. | ||
| + | |||
| + | ==== Распределение Бернулли ==== | ||
| + | |||
| + | Пусть <tex>X \sim \text{Bernoulli}(p)</tex>, <tex>p \in (0,1)</tex>. Функция вероятности: <tex>f(x; p) = p^x (1-p)^{1-x}</tex>, <tex>x \in \{0,1\}</tex>. | ||
| + | Логарифм: <tex>\ell(p) = x \ln p + (1-x) \ln(1-p)</tex>. | ||
| + | Вторая производная: <tex>\partial^2 \ell / \partial p^2 = -x/p^2 - (1-x)/(1-p)^2</tex>. | ||
| + | Информация Фишера: <tex>I(p) = 1/[p(1-p)]</tex>. | ||
| + | Для выборки: <tex>I_n(p) = n/[p(1-p)]</tex>. | ||
| + | Граница: <tex>p(1-p)/n</tex>. | ||
| + | Оценка <tex>\hat{p} = \bar{X}</tex> имеет дисперсию <tex>p(1-p)/n</tex> — эффективна. | ||
| + | |||
| + | ==== Распределение Пуассона ==== | ||
| + | |||
| + | Пусть <tex>X \sim \text{Poisson}(\lambda)</tex>, <tex>\lambda > 0</tex>. Функция вероятности: <tex>f(x; \lambda) = e^{-\lambda} \lambda^x / x!</tex>. | ||
| + | Логарифм: <tex>\ell(\lambda) = -\lambda + x \ln \lambda - \ln x!</tex>. | ||
| + | Вторая производная: <tex>\partial^2 \ell / \partial \lambda^2 = -x/\lambda^2</tex>. | ||
| + | Информация: <tex>I(\lambda) = \mathbb{E}[X]/\lambda^2 = 1/\lambda</tex>. | ||
| + | Граница: <tex>\lambda/n</tex>. | ||
| + | Оценка <tex>\hat{\lambda} = \bar{X}</tex> имеет дисперсию <tex>\lambda/n</tex> — эффективна. | ||
| + | |||
| + | ==== Экспоненциальное распределение ==== | ||
| + | |||
| + | Пусть <tex>X \sim \text{Exp}(\theta)</tex> с плотностью <tex>f(x; \theta) = \theta e^{-\theta x}</tex>, <tex>x > 0</tex>, <tex>\theta > 0</tex> (параметр интенсивности). | ||
| + | Логарифм: <tex>\ell(\theta) = \ln \theta - \theta x</tex>. | ||
| + | Вторая производная: <tex>\partial^2 \ell / \partial \theta^2 = -1/\theta^2</tex>. | ||
| + | Информация: <tex>I(\theta) = 1/\theta^2</tex>. | ||
| + | Граница: <tex>\theta^2/n</tex>. | ||
| + | Оценка <tex>\hat{\theta} = 1/\bar{X}</tex> является ОМП, но она смещённая. Несмещённая оценка для <tex>\theta</tex> существует (например, <tex>(n-1)/(n \bar{X})</tex>) и её дисперсия равна <tex>\theta^2/(n-2)</tex> для <tex>n>2</tex>, что больше границы <tex>\theta^2/n</tex>. Таким образом, эффективной несмещённой оценки не существует. | ||
| + | |||
| + | === Применение в машинном обучении и анализе данных === | ||
| + | |||
| + | Неравенство Рао — Крамера находит прямое применение в следующих областях: | ||
| + | |||
| + | * '''Оценивание параметров вероятностных моделей'''. При построении генеративных моделей (например, наивный байесовский классификатор, скрытые марковские модели) знание границы Рао — Крамера позволяет оценить, насколько велика может быть ошибка оценивания параметров при заданном объёме выборки, и, следовательно, планировать необходимый размер обучающей выборки. | ||
| + | |||
| + | * '''Анализ метода максимального правдоподобия'''. В [[Логистическая регрессия|логистической регрессии]] и других обобщённых линейных моделях (GLM) асимптотическая ковариационная матрица оценок коэффициентов аппроксимируется обратной матрицей информации Фишера. На практике стандартные ошибки коэффициентов вычисляются именно на основе этой аппроксимации, что оправдано неравенством Рао — Крамера и свойством асимптотической эффективности ОМП. | ||
| + | |||
| + | * '''Байесовская статистика'''. В асимптотическом режиме (большие выборки) апостериорное распределение приближается нормальным со средним, равным ОМП, и дисперсией, равной обратной информации Фишера (теорема Бернштейна — фон Мизеса). Это прямое следствие эффективности ОМП и информационной границы. | ||
| + | |||
| + | * '''Проектирование экспериментов'''. В активном обучении и оптимальном планировании эксперимента критерии D-оптимальности и A-оптимальности основаны на максимизации информации Фишера, что эквивалентно минимизации объёма эллипсоида ошибок, ограниченного снизу границей Рао — Крамера. | ||
| + | |||
| + | === Ограничения и типичные ошибки === | ||
| + | |||
| + | '''Ограничения:''' | ||
| + | |||
| + | # '''Несмещённость'''. Неравенство применимо только к несмещённым оценкам. Для смещённых оценок существует обобщённое неравенство Рао — Крамера, учитывающее градиент смещения: | ||
| + | <tex> | ||
| + | \mathbb{D}_\theta[\hat{\theta}_n] \ge \frac{(1 + b'(\theta))^2}{I_n(\theta)}, | ||
| + | </tex> | ||
| + | где <tex>b(\theta) = \mathbb{E}[\hat{\theta}_n] - \theta</tex>. | ||
| + | Однако многие полезные оценки (например, регуляризованные, байесовские) смещены, и прямое применение классической формы некорректно. | ||
| + | |||
| + | # '''Регулярность'''. В случае распределений с параметром, влияющим на носитель, неравенство может давать слишком слабую границу или вообще не выполняться. Пример — равномерное распределение <tex>U(0, \theta)</tex>, где дисперсия оценки <tex>\frac{n+1}{n} X_{(n)}</tex> пропорциональна <tex>1/n^2</tex>, что меньше <tex>1/n</tex>. | ||
| + | |||
| + | # '''Конечность информации'''. Если информация Фишера обращается в бесконечность или равна нулю, граница становится тривиальной. | ||
| + | |||
| + | # '''Многомерные обобщения'''. В многомерном случае неравенство имеет матричный вид, и его интерпретация требует осторожности: граница определяется обратной матрицей Фишера, но не любая несмещённая оценка имеет ковариационную матрицу, сравнимую с этой границей в смысле неотрицательной определённости. | ||
| + | |||
| + | '''Типичные ошибки:''' | ||
| + | |||
| + | * '''Путаница дисперсии и среднеквадратичной ошибки (MSE)'''. Для смещённых оценок MSE = дисперсия + квадрат смещения; неравенство Рао — Крамера не даёт нижней границы для MSE напрямую. Использование классической границы для оценки MSE смещённой оценки — грубая ошибка. | ||
| + | |||
| + | * '''Игнорирование условий регулярности'''. Применение неравенства к моделям с зависящим от параметра носителем (например, <tex>U(0, \theta)</tex>) без проверки условий приводит к неверным выводам. | ||
| + | |||
| + | * '''Смешение эффективности и состоятельности'''. Эффективная оценка всегда состоятельна, но обратное неверно. Утверждение «оценка состоятельна, значит, она эффективна» ошибочно. | ||
| + | |||
| + | * '''Неправильная интерпретация информации Фишера'''. Иногда полагают, что <tex>I_n(\theta)</tex> — это дисперсия ОМП, хотя на самом деле это теоретическая граница, которая достигается только для эффективных оценок. | ||
| + | |||
| + | === Резюме === | ||
| + | |||
| + | Неравенство Рао — Крамера является краеугольным камнем параметрической теории оценивания. Оно даёт абсолютный нижний предел для дисперсии несмещённых оценок, выражаемый через [[Фишеровская информация|информацию Фишера]], и служит эталоном для сравнения процедур оценивания. Особую ценность неравенство приобретает в контексте [[Метод максимального правдоподобия|метода максимального правдоподобия]], поскольку оценки максимального правдоподобия являются асимптотически эффективными, то есть достигают этой границы при больших выборках. | ||
| + | |||
| + | Наиболее полезно неравенство в следующих ситуациях: | ||
| + | |||
| + | * при анализе точности несмещённых оценок в параметрических моделях; | ||
| + | * при обосновании асимптотических свойств ОМП и вычислении стандартных ошибок; | ||
| + | * при планировании экспериментов и определении минимального объёма выборки для достижения требуемой точности; | ||
| + | * в многомерных задачах — для анализа корреляционных структур оценок. | ||
| + | |||
| + | Важно помнить об ограничениях: неравенство не применимо к смещённым оценкам без модификации и требует выполнения условий регулярности, которые нарушаются в ряде практически важных моделей. Тем не менее, в широком классе задач оно остаётся незаменимым инструментом теоретического и прикладного анализа данных. | ||
| + | |||
| + | == Литература == | ||
| + | |||
| + | <references/> | ||
| + | |||
| + | * {{книга | ||
| + | | автор = Крамер Х. | ||
| + | | заглавие = Математические методы статистики | ||
| + | | издательство = Мир | ||
| + | | год = 1975 | ||
| + | | издание = 2-е | ||
| + | | страниц = 648 | ||
| + | | isbn = | ||
| + | }} | ||
| + | * {{книга | ||
| + | | автор = Rao, C. R. | ||
| + | | заглавие = Linear Statistical Inference and Its Applications | ||
| + | | издательство = John Wiley & Sons | ||
| + | | год = 1973 | ||
| + | | издание = 2nd | ||
| + | | страниц = 656 | ||
| + | | isbn = 0-471-70823-2 | ||
| + | }} | ||
| + | * {{книга | ||
| + | | автор = Lehmann, E. L., Casella, G. | ||
| + | | заглавие = Theory of Point Estimation | ||
| + | | издательство = Springer | ||
| + | | год = 1998 | ||
| + | | издание = 2nd | ||
| + | | страниц = 588 | ||
| + | | isbn = 0-387-98502-6 | ||
| + | }} | ||
| + | * {{статья | ||
| + | | автор = Fisher, R. A. | ||
| + | | заглавие = On the mathematical foundations of theoretical statistics | ||
| + | | издание = Philosophical Transactions of the Royal Society A | ||
| + | | год = 1922 | ||
| + | | том = 222 | ||
| + | | страницы = 309–368 | ||
| + | | doi = 10.1098/rsta.1922.0009 | ||
| + | }} | ||
| + | * {{статья | ||
| + | | автор = Cramér, H. | ||
| + | | заглавие = A contribution to the theory of statistical estimation | ||
| + | | издание = Skandinavisk Aktuarietidskrift | ||
| + | | год = 1946 | ||
| + | | том = 29 | ||
| + | | страницы = 85–94 | ||
| + | }} | ||
| + | * {{статья | ||
| + | | автор = Rao, C. R. | ||
| + | | заглавие = Information and the accuracy attainable in the estimation of statistical parameters | ||
| + | | издание = Bulletin of the Calcutta Mathematical Society | ||
| + | | год = 1945 | ||
| + | | том = 37 | ||
| + | | страницы = 81–89 | ||
| + | }} | ||
| + | |||
| + | [[Категория:Математическая статистика]] | ||
| + | [[Категория:Теория оценивания]] | ||
| + | [[Категория:Машинное обучение]] | ||
| + | [[Категория:Энциклопедия анализа данных]] | ||
Версия 20:03, 17 июля 2026
| | Статья написана с использованием LLM ChatGPT (GPT-5.6 Sol) и проверена участником Mariia Shubina 23:00, 17 июля 2026 (MSD) |
|
Неравенство Рао — Крамера
Неравенство Рао — Крамера (англ. Cramér–Rao inequality), также известное как информационное неравенство или неравенство Крамера — Рао, — фундаментальное утверждение в математической статистике и теории оценивания, устанавливающее нижнюю границу для дисперсии несмещённых оценок неизвестных параметров вероятностных моделей. Эта граница выражается через информацию Фишера и определяет теоретический предел точности, достижимый при оценивании параметра по конечной выборке.
Неравенство играет центральную роль в обосновании метода максимального правдоподобия, служит инструментом для сравнения оценок и позволяет характеризовать асимптотическую эффективность процедур оценивания. Впервые аналогичные неравенства были получены независимо М. Фреше (1943), Х. Крамером (1946) и К. Р. Рао (1945), причём работа Рао содержала наиболее общую формулировку в терминах информации Фишера[1][1].
Основные понятия
Пусть — независимая выборка из распределения, принадлежащего параметрическому семейству
. Предполагается, что плотность (или функция вероятности) каждого наблюдения имеет вид
и удовлетворяет условиям регулярности, обеспечивающим возможность дифференцирования по параметру под знаком интеграла.
- Статистическая оценка — функция
от выборочных данных, используемая для приближения истинного значения параметра
.
- Несмещённая оценка — оценка, для которой
для всех
. Иными словами, в среднем оценка не отклоняется от оцениваемого параметра.
- Дисперсия оценки —
, характеризующая разброс оценки вокруг истинного значения.
- Функция правдоподобия для выборки объёма
определяется как
. Логарифмическая функция правдоподобия:
.
- Фишеровская информация — мера количества информации, которую выборка несёт о неизвестном параметре. Для одного наблюдения:
при условии, что вторая производная существует и операция дифференцирования и интегрирования перестановочны. Для выборки объёма
в силу независимости наблюдений
.
Формулировка неравенства
Классическая форма. Пусть — несмещённая оценка параметра
, построенная по выборке объёма
. Тогда при выполнении условий регулярности
Пояснение членов:
-
— дисперсия оценки, которую мы стремимся минимизировать.
-
— количество информации Фишера во всей выборке.
- Граница
называется границей Рао — Крамера (или информационной границей). Она показывает минимальную возможную дисперсию несмещённой оценки в данной модели.
Для многомерного случая, когда , неравенство обобщается на матрицы ковариации: разность между ковариационной матрицей несмещённой оценки и обратной матрицей Фишера является неотрицательно определённой матрицей.
Условия регулярности
Неравенство справедливо не для всех распределений. Необходимы следующие условия (достаточные, но не строго необходимые):
- Носитель распределения не зависит от параметра
, то есть множество
одинаково для всех
.
- Функция правдоподобия дважды дифференцируема по
.
- Операция дифференцирования по
может быть вынесена за знак интеграла (или суммы), в частности,
, и аналогично для второй производной.
- Информация Фишера
конечна и положительна для всех
.
Нарушение первого условия (зависимость носителя от параметра) часто приводит к тому, что дисперсия некоторых оценок убывает быстрее, чем , и неравенство Рао — Крамера становится неинформативным (например, для равномерного распределения
). В таких случаях используются обобщения — например, неравенство Бхаттачарии или неравенство Чепмена — Роббинса.
Эффективные оценки
Оценка , для которой неравенство Рао — Крамера обращается в равенство при всех
, называется эффективной оценкой. В этом случае
. Эффективные оценки являются несмещёнными и достигают минимально возможной дисперсии в классе несмещённых оценок. Важно различать эффективность и состоятельность: эффективная оценка всегда состоятельна (при выполнении регулярных условий), но не всякая состоятельная оценка эффективна.
Критерий эффективности (равенство в неравенстве Рао — Крамера) эквивалентен тому, что производная логарифма правдоподобия может быть представлена в виде
Это условие выполняется для экспоненциальных семейств с естественной параметризацией, где оценка максимального правдоподобия часто оказывается эффективной.
Связь с методом максимального правдоподобия и асимптотической нормальностью
Неравенство Рао — Крамера тесно связано с асимптотической теорией оценивания. При выполнении регулярных условий оценка максимального правдоподобия (ОМП) является:
- состоятельной;
- асимптотически нормальной:
;
- асимптотически эффективной, то есть её асимптотическая дисперсия достигает границы Рао — Крамера
.
Это означает, что среди всех регулярных оценок ОМП является наилучшей в асимптотическом смысле. Более того, Фишеровская информация определяет кривизну логарифма правдоподобия и, следовательно, точность оценивания: чем больше информации, тем уже асимптотическое распределение ОМП.
Классические примеры
Нормальное распределение
Пусть , параметр
,
известно. Плотность:
.
Логарифм правдоподобия для одного наблюдения:
.
Вторая производная:
.
Информация Фишера:
.
Для выборки объёма
:
.
Граница Рао — Крамера:
.
Оценка
имеет дисперсию
— равенство достигается, оценка эффективна.
Если ,
известно, то
, граница
. Несмещённая оценка
имеет дисперсию
— эффективна.
Распределение Бернулли
Пусть ,
. Функция вероятности:
,
.
Логарифм:
.
Вторая производная:
.
Информация Фишера:
.
Для выборки:
.
Граница:
.
Оценка
имеет дисперсию
— эффективна.
Распределение Пуассона
Пусть ,
. Функция вероятности:
.
Логарифм:
.
Вторая производная:
.
Информация:
.
Граница:
.
Оценка
имеет дисперсию
— эффективна.
Экспоненциальное распределение
Пусть с плотностью
,
,
(параметр интенсивности).
Логарифм:
.
Вторая производная:
.
Информация:
.
Граница:
.
Оценка
является ОМП, но она смещённая. Несмещённая оценка для
существует (например,
) и её дисперсия равна
для
, что больше границы
. Таким образом, эффективной несмещённой оценки не существует.
Применение в машинном обучении и анализе данных
Неравенство Рао — Крамера находит прямое применение в следующих областях:
- Оценивание параметров вероятностных моделей. При построении генеративных моделей (например, наивный байесовский классификатор, скрытые марковские модели) знание границы Рао — Крамера позволяет оценить, насколько велика может быть ошибка оценивания параметров при заданном объёме выборки, и, следовательно, планировать необходимый размер обучающей выборки.
- Анализ метода максимального правдоподобия. В логистической регрессии и других обобщённых линейных моделях (GLM) асимптотическая ковариационная матрица оценок коэффициентов аппроксимируется обратной матрицей информации Фишера. На практике стандартные ошибки коэффициентов вычисляются именно на основе этой аппроксимации, что оправдано неравенством Рао — Крамера и свойством асимптотической эффективности ОМП.
- Байесовская статистика. В асимптотическом режиме (большие выборки) апостериорное распределение приближается нормальным со средним, равным ОМП, и дисперсией, равной обратной информации Фишера (теорема Бернштейна — фон Мизеса). Это прямое следствие эффективности ОМП и информационной границы.
- Проектирование экспериментов. В активном обучении и оптимальном планировании эксперимента критерии D-оптимальности и A-оптимальности основаны на максимизации информации Фишера, что эквивалентно минимизации объёма эллипсоида ошибок, ограниченного снизу границей Рао — Крамера.
Ограничения и типичные ошибки
Ограничения:
- Несмещённость. Неравенство применимо только к несмещённым оценкам. Для смещённых оценок существует обобщённое неравенство Рао — Крамера, учитывающее градиент смещения:
где
. Однако многие полезные оценки (например, регуляризованные, байесовские) смещены, и прямое применение классической формы некорректно.
- Регулярность. В случае распределений с параметром, влияющим на носитель, неравенство может давать слишком слабую границу или вообще не выполняться. Пример — равномерное распределение
, где дисперсия оценки
пропорциональна
, что меньше
.
- Конечность информации. Если информация Фишера обращается в бесконечность или равна нулю, граница становится тривиальной.
- Многомерные обобщения. В многомерном случае неравенство имеет матричный вид, и его интерпретация требует осторожности: граница определяется обратной матрицей Фишера, но не любая несмещённая оценка имеет ковариационную матрицу, сравнимую с этой границей в смысле неотрицательной определённости.
Типичные ошибки:
- Путаница дисперсии и среднеквадратичной ошибки (MSE). Для смещённых оценок MSE = дисперсия + квадрат смещения; неравенство Рао — Крамера не даёт нижней границы для MSE напрямую. Использование классической границы для оценки MSE смещённой оценки — грубая ошибка.
- Игнорирование условий регулярности. Применение неравенства к моделям с зависящим от параметра носителем (например,
) без проверки условий приводит к неверным выводам.
- Смешение эффективности и состоятельности. Эффективная оценка всегда состоятельна, но обратное неверно. Утверждение «оценка состоятельна, значит, она эффективна» ошибочно.
- Неправильная интерпретация информации Фишера. Иногда полагают, что
— это дисперсия ОМП, хотя на самом деле это теоретическая граница, которая достигается только для эффективных оценок.
Резюме
Неравенство Рао — Крамера является краеугольным камнем параметрической теории оценивания. Оно даёт абсолютный нижний предел для дисперсии несмещённых оценок, выражаемый через информацию Фишера, и служит эталоном для сравнения процедур оценивания. Особую ценность неравенство приобретает в контексте метода максимального правдоподобия, поскольку оценки максимального правдоподобия являются асимптотически эффективными, то есть достигают этой границы при больших выборках.
Наиболее полезно неравенство в следующих ситуациях:
- при анализе точности несмещённых оценок в параметрических моделях;
- при обосновании асимптотических свойств ОМП и вычислении стандартных ошибок;
- при планировании экспериментов и определении минимального объёма выборки для достижения требуемой точности;
- в многомерных задачах — для анализа корреляционных структур оценок.
Важно помнить об ограничениях: неравенство не применимо к смещённым оценкам без модификации и требует выполнения условий регулярности, которые нарушаются в ряде практически важных моделей. Тем не менее, в широком классе задач оно остаётся незаменимым инструментом теоретического и прикладного анализа данных.
Литература
- Крамер Х. Математические методы статистики. — 2-е. — Мир, 1975. — 648 с.
- Rao, C. R. Linear Statistical Inference and Its Applications. — 2nd. — John Wiley & Sons, 1973. — 656 с. — ISBN 0-471-70823-2
- Lehmann, E. L., Casella, G. Theory of Point Estimation. — 2nd. — Springer, 1998. — 588 с. — ISBN 0-387-98502-6
- Fisher, R. A. On the mathematical foundations of theoretical statistics // Philosophical Transactions of the Royal Society A. — 1922. — Т. 222. — С. 309–368.
- Cramér, H. A contribution to the theory of statistical estimation // Skandinavisk Aktuarietidskrift. — 1946. — Т. 29. — С. 85–94.
- Rao, C. R. Information and the accuracy attainable in the estimation of statistical parameters // Bulletin of the Calcutta Mathematical Society. — 1945. — Т. 37. — С. 81–89.

