Saltar para o conteúdo
DataLeaf

Artigos

Porque é que a variância amostral divide por n − 1

Uma demonstração curta de que dividir por n − 1 elimina o enviesamento, e um lembrete de que o estimador centrado não é o mais exato.

Todas as disciplinas introdutórias definem a variância amostral com n−1n - 1 no denominador, e a maioria dos estudantes aceita-o por confiança. A razão cabe em três linhas, e o mesmo acontece com a ressalva que costuma ficar por dizer.

Definição — Variância amostral
Para observações x1,…,xnx_1, \dots, x_n com média xˉ=1n∑ixi\bar x = \frac{1}{n} \sum_{i} x_i, seja S=∑i=1n(xi−xˉ)2S = \sum_{i=1}^{n} (x_i - \bar x)^2. A variância amostral é s2=S/(n−1)s^2 = S / (n - 1); a variância empírica é σ^2=S/n\hat\sigma^2 = S / n.

O enviesamento e a sua correção

#
Teorema — Ausência de enviesamento
Se X1,…,XnX_1, \dots, X_n são independentes com média μ\mu e variância σ2<∞\sigma^2 < \infty, então 𝔼[S]=(n−1) σ2\mathbb{E}[S] = (n - 1)\,\sigma^2. Consequentemente 𝔼[s2]=σ2\mathbb{E}[s^2] = \sigma^2, enquanto 𝔼[σ^2]=n−1n σ2\mathbb{E}[\hat\sigma^2] = \frac{n-1}{n}\,\sigma^2.
Demonstração.

Decomponha-se cada desvio em relação à média verdadeira num desvio em relação à média amostral e no erro da média amostral. Os termos cruzados somam zero, o que dá a identidade ∑i(Xi−μ)2=S+n(Xˉ−μ)2\sum_i (X_i - \mu)^2 = S + n (\bar X - \mu)^2. Tomando valores esperados,

𝔼[S]=∑i=1n𝔼[(Xi−μ)2]−n 𝔼[(Xˉ−μ)2]=nσ2−nVar⁡(Xˉ)=nσ2−σ2=(n−1) σ2, \begin{aligned} \mathbb{E}[S] &= \sum_{i=1}^{n} \mathbb{E}\bigl[(X_i - \mu)^2\bigr] - n\, \mathbb{E}\bigl[(\bar X - \mu)^2\bigr] \\ &= n \sigma^2 - n \operatorname{Var}(\bar X) = n\sigma^2 - \sigma^2 = (n - 1)\, \sigma^2, \end{aligned}

porque a independência dá Var⁡(Xˉ)=σ2/n\operatorname{Var}(\bar X) = \sigma^2 / n.

Fim da demonstração

A intuição é que xˉ\bar x é ajustada aos mesmos dados com que é comparada. A média amostral é o ponto que minimiza a soma dos quadrados dos desvios, pelo que os dados parecem sempre um pouco menos dispersos em torno de xˉ\bar x do que em torno do μ\mu desconhecido. Estimar a média consome um grau de liberdade, e dividir por n−1n - 1 em vez de nn repõe exatamente o valor esperado.1

Centrado não é o mesmo que exato

#

A correção acerta a média do estimador, não a sua dispersão, e em amostras pequenas é a dispersão que domina.

Observação

Para dados normais, S/σ2S / \sigma^2 segue uma distribuição χn−12\chi^2_{n-1}, pelo que Var⁡(S)=2(n−1) σ4\operatorname{Var}(S) = 2 (n - 1)\, \sigma^4. O erro quadrático médio de S/cS / c é

EQM⁡(S/c)=σ4[2(n−1)c2+(n−1c−1)2], \operatorname{EQM}(S / c) = \sigma^4 \left[ \frac{2(n-1)}{c^2} + \left( \frac{n-1}{c} - 1 \right)^{2} \right],

que é mínimo em c=n+1c = n + 1. Dividir por n−1n - 1 dá o único estimador centrado dos três, e o de maior erro.

Exemplo — Uma simulação
Gerem-se 200 000 amostras de dimensão nn de uma distribuição normal padrão, de modo que σ2=1\sigma^2 = 1, e calculem-se os três estimadores para cada amostra. A tabela dá os valores exatos da observação anterior, com os valores simulados entre parênteses.
Dimensão nnMédia de S/nS/nEQM de S/(n−1)S/(n-1)EQM de S/nS/nEQM de S/(n+1)S/(n+1)
20,500 (0,500)2,000 (2,009)0,750 (0,752)0,667 (0,667)
30,667 (0,666)1,000 (1,004)0,556 (0,558)0,500 (0,502)
50,800 (0,801)0,500 (0,501)0,360 (0,360)0,333 (0,333)
100,900 (0,900)0,222 (0,223)0,190 (0,191)0,182 (0,182)
300,967 (0,968)0,069 (0,069)0,066 (0,066)0,065 (0,065)

Com duas observações, o estimador centrado tem o triplo do erro quadrático médio de S/(n+1)S / (n + 1). Com trinta observações, os erros diferem menos de dez por cento, e a escolha quase não importa.

Qual reportar

#

Reporte s2s^2 quando a variância alimenta algo que depende da ausência de enviesamento: estimativas combinadas, estatísticas tt e as fórmulas habituais que a pressupõem. Use σ^2\hat\sigma^2 quando é a estimativa de máxima verosimilhança num modelo maior e a coerência com esse modelo importa mais. E quando uma única variância de uma amostra pequena tiver de ficar o mais perto possível da verdade, lembre-se de que nenhuma das duas é a escolha mais exata.


  1. A correção deve o nome ao astrónomo Friedrich Wilhelm Bessel. ↩︎