Algorithme EM pour la distribution normale bipolaire

Oct 22 2020

Question: Laissez$x_1, \dots, x_m$ être un échantillon iid d'une densité normale avec une moyenne $\mu$ et variance $\sigma^2$. Supposons pour chacun$x_i$ nous observons $y_i = |x_i|$. Formuler un algorithme EM pour l'estimation$\mu$ et $\sigma^2$.

Ma solution:

Définir une variable latente $Z$, quand $z_i = 1, x_i = y_i$ et $z_i = 0, x_i = -y_i$ et la probabilité $p(z_i = 1| \Theta, y_i) = p$. On sait facilement que$-x_i \sim \mathcal{N}(-\mu, \sigma^2)$.

$$ \begin{equation} \begin{aligned} l(\mathbf{x}, \mathbf{z}, p, \Theta) = \sum_{i = 1}^m z_i\left[ -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 -\frac{1}{2\sigma^2}(x_i - \mu)^2 + \ln p\right]\\ + \sum_{i = 1}^m (1 - z_i)\left[ -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 -\frac{1}{2\sigma^2}(x_i + \mu)^2 + \ln (1-p)\right], \end{aligned} \end{equation}$$

L'étape E dans l'algorithme EM est:$E_{\Theta_{n}}[l(\mathbf{x}, \mathbf{z}, p, \Theta) | \mathbf{y}]$.

Ma question:

  1. Il semble que certains problèmes surviennent dans mon modèle puisque deux variables latentes $z_i, p$ et inconnu $x_i$impliqué dans l'étape E. Alors, quelqu'un pourrait-il me dire où est l'erreur?

  2. Je vois la réponse pour mettre à jour le $\mu$ implique $f(y_i | \Theta_n)$, mais honnêtement, à partir de l'étape E: $E[x_iz_i | \Theta_n, y_i]$, il n'y aurait pas $f_i$impliqué. Alors, comment se fait la formule?

Merci d'avance!


La fonction de vraisemblance peut être davantage exprimée comme: \ begin {équation}\begin{aligned} Q(\Theta, \Theta_{n}) = & E_{\Theta_{n}}[l(\mathbf{x}, \mathbf{z}, \Theta) | \mathbf{y}]\\ = & \sum_{i = 1}^m\left( -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 - \frac{E_{\Theta_{n}}[x_i^2|y_i]}{2\sigma^2} - \frac{\mu^2}{2\sigma^2} - \frac{1-2\mu E_{\Theta_{n}}[x_iz_i|y_i]}{\sigma^2}\right) \end{aligned} \ end {équation}

L'attente de $E[x_iz_i | \Theta_n, y_i]$ $$ \begin{equation} \begin{aligned} E[x z | \Theta_n, y] = & \int \sum_l xz_lp(x_k,z_l | \Theta_n, y) dx\\ = &\int xp(x_k,z = 1 | \Theta_n, y)dx\quad \text{only z = 1 left}\\ = & p(z = 1 | \Theta_n, y)\int x f(x | z = 1, \Theta_n, y)dx\\ = & \frac{f(y_i|\theta_n)}{f(y_i|\theta_n) + f(-y_i|\theta_n)} \mu_n \end{aligned} \end{equation}$$:

Mais toujours coincé.

Réponses

2 Xi'an Oct 22 2020 at 23:59
  1. Il n'y a aucune probabilité $p$ dans ce problème comme $$\mathbb P_\theta(Z_i=1)=\mathbb P_\theta(X_i>0)=1-\Phi(\mu/\sigma)$$
  2. Il n'y a qu'un seul type de variable latente,$\mathbf Z$, puisque $\mathbf X$ est une fonction déterministe de $\mathbf Y$ et $\mathbf Z$, comme indiqué ci-dessous.
  3. la vraisemblance complète peut donc être exprimée en termes de $\mathbf Y$ et $\mathbf Z$ seulement

Si $X\sim\mathcal N(\mu,\sigma^2)$, puis $Y=|X|$ a une distribution de masse Dirac à $|X|$ sur conditionnelle $X$. La distribution marginale de$Y$ est la normale pliée, avec densité $$\sigma^{-1}\varphi(y;\mu,\sigma)+\sigma^{-1}\varphi(-y;\mu,\sigma)$$ Inversement, la distribution de $X$ sur conditionnelle $Y$ est une somme des masses de Dirac à $Y$ et $-Y$ avec des masses respectives proportionnelles à $\varphi(y;\mu,\sigma)$ et $\varphi(-y;\mu,\sigma)$. Notez que$$Z=\mathbb I_{X=|Y|}$$ est une transformation déterministe de $(X,Y)$, d'où que $Z$ est connu étant donné $(X,Y)$ et cela $X$ est connu étant donné $(Z,Y)$. Cela implique que$$\mathbb E_{\theta_{n}}[l(\mathbf{X}, \mathbf{Z}, \theta) | \mathbf{y}] =\mathbb E_{\theta_{n}}[l(\mathbf{X(Z,Y)}, \mathbf{Z}, \theta) | \mathbf{y}] $$et, puisque \ begin {équation}\begin{aligned} l(\mathbf{x}, \mathbf{z}, p, \Theta) &= \sum_{i = 1}^m \mathbb I_{z_i=1}\left[ -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 -\frac{1}{2\sigma^2}(x_i(1,y_i) - \mu)^2 \right]\\ &\quad + \sum_{i = 1}^m \mathbb I_{z_i=0}\left[ -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 -\frac{1}{2\sigma^2}(x_i(0,y_i) - \mu)^2 \right],\\ &= \sum_{i = 1}^m \mathbb I_{z_i=1}\left[ -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 -\frac{1}{2\sigma^2}(y_i - \mu)^2 \right]\\ &\quad + \sum_{i = 1}^m \mathbb I_{z_i=0}\left[ -\frac{1}{2}\ln 2\pi - \frac{1}{2}\ln \sigma^2 -\frac{1}{2\sigma^2}(-y_i - \mu)^2 \right], \end{aligned}\ end {équation} le pas E écrit comme \ begin {équation}\begin{aligned} \mathbb E_{\theta_n}[l(X,Z,\theta)|y) &= -\frac{m}{2}\ln 2\pi - \frac{m}{2}\ln \sigma^2- \frac{1}{2\sigma^2}\sum_{i = 1}^m \mathbb E_{\theta_n}[\mathbb I_{z_i=1}|y] (y_i - \mu)^2 \\ &\quad -\frac{1}{2\sigma^2} \sum_{i=1}^m \mathbb E_{\theta_n}[\mathbb I_{z_i=0}|y] (y_i + \mu)^2 \end{aligned}\ end {equation} Cela implique que$\mu_{n+1}$ car le pas M est la solution de l'équation $$\sum_{i = 1}^m \mathbb E_{\theta_n}[\mathbb I_{z_i=1}|y] (\mu-y_i) +\sum_{i=1}^m \mathbb E_{\theta_n}[\mathbb I_{z_i=0}|y] (y_i + \mu) = 0$$