Warum werden Dichtefunktionen manchmal mit bedingter Notation geschrieben?
Ich sehe immer wieder Dichtefunktionen, die sich nicht explizit aus der Konditionierung ergeben, die mit dem bedingten Vorzeichen geschrieben wurde: Zum Beispiel für die Dichte des Gaußschen $N(\mu,\sigma)$ warum schreiben: $$ f(x| \mu, \sigma)=\frac{1}{\sqrt{2\pi \sigma^2}}\exp{-\frac{(x-\mu)^2}{2\sigma^2}}$$
Anstatt von
$$ f(x)=\frac{1}{\sqrt{2\pi \sigma^2}}\exp{-\frac{(x-\mu)^2}{2\sigma^2}}$$
Wird dies nur getan, um explizit zu sagen, was die Parameterwerte sind, oder (was ich mir erhoffe) gibt es eine Bedeutung in Bezug auf die bedingte Wahrscheinlichkeit?
Antworten
- In einem Bayesian Zusammenhang die Parameter sind Zufallsvariablen, so dass in diesem Zusammenhang die Dichte tatsächlich die bedingte Dichte von$X \mid (\mu, \sigma)$. In dieser Einstellung ist die Notation sehr natürlich.
- Außerhalb eines Bayes'schen Kontexts ist es nur eine Möglichkeit, klar zu machen, dass die Dichte (hier verwende ich dieses Wort umgangssprachlich und nicht probabilistisch) von den Parametern abhängt. Einige Leute benutzen$f_{\mu, \sigma}(x)$ oder $f(x; \mu, \sigma)$ zu dem gleichen Effekt.
- Dieser letztere Punkt kann im Zusammenhang mit Wahrscheinlichkeitsfunktionen wichtig sein. Eine Wahrscheinlichkeitsfunktion ist eine Funktion der Parameter $\theta$, einige Daten gegeben $x$. Die Wahrscheinlichkeit wird manchmal geschrieben als$L(\theta \mid x)$ oder $L(\theta ; x)$oder manchmal als $L(\theta)$ wenn die Daten $x$wird als gegeben verstanden. Verwirrend ist, dass im Fall einer kontinuierlichen Verteilung die Wahrscheinlichkeitsfunktion als der Wert der Dichte definiert ist , der dem Parameter entspricht$\theta$, ausgewertet an den Daten $x$dh $L(\theta; x) := f_\theta(x)$. Schreiben$L(\theta; x) = f(x)$ wäre verwirrend, da die linke Seite eine Funktion von ist $\theta$, während die rechte Seite angeblich nicht davon abzuhängen scheint $\theta$. Während ich lieber schreibe$L(\theta; x) := f_\theta(x)$könnten einige schreiben $L(\theta; x) := f(x \mid \theta)$.
- Ich habe nicht wirklich viel Konsistenz in der Notation zwischen verschiedenen Autoren gesehen, obwohl jemand besser gelesen hat, als ich mich korrigieren kann, wenn ich falsch liege.
Diese Notation wird häufig im MLE-Kontext verwendet, um sie von der Wahrscheinlichkeitsfunktion und der Schätzung der von Daten abhängigen Parameter zu unterscheiden.
In MLE machen Sie so etwas: $$\hat\mu,\hat\sigma|X= \underset{\mu,\sigma}{\operatorname{argmax}} \mathcal L(X|\mu,\sigma)$$ $$\mathcal L(X|\mu,\sigma)=\prod_i f(x_i\in X|\mu,\sigma) $$
Diese Notation betont also, dass Sie das PDF verwenden $f(.)$ des Datensatzes abhängig von einem Kandidatensatz von Parametern, um die Wahrscheinlichkeitsfunktion zu erhalten $\mathcal L$. Dann wählen Sie das Set, das die Wahrscheinlichkeit maximiert, als Ihre Lösung$\hat\mu,\hat\sigma$. Somit ist die Lösung wirklich vom Datensatz abhängig$X$, während die Wahrscheinlichkeit vom Kandidatenparametersatz abhängig ist $\mu,\sigma$. Deshalb ist diese Notation für didaktische Zwecke gut geeignet, um zu zeigen, wie die Bedingungen auf der linken und rechten Seite "umdrehen".