Prouver divers $\mathbb{R}^n$ identités de différenciation
Laisser $f: \mathbb{R}^n \rightarrow \mathbb{R}^n$, $x \in \mathbb{R}^n$. Laisser$\frac{\partial g}{\partial x}$ être une matrice jacobienne pour que $\frac{\partial g}{\partial x} =\begin{bmatrix} \frac{\partial g_1}{\partial x_1} & \frac{\partial g_1}{\partial x_2} & \dots & \frac{\partial g_1}{\partial x_n} \\[1ex] % <-- 1ex more space between rows of matrix \frac{\partial g_2}{\partial x_1} & \frac{\partial g_2}{\partial x_2} & \dots & \frac{\partial g_2}{\partial x_n} \\[1ex] % \dots & \dots & \dots & \dots \\ \frac{\partial g_m}{\partial x_1} & \frac{\partial g_m}{\partial x_2} & \dots & \frac{\partial g_m}{\partial x_m} \end{bmatrix}$.
Si $m = 1$, puis $\frac{\partial g}{\partial x}$est un dégradé. Dans mes notes, le dégradé est exprimé sous forme de colonne , au lieu d'une ligne, je me suis donc un peu confondu avec la dimensionnalité.
Prouve-le
- Si $a \in \mathbb{R}^n$, $x \in \mathbb{R}^n$, puis $\frac{\partial(a^{\intercal}x)}{\partial x}= a.$
- Si $\mathbf{A} \in \mathbb{R}^{m \times n}$, $x \in \mathbb{R}^n$, puis $\frac{\partial(\mathbf{A}x)}{\partial x}= \mathbf{A}$.
- Si $\mathbf{A} \in \mathbb{R}^{m \times n}$, $x \in \mathbb{R}^n$, puis $\frac{\partial(x^\intercal\mathbf{A}x)}{\partial x} = (\mathbf{A} + \mathbf{A^\intercal})x$; en particulier, si$\mathbf{A}^\intercal = \mathbf{A}$, puis $\frac{\partial(x^\intercal\mathbf{A}x)}{\partial x} = 2\mathbf{A}x$.
- Si $x \in \mathbf{R}^n$, puis $\frac{\partial ||x||^2}{\partial x} = 2x$.
Je pense que cela ne devrait pas être trop difficile.
- En multipliant un vecteur et une transposée vectorielle, on obtient $a^\intercal x = \langle a_1x_1 + \dots + a_nx_n \rangle$. Donc,$\frac{\partial(a^{\intercal}x)}{\partial x}= [\frac{\partial(a^{\intercal}x)}{\partial x_1}, \dots, \frac{\partial(a^{\intercal}x)}{\partial x_n}] = [a_1, \dots, a_n] = a.$
- De même que le premier, $\frac{\partial(Ax)}{dx} = [\frac{\partial(a_1x)}{\partial x}, \dots, \frac{\partial(a_mx)}{\partial x}]$ = $[a_1,\dots, a_m] = \mathbf{A}$.
- Pour $\mathbf{A}$ étant symétrique, nous pourrions écrire $x^\intercal\mathbf{A}x = \sum_{i = 1}^{n} \sum_{i = 1}^{n} x_i a_{ij} x_j$ et montrez que $a_{1i} = a_{i1}$. Comment procéder avec$\mathbf{A}$ étant non symétrique $m \times n$?
- $\frac{\partial||x||^2}{\partial x} = \frac{\partial}{\partial x}\sum_ix^2_i = \sum_i2x_i = 2x$.
Pourriez-vous s'il vous plaît vérifier et signaler les erreurs, peut-être en le rendant plus rigoureux? Merci.
Réponses
Tout ce que vous écrivez va bien. Pour ce qui concerne le point 3., notez d'abord qu'il n'a de sens que si$m=n$. Après ça, tu te décomposeras juste$A$ dans sa partie symétrique et antisymétrique: $$ A=\frac{A+A^T}{2}+\frac{A-A^T}{2}. $$ Seule la partie symétrique de $A$ apporte une contribution à l'expression $x^T A x$. En effet, si$B$ est une matrice antisymétrique, c'est-à-dire si $B^T=-B$, puis $$ x^T B x=Bx\cdot x=x\cdot B^T x=- x\cdot B x=-x^T B x $$ à partir duquel $2 x^T B x=0$, à partir duquel $x^T B x=0$.
Donc, $x^T A x=x^T \frac{A+A^T}{2}x$ et vous pouvez appliquer le résultat pour lequel vous avez calculé $A$symétrique. À savoir$$ \partial_x (x^T A x)=\partial_x(x^T \frac{A+A^T}{2}x)=2(\frac{A+A^T}{2})x=(A+A^T)x. $$ En résumé, il vous suffit de prouver la formule pour $A$ symétrique.
PS Votre livre est "à droite", le dégradé doit être un vecteur colonne. Quand$m=1$il vaut mieux considérer la matrice jacobienne comme le gradient transposé. Vous en aurez la raison dans les prochains cours.