Otimização do Autoencoder Linear com SGD

Oct 29 2020

Estou interessado no Linear Autoencoder (LAE) e sabia que, no ponto de convergência, o subespaço que o LAE aprende é o mesmo que o subespaço que o PCA aprende até as transformações lineares. Além disso, a função de perda tem pontos de sela e seus mínimos locais tornam-se mínimos globais. Aqui, a configuração do problema é conforme discutido em "Redes Neurais e Análise de Componentes Principais: Aprendendo com Exemplos Sem Mínimos Locais" (1989) (http://www.vision.jhu.edu/teaching/learning/deeplearning19/assets/Baldi_Hornik-89.pdf)

Parece que esses fatos teóricos foram estudados e derivados no final dos anos 1980 e 1990 por causa das restrições computacionais da época, e sou grato por ter esses resultados. No entanto, também estou interessado em seu lado prático. Mais concretamente, quero saber sobre a taxa de convergência e a forma como o LAE recupera o subespaço principal (ou seja, qual direção principal tende a ser aprendida mais rápido do que as outras) ao usar o algoritmo SGD usual.

Você sabe se há algum trabalho relacionado a esse assunto? Embora eu tenha encontrado vários artigos relacionados a isso, eles se concentram em diferentes redes neurais, não em LAE.

Respostas

2 elliotp Nov 02 2020 at 01:52

Eu acho que você achará este artigo útil: D. Kunin et al., " Loss Landscapes of Regularized Linear Autoencoders (2019). Os autores discutem a convergência de autoencoders lineares para o subespaço principal e como a regularização permite a recuperação dos componentes principais reais (não apenas o subespaço).

Você também pode achar este artigo útil: E. Plaut, From Principal Subespaces to Principal Components with Linear Autoencoders (2018). Este artigo fornece uma introdução elaborada ao LAE e sua relação com o PCA.