Melhorando DQN com flutuações

Oct 20 2020

Olá :) Sou muito novo nesta comunidade, então me avise se eu postar algo incorreto e tentarei mudar.

Estou trabalhando no projeto que visa a criação de um agente autônomo na CARLA. Eu construí uma rede neural Xception (decaying ε-greedy). Os outros parâmetros são:

EPISÓDIOS: 100
GAMA: 0,3
EPSILON_DECAY: 0,9
MIN_EPSILON: 0,001 LOTE: 16

Devido aos recursos limitados do computador, escolhi 100 ou 300 épocas para treinar o modelo, mas ele gera muitas flutuações:

EPISÓDIOS: 100
GAMA: 0,7 EPSILON_DECAY: 0,9
MIN_EPSILON: 0,001 LOTE: 16

Alguém pode sugerir como posso melhorar meus resultados? Ou é apenas questão de pequeno número de épocas?

Respostas

1 ArayKarjauv Oct 20 2020 at 19:43

Não está claro da sua pergunta como você usa o buffer de reprodução. Basicamente, você deve armazenar todos os estados / tuplas de recompensa e treinar seu agente em todo o buffer.

Além disso, você deve dar ao agente tempo para explorar (todos) os estados do mundo. Mas se você quiser acelerar o treinamento, você pode tentar implementar a amostragem de importância