GPT4 — Hechos y expectativas razonables
GPT-4 (Generative Pre-trained Transformer 4) es un modelo de lenguaje muy anticipado que se espera que se lance en el primer trimestre de 2023. Si bien no se sabe mucho sobre GPT-4 en este momento, es probable que sea un importante avance en el rendimiento de modelos de lenguaje grande.
Si busca GPT4, puede encontrar menciones de un modelo de "parámetros 100T". Esta estimación se basa en el aumento significativo de los parámetros entre GPT2 (parámetros 1.5B) y GPT3 (parámetros 175B). Sin embargo, es importante tener en cuenta que esto es solo una extrapolación y que la cantidad real de parámetros para GPT4 no se ha anunciado oficialmente.
Entonces, ¿qué sabemos de GPT4? ¿Qué tan grande será? ¿Qué técnicas de entrenamiento y optimización se incluirán en su diseño?
Profundicemos… Pero cuando un tweet de Sam Altman insinúa la capacidad de GPT4 para pasar constantemente la prueba de Turing… ¡puede estar seguro de que habrá un antes y un después de GPT4!
Por lo tanto, creemos que la extrapolación de los "parámetros 100T" es incorrecta. Sin embargo, independientemente de su aumento de tamaño, esperamos que las últimas optimizaciones de modelos grandes y los enfoques de ajuste fino sean parte de esta versión (ver más abajo).
Aquí un breve resumen de lo que sabemos y podemos anticipar para este modelo.
Pero primero, considera apoyarnos: aplaude y síguenos
¿Qué sabemos de su tamaño y multimodalidad?
Tamaño GPT4
¿Un modelo de parámetros 100T? No.
El tamaño no será el principal factor de mejora : Sam Altman anunció que el tamaño de GPT4 no será mucho mayor que el de GPT3.
Esto no sorprende, ya que sabemos que GPT3 no es un cálculo óptimo (demasiado grande teniendo en cuenta la cantidad de tokens de entrenamiento). "Simplemente" agregar más datos aún puede ayudar a que GPT3 mejore significativamente.
No dice mucho... pero no deberíamos esperar algo por encima de un orden de magnitud más grande que los parámetros de ~1 TB.
¿GPT4 será multimodal?
¿Un modelo multimodal? No.
Sam Altman también anunció durante una sesión de preguntas y respuestas que GPT4 no será multimodal.
Deberíamos esperar un modelo de solo texto ajustado para seguir mejor nuestras instrucciones (es decir, una mejor "alineación" con nuestro aviso previsto)
Aún así, GPT4 será mucho mejor que GPT3, y he aquí por qué
¿Mejor en qué sentido?
Todavía podemos esperar una mejora significativa en comparación con GPT3 , una que puede justificar la exageración actual.
¿Por qué? porque las nuevas optimizaciones muestran que puede lograr el mismo rendimiento que GPT3 con modelos 100 veces más pequeños (consulte el ajuste fino del aprendizaje de refuerzo a continuación). Esto significa que un modelo GPT4 bien optimizado, con un tamaño similar a GPT3, aún funcionaría muchísimo mejor.
Es decir, debería tener
- Habilidades emergentes existentes mejoradas, es decir, seguir instrucciones, además de razonar, codificar, etc.: consulta este artículo sobre habilidades emergentes si no estás familiarizado con este concepto.
- Nuevas habilidades emergentes, por ejemplo, cadena implícita de razonamiento de pensamientos
Principalmente 3 que tuvieron un impacto significativo en el rendimiento de los modelos en 2022.
(1) Cómputo óptimo: en pocas palabras, aumentar los datos de entrenamiento aún puede mejorar el rendimiento de GPT3 sin aumentar el tamaño del modelo. De hecho, Deepmind demostró a través de un análisis empírico que existe una relación óptima entre el tamaño de los datos y el tamaño de los parámetros de un modelo entrenado. Este resultado mostró que GPT3 puede ser superado por un modelo 3 veces más pequeño (también conocido como Chinchilla). Aquí un post para leer más al respecto.
(2) Ajuste fino del aprendizaje por refuerzo : OpenAI lanzó en 2022 un modelo llamado InstructGPT (parámetros 1.3B). En su artículo , muestran que este modelo perfeccionado, basado en la retroalimentación humana, puede "superar los resultados del 175B GPT-3, a pesar de tener 100 veces menos parámetros". GPT3.5 y ChatGPT se basan en este nuevo enfoque.
(3) Nueva parametrización (μP): Este es un método para optimizar el entrenamiento de grandes redes neuronales . En pocas palabras, µP se puede usar para transferir hiperparámetros entre diferentes tamaños de modelos, lo que reduce la necesidad de prueba y error para encontrar los hiperparámetros óptimos para un modelo determinado. En otras palabras, podemos optimizar los hiperparámetros de modelos pequeños y usar los mismos parámetros para modelos más grandes.
Resumamos esto en el contexto de GPT4 : podemos agregar más datos en GPT3 sin tener que aumentar el tamaño del modelo. Basándose en el entrenamiento de aprendizaje por refuerzo con retroalimentación humana, los modelos pequeños pueden funcionar tan bien como los modelos 100 veces más grandes. Y gracias a la parametrización μP, podemos optimizar los hiperparámetros en modelos pequeños y reutilizar parámetros óptimos en los modelos más grandes.
¡Todo esto muestra una gran mejora potencial que se basa únicamente en la calidad de los datos y la optimización del entrenamiento! Sin embargo, aún apostaría por un aumento del tamaño del modelo de 5 a 10 veces, porque al final del día todavía sabemos que en las mismas condiciones de entrenamiento, más grande siempre es mejor.
¡Feliz año nuevo a todos y nos vemos en 2023!
Si te gustó esta publicación, considera apoyarnos: aplaude y sigue

![¿Qué es una lista vinculada, de todos modos? [Parte 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































