GPT4 — Faits et attentes raisonnables
GPT-4 (Generative Pre-trained Transformer 4) est un modèle de langage très attendu qui devrait être publié au premier trimestre 2023. Bien que l'on ne sache pas grand-chose sur GPT-4 pour le moment, il est susceptible d'être un progrès dans la performance des grands modèles de langage.
Si vous recherchez GPT4, vous pouvez rencontrer des mentions d'un modèle "100T parameters". Cette estimation est basée sur l'augmentation significative des paramètres entre GPT2 (paramètres 1,5B) et GPT3 (paramètres 175B). Cependant, il est important de noter qu'il ne s'agit que d'une extrapolation et que le nombre réel de paramètres pour GPT4 n'a pas été officiellement annoncé.
Alors, que savons-nous de GPT4 ? Quelle sera sa taille ? Quelles techniques de formation et d'optimisation seront incluses dans sa conception ?
Allons-y… Mais quand un tweet de Sam Altman fait allusion à la capacité de GPT4 à réussir systématiquement le test de Turing… vous pouvez être sûr qu'il y aura un avant GPT4 et un après !
Ainsi, nous pensons que l'extrapolation des « paramètres 100T » est erronée. Pourtant, quelle que soit son augmentation de taille, nous nous attendons à ce que les dernières optimisations majeures des grands modèles et les approches de réglage fin fassent partie de cette version (voir ci-dessous).
Voici un bref résumé de ce que nous savons et pouvons anticiper pour ce modèle.
Mais d'abord, pensez à nous soutenir : applaudissez et suivez
Que sait-on de sa taille et de sa multimodalité ?
Taille GPT4
Un modèle 100T paramètres ? Non.
La taille ne sera pas le principal facteur d'amélioration : Sam Altman a annoncé que la taille de GPT4 ne sera pas beaucoup plus grande que GPT3.
Cela n'est pas surprenant puisque nous savons que GPT3 n'est pas optimal en termes de calcul (trop grand compte tenu du nombre de jetons d'entraînement). "Simplement" ajouter plus de données peut encore aider GPT3 à s'améliorer de manière significative.
Cela ne dit pas grand-chose… mais nous ne devrions pas nous attendre à quelque chose au-dessus d'un ordre de grandeur de paramètres plus grands d'environ 1 To.
GPT4 sera-t-il multimodal ?
Un modèle multimodal ? Non.
Sam Altman a également annoncé lors d'une session de questions-réponses que GPT4 ne sera pas multimodal.
Nous devrions nous attendre à un modèle de texte uniquement affiné pour mieux suivre nos instructions (c'est-à-dire, un meilleur "alignement" avec notre invite prévue)
GPT4 sera toujours bien meilleur que GPT3, et voici pourquoi
Mieux dans quel sens ?
On peut encore s'attendre à une amélioration significative par rapport à GPT3 , qui peut justifier le battage médiatique actuel.
Pourquoi? car de nouvelles optimisations montrent que vous pouvez obtenir les mêmes performances que GPT3 avec des modèles 100 fois plus petits (voir le réglage fin de l'apprentissage par renforcement ci-dessous). Cela signifie qu'un modèle GPT4 bien optimisé, avec une taille similaire à GPT3, fonctionnerait toujours mieux.
A savoir, il devrait avoir
- Capacités émergentes existantes améliorées, c'est-à-dire suivre les instructions ainsi que le raisonnement, le codage, etc. : consultez cet article sur les capacités émergentes si vous n'êtes pas familier avec ce concept.
- Nouvelles capacités émergentes, p. ex. raisonnement implicite en chaîne de pensées
Principalement 3 qui ont eu un impact significatif sur les performances des modèles en 2022.
(1) Compute Optimal : en un mot, l'augmentation des données d'entraînement peut encore améliorer les performances de GPT3 sans augmenter la taille du modèle. En fait, Deepmind a montré à travers une analyse empirique qu'il existe une relation optimale entre la taille des données et la taille des paramètres d'un modèle formé. Ce résultat a montré que GPT3 peut être surpassé par un modèle 3 fois plus petit (aka Chinchilla). Voici un article pour en savoir plus.
(2) Reinforcement Learning Fine Tuning : OpenAI a sorti en 2022 un modèle appelé InstructGPT (paramètres 1.3B). Dans leur article , ils montrent que ce modèle affiné, basé sur la rétroaction humaine, peut "surclasser les sorties du 175B GPT-3, malgré 100 fois moins de paramètres". GPT3.5 et ChatGPT sont tous deux basés sur cette nouvelle approche.
(3) Nouvelle paramétrisation (μP) : Il s'agit d'une méthode d'optimisation de l'apprentissage des grands réseaux de neurones . En un mot, µP peut être utilisé pour transférer des hyper-paramètres entre différentes tailles de modèles, réduisant ainsi le besoin d'essais et d'erreurs pour trouver les hyper-paramètres optimaux pour un modèle donné. En d'autres termes, nous pouvons optimiser les hyper-paramètres des petits modèles et utiliser les mêmes paramètres pour les modèles plus grands !
Résumons cela dans le contexte de GPT4 : nous pouvons ajouter plus de données dans GPT3 sans avoir à augmenter la taille du modèle. S'appuyant sur l'apprentissage par renforcement avec rétroaction humaine, les petits modèles peuvent être aussi performants que les modèles 100 fois plus grands. Et grâce à la paramétrisation μP, on peut optimiser les hyper-paramètres sur les petits modèles et réutiliser les paramètres optimaux sur les plus gros modèles.
Tout cela montre un énorme potentiel d'amélioration en s'appuyant uniquement sur la qualité des données et l'optimisation de la formation ! Je parierais toujours sur une augmentation de la taille du modèle de 5 à 10 fois, car en fin de compte, nous savons toujours que dans les mêmes conditions d'entraînement, plus c'est grand, mieux c'est.
Bonne année à tous et rendez-vous en 2023 !
Si vous avez aimé ce post, pensez à nous soutenir : applaudissez et suivez
![Qu'est-ce qu'une liste liée, de toute façon? [Partie 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































