Pourquoi augmenter l'efficacité des tokens du modèle permet d'augmenter le prix
Categories:
GPT5.5 a doublé son prix par rapport à GPT5.4, et GPT5.4 a augmenté d’environ 40% par rapport à GPT5.3codex. Les deux augmentations de prix reposent sur une logique de base : l’amélioration de l’efficacité des tokens. GPT5.2 est un modèle terriblement lent, mais la série GPT5 présente un taux de localisation précise des problèmes élevé et peu de bugs, ce qui réduit considérablement la charge mentale de relecture, et je n’ai jamais pu m’y résoudre à y renoncer. À partir de GPT5.3codex, chaque génération de modèles GPT a nettement amélioré sa vitesse. Selon les dires officiels, le modèle améliore ses performances tout en réduisant le coût en tokens de réflexion. Autrement dit, à matériel égal et avec une meilleure performance, le modèle est plus « percutant » : je l’interprète comme une intelligence supérieure du modèle, une logique plus claire, capable de parvenir rapidement à la bonne conclusion plutôt que de réfléchir à plusieurs reprises. Ceux qui ont vu la chaîne de pensée de certains modèles open source remarqueront que son processus de réflexion est en grande partie erroné, mais en s’appuyant sur de multiples réflexions et ajouts de détails, il finit tout de même par obtenir la bonne réponse, sauf que la chaîne de pensée est interminable et confuse. L’efficacité de réflexion de GPT5.5 est désormais unique dans le secteur. La réflexion d’opus était autrefois superficielle, et depuis la version 4.7, on retrouve des « Avez-vous besoin de… ? ». D’après mon expérience, le taux de recommandation précis de GPT5.4 était déjà très élevé. J’espère que nos modèles rattraperont vite GPT5 au lieu de continuer à copier opus.

