Gematigde vergeetachtigheid bevordert modelprestaties

De GPT5-serie heeft een hoog recall-percentage, kan zeer strikte logica realiseren, is ongeëvenaard voor het oplossen van bugs, en kan tegelijkertijd tijdig tegenstrijdigheden in de context opmerken, een ervaring die uniek is onder de huidige modellen. Maar onlangs ontdekte ik in mijn persoonlijke reverse-engineering project dat GPT5 beperkte reverse-engineering capaciteiten heeft, duidelijk minder dan het opus-model. Het geeft vaak expliciet aan dat iets niet werkt, terwijl opus…

De GPT5-serie heeft een hoog recall-percentage, kan zeer strikte logica realiseren, is ongeëvenaard voor het oplossen van bugs, en kan tegelijkertijd tijdig tegenstrijdigheden in de context opmerken, een ervaring die uniek is onder de huidige modellen. Maar onlangs ontdekte ik in mijn persoonlijke reverse-engineering project dat GPT5 beperkte reverse-engineering capaciteiten heeft, duidelijk minder dan het opus-model. Het geeft vaak expliciet aan dat iets niet werkt, terwijl opus de functie snel kan reverse-engineeren. Opus documenteert zijn reverse-engineering proces als een geschiedenis van operationele pogingen, en na enkele dagen intensief gebruik bevat het geschiedenisdocument behoorlijk wat tegenstrijdigheden. GPT kan ervoor zorgen dat het niet blind vertrouwt op een verouderde beschrijving, maar wanneer er te veel verouderde informatie is, kan GPT5 het correct verwerken moeilijk aan. Met andere woorden, de GPT5-serie modellen presteren beperkt in een slecht onderhouden, lage-kwaliteit project, terwijl opus relatief goed blijft presteren.

Gematigde vergeetachtigheid bevordert modelprestaties Afbeelding 1