왜 모델의 token 효율을 높이면 가격을 올릴 수 있는가
GPT5.5는 GPT5.4 대비 가격이 두 배이며, GPT5.4는 GPT5.3 codex 대비 가격이 약 40% 상승했습니다. 두 차례의 가격 인상에는 모두 token 효율을 높였다는 기본 논리가 있습니다. GPT5.2는 느리기가 치를 떨게 만드는 모델이지만, GPT5 시리즈 모델은 문제 파악 정확도가 높고 버그가 적어 검토 시의 정신적 부담을 크게 줄여주기에 줄곧 버리지 못했습니다. 5.3 codex부터 GPT 모델은 세대마다 속도가 눈에 띄게 빨라졌으며, 공식 설명에 따르면 모델이 성능을 높이면서도 사고에 쓰이는 token 비용을 낮췄다고 합니다. 즉, 하드웨어는 그대로이고 성능은 향상된 전제 하에 모델이 더 “핵심을 찌르는” 답을 내놓는데, 이를 저는 모델의 지능이 더 높아지고 논리가 더 명확해져 올바른 결론을 빠르게 사고해낼 수 있게 된 것이지, 여러 번 반성하는 것이 아니라고 이해합니다. 일부 오픈소스 모델의 사고 과정을 본 적이 있다면, 그 사고 과정의 대부분이 틀렸을 수 있지만 여러 번 반성하고 세부 사항을 반복적으로 추가함으로써 결국 정답을 얻기도 함을 알 수 있을 것입니다. 다만 사고 과정이 길고 지루하기만 합니다. GPT5.5의 사고 효율은 이제 업계에서 독보적이라고 할 수 있습니다. opus의 사고는 예전에는 실효성이 없다시피 했고, 4.7부터는 “당신은 …가 필요합니까?“라는 질문도 등장했습니다. 제 경험상 GPT5.4 이후로 추천 정확도가 이미 매우 높았기에, 우리 모델이 빨리 GPT5를 증류(蒸)하여 opus를 더 이상 증류하지 않았으면 합니다.

