죄송하지만 mimo v2.5 pro는 정말 안 됩니다
어떤 분들은 샤오미의 모델이 장거리 작업을 수행할 수 있고, 수백 번의 tool call도 오류 없이 수행한다고 공유합니다. 이 테스트 방향을 누가 시작한 건지 모르겠지만, 마치 한 학생이 시험장에서 100분 동안 화장실에 가지 않고 버틸 수 있다고 말하는 것과 같아 아무런 의미가 없습니다. 우리 정상적인 사람들의 이해로는, 한 차례의 응시 시험에 있어 유일하게 중요한 것은 오직 점수뿐이며, 조금 더 느슨하게 본다면 점수가 평가 체계에서 차지하는 비중이 95% 이상이고, 보통은 먼저 점수를 보고 그 다음 다른表现을 보며, 점수가 낮으면 다른 것을 볼 필요가 없습니다. mimo는 확실히 하나의 작업을 끝까지 수행할 수 있지만, 문제는 제대로 하지 못한다는 것입니다. 아래는 mimo 2.5 pro에 대한 주관적이고 비정량적인 공유이며, 업계의 벤치마크인 GPT5 시리즈와 opus 시리즈와만 비교합니다. 지시 따르기가较差하며, 리콜(회수)이较差합니다. 이를 바탕으로 1M 컨텍스트가 있음에도 리콜이 낮으면 큰 컨텍스트의 의미는 제한적입니다. 제가 agent에서 ATDD 개발 프로세스 사용을 명시했음에도 mimo는 저를 위해 case 문서와 테스트 케이스를 생성하지 않았습니다. 의도 이해가较差하여, 작업이 초기 단계에서부터偏差가 발생할 수 있습니다. GPT5와 opus는 모두 대화 초기에 많은 정보를 수집하며, 대화 시작 정보 수집 단계는 속도가 느리지만 이후에는 빠릅니다. 이 느림이 가져오는 이점은 의도 이해偏差가 적다는 것이고, 단점은 token 소모가明显히 크다는 것입니다. mimo 2.5 pro는 대화 시작 단계의 정보 수집 의지가 부족하므로, 이 모델은 초소규모 프로그래밍 작업만 수행할 수 있다고 생각하며, 비록 1M 컨텍스트를 가지고 있더라도 말입니다. 모델이 환경 정보 수집 의지가 낮기 때문에, mimo 모델의 windows 상 도구 지원은 매우较差하며, 기본적으로 제공하는 명령어는 모두 linux 명령어입니다. 하지만 필요하지 않은 한 저는 기본적으로 windows dev drive에서 개발하며, GPT5/opus는 말할 것도 없고 벤치마크 모델에는 이런 문제가 없고, glm5.1과 DeepSeek v4 flash/pro도 정상적으로表现합니다. 통상 지식이匮乏하여, 비교적 뚜렷한 상식을 벗어나는 오류를 식별하지 못하고, 뻗대며 계속 진행합니다. 결국 많은 token을 소모하여 황당한 방안과 수정을 내놓는데, 차라리 모델의 컨텍스트 구축 의지를 강화하는 것이 낫습니다. 마지막으로 요약하자면, mimo v2.5 pro는 작업 의지는 강하지만 탐색 의지는薄弱하며, 기억이 나쁘고 통상 지식이 부족하며 논리가 poor하고 windows 지원이 poor한, 별다를 것 없는 모델입니다. 레이 총괄님이 제공해 주신 token plan에 감사하지만, 안타깝게도 GPT5와 비교하면 마치 부지런한 초등학생과 박사의 차이와 같아, 일부 사람들이 말하는 80%의 능력을 갖춘 것이 결코 아닙니다. 제 주관적 경험은 모두 프로그래밍 작업이며, 약 10회 요청으로 329원 pro 패키지의 6%를 소모했으니, 대략적으로 329원 패키지는 제 사용 시나리오에서 요청을 200회만 보낼 수 있다고粗算합니다. 간단한 단일 페이지 수정 하나만 수락했을 뿐, 나머지 구현은 모두 롤백했습니다. 아마 글쓰기에 적합한 모델일까요? 어쨌든 코드 작성에는 적합하지 않습니다.

