desculpe mimo v2.5 pro realmente não serve
Categories:
Algumas pessoas compartilham que o modelo da Xiaomi consegue executar tarefas de longa duração, com centenas de tool calls sem erro, não sei quem iniciou essa direção de teste, é como dizer que um aluno consegue ficar 100 minutos na prova sem ir ao banheiro, não faz sentido. Nós, pessoas normais, entendemos que, para um exame, a única coisa importante é a nota, e se formos mais flexíveis, a nota representa mais de 95% do sistema de avaliação; geralmente olhamos a nota primeiro e depois o resto, se a nota for baixa não vale a pena ver o resto. O mimo realmente consegue terminar uma tarefa, mas o problema é que não a faz corretamente. A seguir, um relato subjetivo e não quantitativo do mimo 2.5 pro, comparando apenas com os padrões da indústria das séries GPT5 e opus. O cumprimento de instruções é ruim, a recuperação é ruim, e embora tenha contexto de 1M, com baixa recuperação o grande contexto tem utilidade limitada. Mesmo eu especificando no agente o uso do fluxo de desenvolvimento ATDD, o mimo não gerou documento de casos nem casos de teste. A compreensão de intenção é ruim, fazendo a tarefa desviar já no início. GPT5 e opus coletam muitas informações no início da conversa; a fase inicial de coleta é lenta, depois fica rápida. A vantagem dessa lentidão é menor desvio de intenção, a desvantagem é consumo de token claramente maior. O mimo 2.5 pro não tem vontade de coletar informações no início, por isso acho que o modelo só serve para tarefas de programação em escala minúscula, apesar de ter contexto de 1M. Como o modelo tem baixa vontade de coletar informações do ambiente, o suporte do mimo a ferramentas no Windows é muito ruim, os comandos dados por padrão são todos de Linux, mas salvo necessidade eu desenvolvo por padrão no dev drive do Windows; nem preciso falar de GPT5/opus, os modelos de referência não têm esse problema, e glm5.1 e DeepSeek v4 flash/pro também se saem normalmente. Falta de conhecimento geral, não consegue identificar erros óbvios contra o senso comum, e ainda teima em continuar. No final gasta muitos tokens dando uma solução e correção absurdas, era melhor reforçar a vontade de construção de contexto do modelo. Para resumir, o mimo v2.5 pro tem forte vontade de trabalhar, fraca vontade de explorar, memória ruim, conhecimento geral ruim, lógica ruim, suporte a Windows ruim, é um modelo sem méritos. Embora agradeça ao presidente Lei pela concessão do plano de tokens, infelizmente comparado ao GPT5 é como a diferença entre um estudante primário diligente e um doutor, não tem nem 80% da capacidade que alguns dizem. Minha experiência subjetiva foi toda em tarefas de programação, cerca de 10 requisições, consumindo 6% do pacote pro de 329 yuan, calculando grosseiramente o pacote de 329 yuan só dá para 200 requisições no meu cenário. Exceto por uma modificação simples de página única que aceitei, todas as outras implementações foram revertidas. Talvez seja um modelo bom para escrever textos? Enfim, não serve para escrever código.

