Désolé, mimo v2.5 pro ne va vraiment pas

Certaines personnes partagent que le modèle de Xiaomi peut exécuter des tâches à long terme, avec des centaines d’appels tool call sans erreur. Je ne sais pas qui a lancé cette direction de test, c’est comme dire qu’un élève peut tenir 100 minutes aux examens sans aller aux toilettes, ce qui n’a aucun sens. Nous, les gens normaux, comprenons que pour un examen, la seule chose importante est la note. Si l’on est plus indulgent, la note représente plus de 95 % du système d’évaluation…

Certaines personnes partagent que le modèle de Xiaomi peut exécuter des tâches à long terme, avec des centaines d’appels tool call sans erreur. Je ne sais pas qui a lancé cette direction de test, c’est comme dire qu’un élève peut tenir 100 minutes aux examens sans aller aux toilettes, ce qui n’a aucun sens. Pour nous, gens normaux, dans le cadre d’un examen, la seule chose qui compte est la note. Si l’on est plus indulgent, la note représente plus de 95 % du système d’évaluation ; on regarde d’abord la note, puis le reste, et si la note est basse, il n’y a pas lieu de regarder autre chose. mimo peut certes terminer une tâche, mais le problème est qu’il ne la fait pas correctement. Voici un partage subjectif et non quantifié de mimo 2.5 pro, en comparaison uniquement avec les références du secteur, les séries GPT5 et opus. La conformité aux instructions est médiocre, le rappel est médiocre. Même avec un contexte de 1M, un faible rappel limite l’intérêt d’un grand contexte. Même si j’ai indiqué dans l’agent d’utiliser le processus de développement ATDD, mimo n’a pas généré de documents de cas ni de cas de test pour moi. La compréhension des intentions est médiocre, ce qui peut entraîner un écart dès le début de la tâche. GPT5 et opus collectent beaucoup d’informations au début de la session ; la phase de collecte au démarrage est lente, puis devient rapide. L’inconvénient de cette lenteur est une consommation de tokens nettement plus élevée, mais l’avantage est un écart de compréhension des intentions réduit. mimo 2.5 pro manque de volonté de collecte d’informations au démarrage, je pense donc que ce modèle ne peut exécuter que des tâches de programmation de très petite échelle, malgré son contexte de 1M. Comme le modèle a peu d’envie de collecter des informations sur l’environnement, le support des outils sous Windows par mimo est très mauvais ; les commandes données par défaut sont des commandes Linux. Sauf nécessité, je développe par défaut sur un Windows Dev Drive. Pas besoin de parler de GPT5/opus, les modèles de référence n’ont pas ce problème, glm5.1 et DeepSeek v4 flash/pro se comportent aussi normalement. Le sens commun fait défaut : il ne peut pas identifier les erreurs manifestement contraires au bon sens et continue obstinément. Au final, il consomme beaucoup de tokens pour proposer une solution et des modifications absurdes, mieux vaudrait renforcer la volonté de construction de contexte du modèle. En résumé, mimo v2.5 pro a une forte volonté de travail, une faible volonté d’exploration, une mauvaise mémoire, un sens commun médiocre, une logique médiocre, un mauvais support Windows : c’est un modèle sans grand intérêt. Bien que je remercie le PDG Lei de l’offre de tokens plan, comparé à GPT5, c’est comme l’écart entre un élève primaire travailleur et un doctorant ; ce n’est absolument pas les 80 % de capacité dont certains parlent. Mes expériences subjectives portent toutes sur des tâches de programmation, environ 10 requêtes, consommant 6 % de mon forfait pro de 329 yuans ; au grossier calcul, le forfait de 329 yuans ne permet que 200 requêtes dans mon cas d’usage. À part une simple modification de page unique acceptée, toutes les autres implémentations ont été annulées. Peut-être est-ce un modèle adapté à l’écriture ? En tout cas, il n’est pas fait pour coder.

Désolé, mimo v2.5 pro ne va vraiment pas - Illustration 1

Désolé, mimo v2.5 pro ne va vraiment pas - Illustration 2