Lo siento, mimo v2.5 pro realmente no sirve

Algunas personas comparten que el modelo de Xiaomi puede ejecutar tareas de larga duración, con cientos de tool call sin errores. No sé quién inició esta dirección de prueba, es como decir que un estudiante puede aguantar 100 minutos en el examen sin ir al baño, lo cual no tiene sentido. Nosotros, las personas normales, entendemos que para un examen competitivo, lo único importante es la puntuación. Si somos más flexibles, la puntuación representa más del 95% del sistema de evaluación…

Algunas personas comparten que el modelo de Xiaomi puede ejecutar tareas de larga duración, con cientos de tool call sin errores. No sé quién inició esta dirección de prueba, es como decir que un estudiante puede aguantar 100 minutos en el examen sin ir al baño, lo cual no tiene sentido. Nosotros, las personas normales, entendemos que para un examen competitivo, lo único importante es la puntuación. Si somos más flexibles, la puntuación representa más del 95% del sistema de evaluación; generalmente se mira la puntuación primero y luego el resto, si la puntuación es baja no hay necesidad de ver nada más. mimo ciertamente puede completar una tarea, pero el problema es que no la hace bien. A continuación comparto de forma subjetiva y no cuantificada mi experiencia con mimo2.5pro, comparándolo solo con los referentes de la industria: la serie GPT5 y la serie opus. El cumplimiento de instrucciones es deficiente, la recuperación es deficiente; aunque tiene contexto de 1M, si la recuperación es baja, el gran contexto tiene un sentido limitado. Incluso cuando en el agente especifico usar el flujo de desarrollo ATDD, mimo no generó documentos de caso ni casos de prueba para mí. La comprensión de intención es deficiente, lo que provoca que la tarea pueda desviarse desde el inicio. GPT5 y opus recopilan mucha información al comienzo de la conversación; la fase inicial de recopilación es lenta y luego más rápida. El beneficio de esta lentitud es menor desviación en la comprensión de intención, la desventaja es un consumo de tokens claramente mayor. mimo2.5pro carece de voluntad para recopilar información al inicio, por lo que considero que este modelo solo puede ejecutar tareas de programación a muy pequeña escala, a pesar de tener contexto de 1M. Debido a la baja voluntad del modelo de recopilar información del entorno, el soporte de mimo para herramientas en Windows es muy deficiente; por defecto da comandos de Linux, pero salvo que sea necesario, yo desarrollo por defecto en Windows Dev Drive. No hace falta mencionar GPT5/opus, los modelos de referencia no tienen este problema; glm5.1 y DeepSeekv4flash/pro también se comportan con normalidad. Carece de conocimiento general, no puede identificar errores obviamente contrarios al sentido común y además sigue adelante con terquedad. Al final consume muchos tokens dando una solución y modificaciones absurdas; mejor sería reforzar la voluntad de construcción de contexto del modelo. Para concluir, mimo v2.5 pro tiene fuerte voluntad de trabajar, débil voluntad de explorar, mala memoria, poco conocimiento general, mala lógica, mal soporte de Windows; es un modelo sin nada destacable. Aunque agradezco al Sr. Lei por el plan de tokens regalado, lamentablemente comparado con GPT5 es como la diferencia entre un estudiante de primaria trabajador y un doctor; no tiene en absoluto el 80% de capacidad que algunos dicen. Mi experiencia subjetiva son todas tareas de programación, unas 10 solicitudes, consumiendo el 6% de un plan pro de 329 yuanes; calculando por encima, el plan de 329 yuanes en mi escenario solo puede enviar 200 solicitudes. Excepto una modificación simple de una página aceptada, todas las demás implementaciones fueron revertidas. ¿Quizás es un modelo adecuado para escribir textos? En fin, no sirve para escribir código.

Lo siento, mimo v2.5 pro realmente no sirve Ilustración 1

Lo siento, mimo v2.5 pro realmente no sirve Ilustración 2