Извините, mimo v2.5 pro действительно не подходит

Некоторые делятся, что модель Xiaomi может выполнять длинные задачи, сотни вызовов tool call без ошибок. Не знаю, кто инициировал это направление тестирования — это всё равно что сказать, будто ученик может продержаться 100 минут на экзамене не сходя в туалет, что бессмысленно. Нормальные люди понимают, что для экзаменационной проверки единственное важное — это только баллы, и если быть снисходительнее, то баллы занимают более 95% веса в системе оценки…

Некоторые делятся, что модель Xiaomi может выполнять длинные задачи, сотни вызовов tool call без ошибок. Не знаю, кто инициировал это направление тестирования — это всё равно что сказать, будто ученик может продержаться 100 минут на экзамене не сходя в туалет, что бессмысленно. Мы, нормальные люди, понимаем, что для экзаменационной проверки единственное важное — это только баллы. Если быть снисходительнее, то баллы занимают более 95% веса в системе оценки: обычно сначала смотрят на баллы, а потом на всё остальное, и если баллы низкие, то нет смысла смотреть дальше. mimo действительно может довести задачу до конца, но проблема в том, что она делает её неправильно. Ниже — субъективный неколичественный обзор mimo2.5pro, сравнивается только с отраслевыми эталонами серии GPT5 и серии opus. Слабое следование инструкциям, слабый отбор релевантного — при этом, хотя есть контекст 1M, при низком отборе смысл большого контекста ограничен. Даже когда я явно указал в agent использовать процесс разработки ATDD, mimo не сгенерировал для меня документы case и тестовые сценарии. Слабое понимание намерений приводит к тому, что задача может сразу пойти не туда. GPT5 и opus на начальном этапе беседы собирают много информации: фаза сбора в начале медленная, потом быстрая. Преимущество этой медлительности — меньше искажений в понимании намерений, недостаток — заметно больший расход token. mimo2.5pro не проявляет желания собирать информацию на старте беседы, поэтому я считаю, что эта модель способна выполнять лишь сверхмалые задачи программирования, несмотря на контекст 1M. Поскольку модель слабо стремится собирать информацию об окружении, mimo плохо поддерживает инструменты на Windows — по умолчанию даёт команды Linux. Но если не нужно иначе, я по умолчанию разрабатываю на Windows dev drive. Про GPT5/opus и говорить нечего — у эталонных моделей такой проблемы нет, glm5.1 и DeepSeekv4flash/pro тоже работают нормально. Нехватка общих знаний: модель не распознаёт очевидные нарушения здравого смысла и упрямо продолжает. В итоге тратит много token на абсурдное решение и правки — лучше бы усилили желание модели строить контекст. Подводя итог: mimo v2.5 pro сильно стремится работать, слабо стремится исследовать, плохая память, слабые общие знания, слабая логика, плохая поддержка Windows — модель, в которой мало хорошего. Хотя благодарен господину Лэю за подарочный token plan, но по сравнению с GPT5 это как разница между прилежным учеником начальной школы и доктором наук, никак не те 80% возможностей, о которых говорят некоторые. Мой субъективный опыт — задачи программирования, около 10 запросов, потрачено 6% от пакета pro на 329 юаней, грубо считая пакет за 329 юаней в моём сценарии позволит сделать лишь 200 запросов. Кроме одного простого изменения на одностраничнике, которое я принял, все остальные реализации были откачены. Может, это модель для написания текстов? В любом случае, она не подходит для написания кода.

Извините, mimo v2.5 pro действительно не подходит, иллюстрация 1

Извините, mimo v2.5 pro действительно не подходит, иллюстрация 2