抱歉mimo v2.5 pro真的不行

有些人分享小米的模型可以執行長程任務, 幾百次tool call不出錯, 不知這個測試方向是誰發起的, 如同說一個學生可以在考場堅持100分鐘不上廁所, 沒有意義. 我們正常人理解, 對一場應試考試來說, 唯一重要的只有分數, 如果更寬鬆一點, 分數佔評價體…

有些人分享小米的模型可以執行長程任務, 幾百次tool call不出錯, 不知這個測試方向是誰發起的, 如同說一個學生可以在考場堅持100分鐘不上廁所, 沒有意義。 我們正常人理解, 對一場應試考試來說, 唯一重要的只有分數, 如果更寬鬆一點, 分數佔評價體系權重的95%以上, 一般先看分數再看其它表現, 分數低就沒有必要再看其它。 mimo的確可以做完一個任務, 但問題是做不對。 以下為對mimo2.5pro的主觀非量化分享, 僅對比業界標竿GPT5系列和opus系列。 指令遵循較差, 召回較差, 在此基礎上雖有1M上下文, 但召回低的話, 大上下文的意義有限。即使我在agent中指明使用ATDD開發流程, mimo也沒有為我生成case文檔和用例。 意圖理解較差, 導致任務可能在初始即出現偏差。GPT5和opus都會在會話初始蒐集很多資訊, 會話啟動蒐集資訊階段速度慢, 後續快。這個慢帶來的好處是意圖理解偏差少, 壞處是token消耗明顯大。mimo2.5pro缺少會話啟動階段的資訊蒐集意願, 因此我認為該模型僅能執行超小規模的程式設計任務, 儘管它有1M上下文。 由於模型對環境資訊蒐集的意願低, mimo模型對windows上工具的支援很差, 預設給出命令都是linux 命令, 但除非必要我預設在windows dev drive上開發, GPT5/opus就不說了, 標竿模型沒這問題, glm5.1和DeepSeekv4flash/pro也表現正常。 通識匱乏, 無法識別較明顯不符合常識的錯誤, 還會頭鐵繼續做。最後消耗很多token給一個離譜的方案和修改, 真不如加強模型的上下文構建意願。 最後總結, mimo v2.5 pro工作意願強勁, 探索意願薄弱, 記憶差, 通識差, 邏輯差, windows支援差, 是一個乏善可陳的模型。雖然感謝雷總贈送的token plan, 可惜和GPT5比起來如同勤勞的小學生和博士的差距, 根本不是可部分人說的有80%的能力。 我的主觀體驗都是程式設計任務, 約10次請求, 消耗329元pro套餐的6%, 粗算329元套餐在我的使用場景只能發200次請求。除了一個簡單的單頁面修改接受以外, 其它的實作全都回退了。或許這是個適合寫文的模型?總之它不適合寫程式碼。

抱歉mimo v2.5 pro真的不行 配圖 1

抱歉mimo v2.5 pro真的不行 配圖 2