MiMo Code long-horizon agent routing: Max Mode, Goal-проверки и OpenAI-compatible backends

MiMo Code — open-source coding agent Xiaomi для долгосрочных задач. Разбираем, как Max Mode, Goal verification, маршрутизация worker/judge и OpenAI-compatible backends меняют стоимость и надежность API gateway.

TheRouter Newsroomисточник Xiaomi MiMo
Архитектура MiMo Code: параллельная выборка Max Mode и цикл верификации Goal

Большинство coding agent'ов проектируются под задачи, умещающиеся в один диалоговый контекст. Когда задача растягивается на десятки или сотни вызовов инструментов, интуитивный ответ — увеличить context window — порождает цепочку сбоев: деградация instruction-following при длинных контекстах, неконтролируемый рост расходов на токены и преждевременные заявления агента о завершении задачи. 10 июня команда Xiaomi MiMo опубликовала инженерное описание MiMo Code — терминального coding agent на базе OpenCode, открытого под лицензией MIT. Архитектурные решения этого инструмента напрямую касаются команд, которые маршрутизируют agent-нагрузки через API gateway.

Что конкретно поставляет MiMo Code

MiMo Code — это harness, а не модель. Он оборачивает любую модель с OpenAI-compatible chat completions endpoint и добавляет три архитектурных слоя поверх базового цикла:

Max Mode — параллельная выборка. На каждом шаге агент генерирует N кандидатов параллельно (по умолчанию N=5, temperature=1). Отдельный вызов модели-«судьи» сравнивает ход рассуждений и планы действий всех кандидатов, выбирает лучший — и только после этого выполняет его. На SWE-Bench Pro Max Mode улучшает результаты на 10–20% ценой примерно 4–5-кратного роста потребления токенов на шаг.

Goal — независимый верификатор завершения. Когда агент пытается остановиться, независимый вызов модели проверяет полную историю диалога по условию завершения на естественном языке (например, «все тесты прошли и код закоммичен»). Если условие не выполнено, конкретные расхождения передаются агенту, и выполнение продолжается. Вероятность бесконечного цикла — менее 0,5%; предусмотрен жёсткий лимит шагов.

Структурированное хранение и извлечение памяти. Вместо компрессии истории в скользящее резюме MiMo Code ведёт явные структуры хранения для состояния задачи и использует retrieval для избирательного восстановления контекста. Дизайн мотивирован наблюдением: rolling-summary ведёт себя как рекуррентная модель — имеет состояние, но не может произвольно обратиться к прошлому.

Max Mode и Goal ортогональны: Max Mode расширяет каждый шаг горизонтально (параллельно), Goal удлиняет выполнение задачи вертикально (больше шагов). Оба режима можно включить одновременно — расходы на токены суммируются.

Что это значит для engineering-команд

1. Model-agnostic deployment — ключевое routing-решение

MiMo Code работает с любым OpenAI-compatible backend. В обсуждении на Hacker News была точная формулировка: «MiMo Code имеет ту же поддержку provider, что и OpenCode. Даже Claude Code можно использовать через любой provider, предоставляющий Anthropic API endpoint.» Это означает: команды, запускающие MiMo Code в автоматизированных coding pipeline, должны сделать выбор:

  • Какую модель использовать для роли worker (основные шаги, высокий объём, чувствительность к стоимости)
  • Какую модель использовать для роли судьи (Max Mode, критична точность, меньший объём)
  • Должны ли worker и судья быть одной моделью или разными

Разделение ролей worker/судья создаёт естественную точку для применения routing-политики: более быстрый и дешёвый provider для worker-шагов и более точная модель для вызовов судьи. AI gateway с per-request model selection может маршрутизировать эти две роли независимо — без изменений в самом harness.

2. Max Mode меняет расчёт бюджета токенов

При N=5 каждый шаг агента потребляет примерно в 5 раз больше токенов, чем при одиночной выборке. На примере задачи в 50 шагов:

  • Стандартный режим: ~50 вызовов worker + ~50 вызовов судьи = ~100 API-запросов
  • Max Mode: ~250 вызовов worker + ~50 вызовов судьи = ~300 API-запросов

Точный множитель зависит от сложности задачи, но смысл ясен: Max Mode — усилитель throughput для нижележащего provider. Команды должны рассматривать это как отдельный ценовой уровень и учитывать запас по rate limit при включённом Max Mode. Если routing layer применяет TPM-ограничения на модель, Max Mode способен незаметно привести к rate limit в рамках одной задачи.

3. Deprecation MiMo-V2 уже стала дедлайном для cost accounting

Operator'ы, жёстко привязанные к mimo-v2-flash или mimo-v2-tts, уже прошли первый этап автоматического перенаправления: 18 июня 2026 года в 00:00 GMT+8 платформа Xiaomi начала перенаправлять запросы v2-flash и v2-tts на эквиваленты V2.5 — по ценам V2.5. Полное прекращение поддержки — 30 июня.

Если ваш routing layer использует вендорские алиасы моделей (то есть передаёт mimo-v2-flash непосредственно в Xiaomi endpoint), перенаправление 18 июня могло изменить стоимость токена без каких-либо изменений в конфигурации. Если ваш routing layer нормализует идентификаторы моделей, проверьте маппинги до 30 июня и убедитесь, что вариант V2.5 (и его цена) корректно отражены в системе учёта затрат.

Взгляд router/operator

MiMo Code обнажает два паттерна, актуальных далеко за пределами этого инструмента:

Асимметрия ролей worker/судья. Agent harness'ы, использующие вызов «планировщика» или «верификатора» параллельно с основным worker, становятся всё более распространёнными. Маршрутизация этих двух ролей к разным provider — или к разным ценовым уровням одного provider — требует gateway, способного диспетчеризовать вызовы по метаданным роли в запросе, а не только по имени модели.

Нелинейное усиление числа шагов. Долгосрочные агенты умножают объём API-вызовов нелинейно. Система учёта, рассматривающая каждую «задачу» как единицу потребления, будет недооценивать реальные расходы на токены при активном Max Mode или Goal. Точная атрибуция затрат требует учёта на уровне каждого API-вызова, а не на уровне задачи.

На что обратить внимание

  • MiMo-V2-Flash и MiMo-V2-TTS начали автоматически переходить на ценообразование V2.5 18 июня; полное прекращение поддержки — 30 июня. Проверьте маппинги model ID уже сейчас.
  • MiMo Code v0.1 — ранний релиз; ограниченный синтаксис командной строки для вызовов инструментов (снижающий overhead токенов по сравнению с JSON) запланирован для будущей миграции и пока не применяется.
  • Max Mode сейчас является экспериментальной функцией и включается вручную через конфигурацию.
  • GitHub-репозиторий MiMo Code открыт под MIT — поддерживает self-hosted развёртывание с любым OpenAI-compatible backend.

Routing-команды, оценивающие долгосрочные coding agent'ы, должны включить в свои routing- и cost-модели в качестве первоклассных параметров: выбор модели для ролей worker и судьи, множитель токенов Max Mode, а также запас по rate limit у provider.

GPT-5.6 Sol устойчивость к prompt injection политика маршрутизации AI-операторы

GPT-5.6 Sol и устойчивость к prompt injection: что результаты GPT-Red означают для вашей политики маршрутизации

GPT-Red от OpenAI сделал GPT-5.6 Sol в 6 раз устойчивее к prompt injection. Для операторов, чьи агентные pipeline обрабатывают email, веб-контент или вызовы сторонних инструментов, этот разрыв — теперь routing-решение.

источник OpenAI
Абстрактная схема маршрутизации: уровни вычисления, памяти и эволюции в архитектуре долгосрочного coding agent

Архитектура MiMo Code для долгосрочных задач: что трёхуровневая модель Xiaomi значит для политики маршрутизации оператора

Coding agent MiMo Code от Xiaomi решает проблему непрерывности состояния в многошаговых задачах с помощью параллельного сэмплирования, checkpoint-памяти и оркестрации как кода. Разбираем, что это значит для операторского routing.

источник Xiaomi MiMo
Помощь и контакты