В ходе 440 тестов три 8B модели, генерировавшие SQL и выбиравшие инструменты на лету, не смогли выполнить контракт ответа и доказательств ни разу. Qwen3-8B, интерпретировавший намерение и при этом использующий детерминированную политику для выполнения утверждённой программы, успешно выполнил контракт 110 раз подряд. Результат относится к конкретной конфигурации и не доказывает невозможность успеха runtime-агентов в других дизайнах.
Runtime-планирование провалило тесты аналитики
Три 8B модели с runtime-planning не выполнили контракт ответа и доказательств ни разу из 330 эпизодов. Policy-executed анализатор успешно выполнил контракт 110 из 110 раз на всех тестовых наборах данных.
Источник: arxiv.org
Открыть в ArenaPulse