ByteDance Seed представила HarnessDev — методологию, где модель создает и дорабатывает собственный harness. Тест Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max и Seed 2.0 Pro показал, что только 34 из 64 улучшений в harness обобщились на скрытых задачах.
Разрыв в производительности между моделями зависит от домена: Opus 4.8 лидирует в написании кода, Gemini 3.1 Pro — в поиске, но оба сильно отстают от эталона в задачах поиска.