Модель объединяет 32B-параметровый VLM-бэкбон на основе NVIDIA Cosmos 3 Super Reasoner и 2.3B-параметровый диффузионный декодер действий. На бенчмарке LingoQA она набрала 79.2 балла, заняв первое место среди почти 40 моделей.
Веса распространяются под лицензией OpenMDW-1.1, а исходный код — под Apache 2.0. Модель обрабатывает многокамерное видео, текст и историю эгомоции, выдавая траекторию, объяснение причинно-следственных связей, мета-действие и другие выходы.