Skild AI выпустила модель S1, которая позволяет роботам выполнять новые многошаговые задачи после просмотра одного видео. Модель достигает 66% успешности выполнения таких задач, в то время как у аналогов этот показатель составляет 9%.
S1 использует технологию in-context learning, интерпретируя видео как входные данные для понимания и выполнения задачи без обновления весов или специфического дообучения. Разработка и исследования проводились на инфраструктуре NVIDIA AI.