Проведено первое всестороннее исследование влияния водяных знаков на работу больших языковых моделей (LLM) и визуальных языковых моделей (VLM) в медицинской сфере. Были протестированы пять схем водяных знаков на одиннадцати LLM и семи VLM при выполнении различных задач клинического рассуждения, как текстовых, так и мультимодальных.
Результаты выявили значительное ухудшение качества работы моделей из-за водяных знаков, проявляющееся в разных формах: искажение лексики, появление ложной терминологии, усиление неверной атрибуции или пропуска выводов по изображениям. Исследователи подчеркивают, что отсутствие специализированных медицинских бенчмарков и использование общих агрегированных метрик могут скрывать критически важные для медицины сбои, вызванные водяными знаками.