Современные визуально-языковые модели (VLM) способны лишь частично анализировать графики, что затрудняет работу с научными, деловыми и политическими данными. Основная проблема — отсутствие масштабных и разнообразных наборов данных для обучения и тестирования.
Исследователи предложили решение в виде ChartNet — мультимодального датасета, предназначенного для обучения моделей анализу и интерпретации графиков. Набор данных разработан для повышения эффективности работы VLM с визуальной информацией.