Aleph Alpha провела бенчмарк моделей Qwen, DeepSeek и Kimi по 967 чувствительным темам. Оценка системы компании показала, что лишь 17-41% ответов были сбалансированными, остальные повторяли официальную позицию или отказывались отвечать.
Прокитайский уклон проявлялся даже в ответах на вопросы, не связанные с Китаем, а также в моделях, обученных на данных китайских вендоров.