Модель DeepSeek-V4.1-Flash является мультимодальной Mixture-of-Experts с 552B параметрами и 196B дополнительных Engram параметров. Глобальный KV кэш составляет 890 байт на токен, что примерно в 437 раз меньше, чем у DeepSeek-V1. Веса модели открыты под лицензией MIT.
DeepSeek AI выпустила DeepSeek-V4.1-Flash с 1M контекстом и FP4 KV Cache
DeepSeek AI представила модель DeepSeek-V4.1-Flash с контекстным окном в 1 миллион токенов и глобальным KV кэшем размером 890 байт на токен.
Источник: marktechpost.com
Открыть в ArenaPulse