Автор представляет четвертую часть серии статей по созданию и обучению decoder-only LLM с нуля. Статья полностью посвящена этапу SFT (Supervised Fine-Tuning), который включает дообучение модели на датасете формата «вопрос-ответ». Цель этого этапа — научить модель вести диалог с пользователем, а не только продолжать текст.
Этот этап обучения направлен на адаптацию модели для интерактивного взаимодействия, в отличие от базовых возможностей генерации текста.