За последний год появилось множество заголовков о стоимости обучения LLM, таких как «Лучший ChatGPT за $100» или «китайцы обучили GPT-4 за шесть миллионов». Однако эти цифры относятся к разным вещам. За словами «обучить LLM» скрывается огромный разброс цен, от десятков долларов на одной карте до миллиарда на передовом фронте.
Работа CTO ML-команды показывает, что расчеты по обучению с нуля, дообучению или использованию открытых весов часто не совпадают с ожиданиями заказчиков. В статье представлена вся «лестница» стоимостей с объяснением, что реально обучить на RTX 5090, где начинается аренда кластера, из чего складывается смета передовых моделей и почему «модель за $6 млн» и «компания с инфраструктурой на миллиард» могут быть одновременно правдой.