Универсальная языковая модель умеет многое, но в конкретной компании часто оказывается бесполезной: она не знает вашу внутреннюю документацию, не говорит в корпоративном стиле и путается в отраслевых терминах. Крупные разработчики стремятся к максимальной универсальности, а бизнесу нужна специализация. Решение называется дообучением, или fine-tuning: готовую модель «затачивают» под свои задачи. Благодаря LoRA, QLoRA и другим PEFT-методам эта процедура стала доступным стандартом и не требует кластера. Ниже разберём, что такое fine-tuning, какие у него виды, как готовить данные, какое железо нужно и когда лучше взять RAG.

Что такое дообучение

Дообучение — это дополнительное обучение уже предобученной базовой модели на небольшом узкоспециализированном наборе данных. Задача не в том, чтобы обучать сеть с нуля. Нужно адаптировать её обширные знания под требования конкретного домена.

Хорошая аналогия — опытный повар, который осваивает новую кухню. Нарезка, варка и жарка у него уже отточены, остаётся выучить новые рецепты и ингредиенты. Так и дообученная модель сохраняет фундаментальные способности, но свободно оперирует специальной терминологией и понимает контекст вашего бизнеса. Универсальный собеседник превращается в узкопрофильного специалиста: если сравнивать с ножами, получается не дешёвый мультитул, а качественный швейцарский нож под вашу задачу.

Виды и методы fine-tuning

Современные методики позволяют выбрать баланс между качеством, стоимостью и ресурсами.

Полное дообучение (Full Fine-Tuning)

Обновляются все без исключения параметры модели. Метод требует огромных вычислительных мощностей (десятки GPU) и много времени. Есть и риск «катастрофического забывания»: осваивая новые данные, модель теряет часть общих знаний. Из-за этого сегодня полное дообучение применяют очень редко.

Параметрически-эффективное дообучение (PEFT)

PEFT демократизировал тонкую настройку. Обучается лишь крошечная доля параметров, иногда около 1% от общего числа, а эффективность достигает 95% от Full Fine-Tuning. К семейству относятся следующие подходы.

  • LoRA (Low-Rank Adaptation). Исходную матрицу весов не меняют, а добавляют к ней две малые низкоранговые матрицы. После обучения их объединяют с исходными весами. Потребление памяти заметно падает, обучение ускоряется, и на одном GPU можно обучать модели, для которых раньше нужен был целый ИИ-кластер.
  • QLoRA (Quantized LoRA). Развитие LoRA с квантованием: исходная модель сжимается до 4-битной точности, и требования к памяти падают ещё сильнее. Например, модель на 8 миллиардов параметров можно дообучить на видеокарте всего с 24 ГБ памяти. Это делает технологию доступной энтузиастам и небольшим командам.
  • Adapter Layers. Небольшие нейросети, встроенные между слоями трансформера.
  • Spectrum. Новый метод, который находит и избирательно дообучает только самые информативные слои модели. Особенно хорош в распределённых вычислениях.

Обучение на инструкциях и SFT

Контролируемое дообучение (SFT) — общий термин для обучения на размеченных данных. Самый известный вариант — Instruction Tuning: модель видит множество примеров вида «инструкция, контекст, желаемый ответ», например «Переведи этот текст». Новым фактам это почти не учит, зато формирует умение точно следовать указаниям и заметно улучшает общение модели с пользователем.

Метод Что обучается Ресурсы
Full Fine-Tuning все параметры десятки GPU, риск катастрофического забывания
LoRA две малые низкоранговые матрицы один GPU
QLoRA то же, база сжата до 4 бит 24 ГБ памяти для модели на 8 млрд параметров
Adapter Layers / Spectrum вставленные адаптеры или наиболее информативные слои умеренные, удобно для распределённых вычислений
Instruction Tuning / SFT поведение на примерах инструкций зависит от выбранного метода

Подготовка данных

Качество датасета определяет около 90% успеха. Недостаточно свалить в кучу документы, данные нужно подготовить.

Источники

  • публичные датасеты с платформы Hugging Face Datasets;
  • собственные корпоративные данные: исторические переписки, документация, базы знаний;
  • синтетические данные, сгенерированные другими LLM. Подход набирает популярность, потому что быстро даёт большие объёмы размеченных примеров.

Обязательные этапы

Собранный материал проходит строгий отбор. Нужно очистить его от шума и дубликатов, проверить баланс тем и типов задач и строго контролировать приватность. Утечка персональных или коммерчески чувствительных сведений во время дообучения может обернуться серьёзными последствиями.

Разбиение на выборки

Стандартная схема — три части.

  1. Обучающая (train) — на ней модель учится.
  2. Валидационная (validation) — помогает следить за прогрессом и подбирать гиперпараметры.
  3. Тестовая (test) — объективно оценивает итоговое качество на данных, которых модель раньше не видела.

Отдельно проверяют data leakage: если информация из тестовой выборки случайно попала в обучающую, результаты окажутся завышенными и необъективными.

Где применяют дообученные модели

  • Корпоративные чат-боты. Ассистент говорит с клиентом на его языке, использует внутреннюю терминологию и точно следует шаблонам общения. Модели можно задать тон: строже для юридического отдела, мягче и поддерживающе для службы заботы о клиентах.
  • Финансы и право. Здесь критичны точность и актуальность. Модель анализирует новые рыночные данные, готовит инвестиционные обзоры, проводит первичный разбор юридических документов и судебных прецедентов с корректной профессиональной лексикой.
  • Здравоохранение. Медицинские ассистенты понимают специальную терминологию, анализируют истории болезней и помогают готовить диагнозы. Знания из медицинских журналов и руководств «вкладываются» в модель, а общие языковые способности остаются.

В роли базовых моделей для таких задач чаще всего берут открытые архитектуры: Qwen, LLaMA и DeepSeek. Они хорошо поддаются адаптации описанными методами.

Какое железо нужно для fine-tuning

Требования зависят от метода. Полное дообучение крупных моделей по-прежнему требует выделенных серверов с ускорителями вроде NVIDIA H200 или B200 и высокоскоростной памятью HBM3 объёмом в сотни гигабайт.

С LoRA и QLoRA картина меняется. Модели с миллиардами параметров можно дообучать на одной мощной видеокарте, например NVIDIA RTX 4090/5090 с 24 ГБ памяти. Без PEFT обучение на обычной карте упирается в память GPU уже на первом этапе и растягивается на часы. Дополнительно снижают требования и ускоряют процесс современные оптимизации: вычисления в FP8/FP4, Flash-Attention и градиентные чекпоинты.

Практический вывод для выбора оборудования:

  • для экспериментов, прототипов и небольших моделей хватит одного GPU с 24 ГБ памяти и QLoRA;
  • для регулярного дообучения нескольких моделей и инференса рядом удобнее многопроцессорный GPU-сервер;
  • для полного дообучения крупных моделей нужны серверы с H200/B200.

Подобрать конфигурацию под вашу задачу можно в разделах ИИ-серверы и серверы, а если сложно определиться, напишите нам: инженеры «СервакМастер» помогут посчитать нужный объём памяти и число ускорителей.

Fine-tuning или RAG

Выбор между дообучением и Retrieval-Augmented Generation (RAG) — не «или-или», а поиск сочетания двух взаимодополняющих подходов.

Fine-Tuning RAG
Суть знания и стиль закладываются в модель постоянно модель получает доступ к внешней, постоянно обновляемой базе знаний в момент запроса
Образ модель «умнее», рассуждает как эксперт модель «осведомлённее», «подглядывает» в документы
Когда подходит глубокое понимание контекста, особый стиль, низкая задержка (нет запросов к внешним базам при генерации) быстро меняющаяся информация: новости, курсы акций, обновляемая документация; нужны ссылки на источник для проверки

Выигрышная стратегия — гибридная. Дообучите модель на стабильных, редко меняющихся знаниях и корпоративном стиле, а свежие данные подключите через RAG. Например, чат-бот, дообученный на HR-документах, знает общую политику и философию компании, а через RAG использует информацию из только что вышедшего отчёта.

Выводы

Fine-tuning утвердился как основной стандарт превращения универсальной языковой модели в точный инструмент для бизнес-задач. Благодаря LoRA, QLoRA и PEFT технология перестала быть привилегией ИИ-гигантов, а открытые модели и богатые фреймворки упростили процесс. RAG дополняет дообучение, а не отменяет: вместе они дают модель с глубокими внутренними знаниями и доступом к актуальной информации. Какую комбинацию выбрать, зависит от задачи, и именно гибкое сочетание подходов ведёт к по-настоящему полезным ИИ-решениям.