Что такое параметры языковой модели и почему DeepSeek бывает 7B, 70B и 405B

~ 10 мин


Введение

Любая новость про нейросети сопровождается загадочными индексами: 7B, 70B, 405B, 671B. Большинство читателей воспринимает их как номера версий — будто модель «405B» просто новее, чем «7B». На самом деле буква B означает billion — миллиард — и показывает количество обучаемых числовых коэффициентов внутри сети. Именно эти коэффициенты называют параметрами, и их количество определяет всё: от способности модели рассуждать до минимального объёма видеопамяти сервера. В этой статье команда СервакМастер подробно объясняет, что такое параметры, почему чем их больше — тем сложнее инфраструктура и как правильно подбирать оборудование под конкретный размер модели.


Параметры модели: что это такое на практике

Нейронная сеть — это многослойная структура из искусственных нейронов. Нейроны связаны между собой, и сила каждой связи закодирована числом — это и есть параметр. В процессе обучения система просматривает триллионы токенов текста и миллиарды раз корректирует эти числа, добиваясь всё более точных ответов. К моменту, когда обучение завершается, параметры фиксируются — модель «заморожена». При инференсе (то есть при работе с пользователем) никакого дополнительного обучения не происходит: входной запрос просто пропускается через миллиарды зафиксированных весов, и на выходе появляется ответ.

Технически параметры делятся на два типа:

  • Веса (weights) — коэффициенты, управляющие тем, насколько один нейрон активирует другой.
  • Смещения (biases) — константы, сдвигающие порог активации нейрона.

Вместе они формируют то, что можно назвать «закодированным знанием» модели. Аналогия: если бы человек хранил свой опыт не как образы и воспоминания, а как числовые зависимости между понятиями — «апельсин близко к "фрукт", далеко от "металл"» — вот это и были бы параметры.


Почему параметров должны быть миллиарды

Язык — принципиально многоуровневая структура. Чтобы понять смысл одного предложения, система должна одновременно учитывать орфографию, синтаксис, семантику, контекст предыдущих реплик и культурный фон. Каждый уровень абстракции требует отдельного набора связей, а каждая связь — своего параметра.

Вот как примерно распределяются задачи по слоям:

  • Начальные слои — обрабатывают отдельные символы, учатся различать буквы, цифры, знаки препинания.
  • Средние слои — выявляют слова, части речи, базовые синтаксические конструкции.
  • Глубокие слои — работают с семантикой: намерением автора, логическими связями, многошаговыми рассуждениями.

Чем длиннее контекст, который нужно удержать, и чем сложнее задача — тем глубже должна быть сеть и тем больше в ней параметров.


Размер модели и реальные возможности

Практика показывает следующее соответствие между размером модели и её способностями:

  • 3B — годится для несложных вопросов и коротких генеративных задач. Помещается на смартфон или слабый ноутбук.
  • 7B — уверенно ведёт диалог, понимает нюансы, способна к базовым рассуждениям. Достаточно одной игровой видеокарты с 16–24 ГБ VRAM.
  • 13B–30B — заметно лучше в аналитике, качественнее генерирует код, удерживает более длинный контекст.
  • 70B — полноценные многошаговые рассуждения, глубокий технический анализ, работа с большими объёмами текста. Нужны несколько GPU.
  • 405B — выходит за рамки буквального понимания: улавливает подтекст, ведёт сложные дискуссии, качественно решает нестандартные задачи. Требует мощного GPU-кластера.

Почему «больше параметров» не равно «умнее»

Простая экстраполяция («добавим ещё параметров — получим лучшую модель») не работает. Здесь важны несколько факторов.

Качество архитектуры. Хорошо спроектированная сеть меньшего размера может превзойти плохо настроенную большую. Например, DeepSeek R1 с 70 миллиардами параметров по ряду задач опережает более ранние модели с 175 миллиардами. Эффективность использования параметров — не менее важная характеристика, чем их количество.

Специализация. Модель на 7B, дообученная на конкретном предметном домене (юридические документы, медицинские тексты, узкоспециализированный код), нередко превосходит общую модель на 70B в этой нише — потому что её параметры «заточены» именно под нужные паттерны.

Технология Mixture of Experts (MoE). Вместо того чтобы задействовать все параметры при каждом запросе, MoE-архитектура активирует лишь нужное подмножество «экспертных» блоков. DeepSeek с 671B параметрами использует именно MoE: в реальных вычислениях участвуют лишь около 37 миллиардов параметров из 671B. Это кардинально снижает требования к VRAM.

Качество данных. Модель, обученная на тщательно отфильтрованных и размеченных данных, обходит конкурентов, которых «кормили» сырым интернетом — даже при меньшем числе параметров.

Крайний пример избыточности — модель Ling-1T (InclusionAI, дочерняя структура Alibaba) с одним триллионом параметров. Для её запуска требуется около 2 ТБ видеопамяти. Практического применения она так и не нашла — просто не существует инфраструктуры, которую реально можно собрать под такую нагрузку без космических затрат.


Параметры и память: математика VRAM

Каждый параметр — это конкретное число в памяти GPU. Размер числа зависит от типа данных:

  • float32 — 4 байта на параметр (используется при обучении).
  • float16 / bfloat16 — 2 байта (стандарт для инференса).
  • int8 — 1 байт (квантизация с небольшой потерей качества).
  • int4 — 0,5 байта (агрессивная квантизация, заметно снижает требования к VRAM).

Посчитаем требования для моделей DeepSeek при float16:

Модель Параметры VRAM при float16 VRAM при int8
DeepSeek 7B 7B ~14 ГБ ~7 ГБ
DeepSeek 70B 70B ~140 ГБ ~70 ГБ
DeepSeek 405B 405B ~810 ГБ ~405 ГБ
DeepSeek 671B (MoE) 671B (активно ~37B) ~350 ГБ ~175 ГБ

Эти цифры объясняют, почему GPU-ускорители с 80–141 ГБ видеопамяти (NVIDIA H100, H200, AMD Instinct MI300X, MI355X) стали стандартом для серьёзного ИИ-инференса. Для самых крупных моделей карты объединяют через NVLink или AMD Infinity Fabric, чтобы они работали как единое адресное пространство памяти.

В СервакМастер при проектировании GPU-серверов под задачи ИИ мы в первую очередь рассматриваем три параметра: суммарный объём VRAM, топологию межкарточного соединения и пропускную способность шины. Без правильно спроектированной инфраструктуры даже идеальная модель не сможет реализовать свой потенциал.


Как параметры влияют на инференс

Когда модель отвечает на запрос, она генерирует токены — слова или их части — один за другим. При каждом шаге система обращается ко всем зафиксированным параметрам. Именно поэтому скорость чтения видеопамяти важнее вычислительной мощности GPU: параметры нужно молниеносно считывать, а не вычислять заново.

Несколько техник ускоряют этот процесс:

  • KV-Cache — кэширует вычисленные ключи и значения механизма внимания, чтобы не пересчитывать весь контекст при генерации каждого нового токена.
  • FlashAttention — оптимизированная реализация механизма внимания, снижающая потребление памяти и повышающая пропускную способность.
  • Квантизация (int8/int4) — переводит веса в форматы с меньшим числом бит, уменьшая объём VRAM в два-четыре раза при приемлемых потерях точности.
  • Tensor Parallelism — распределяет вычисления матриц весов между несколькими GPU, линейно ускоряя инференс.

Если использовать образную аналогию: параметры — это фонд энциклопедии, а инференс — это скорость, с которой консультант находит нужную статью и формулирует ответ. Чем богаче фонд и быстрее доступ — тем ценнее такой консультант.


Практические рекомендации по подбору оборудования

Зная количество параметров целевой модели, можно сразу оценить минимальные требования к железу.

Модель Минимальная VRAM Один из вариантов железа
DeepSeek 7B 14 ГБ 1× NVIDIA RTX 4090 (24 ГБ) или A10 (24 ГБ)
DeepSeek 70B 140 ГБ 2× NVIDIA A100 80G или 2× H100 80G
DeepSeek 405B 810+ ГБ Кластер из 8–16× H100 / H200
DeepSeek 671B (MoE) ~350 ГБ 4–8× H100 / H200 — MoE снижает активную нагрузку

Помимо VRAM важно учитывать:

  • Пропускную способность памяти — именно она определяет скорость генерации токенов.
  • Межкарточную топологию — NVLink существенно быстрее PCIe при работе нескольких GPU вместе.
  • Систему охлаждения и питания — GPU уровня H100 потребляет до 700 Вт, и восемь таких карт в стойке требуют продуманного теплоотвода.

Итог

Параметры языковой модели — это её накопленный опыт, закодированный в миллиардах числовых коэффициентов. Каждый параметр хранит крошечный фрагмент закономерности, а вместе они дают модели способность понимать язык и рассуждать. Количество параметров напрямую определяет требования к серверной инфраструктуре: объём видеопамяти, межпроцессорную связность, мощность блоков питания и систему охлаждения.

При этом размер — не единственный критерий. Архитектура, данные обучения, квантизация и специализированное дообучение позволяют небольшим моделям уверенно конкурировать с гигантами в конкретных прикладных задачах.

В СервакМастер мы подходим к числам вроде «7B» или «405B» как к техническим спецификациям с конкретными требованиями к железу — точно так же, как к тактовой частоте процессора или объёму ОЗУ. Если вы планируете развернуть языковую модель на собственных мощностях, свяжитесь с нами — подберём оптимальную конфигурацию GPU-сервера под вашу модель и нагрузку.

В блоге СервакМастер также доступны материалы о токенах, механизме KV-Cache, алгоритме FlashAttention и квантизации — всё в привязке к реальным серверным платформам.