Что такое параметры языковой модели и почему DeepSeek бывает 7B, 70B и 405B
~ 10 мин
Введение
Любая новость про нейросети сопровождается загадочными индексами: 7B, 70B, 405B, 671B. Большинство читателей воспринимает их как номера версий — будто модель «405B» просто новее, чем «7B». На самом деле буква B означает billion — миллиард — и показывает количество обучаемых числовых коэффициентов внутри сети. Именно эти коэффициенты называют параметрами, и их количество определяет всё: от способности модели рассуждать до минимального объёма видеопамяти сервера. В этой статье команда СервакМастер подробно объясняет, что такое параметры, почему чем их больше — тем сложнее инфраструктура и как правильно подбирать оборудование под конкретный размер модели.
Параметры модели: что это такое на практике
Нейронная сеть — это многослойная структура из искусственных нейронов. Нейроны связаны между собой, и сила каждой связи закодирована числом — это и есть параметр. В процессе обучения система просматривает триллионы токенов текста и миллиарды раз корректирует эти числа, добиваясь всё более точных ответов. К моменту, когда обучение завершается, параметры фиксируются — модель «заморожена». При инференсе (то есть при работе с пользователем) никакого дополнительного обучения не происходит: входной запрос просто пропускается через миллиарды зафиксированных весов, и на выходе появляется ответ.
Технически параметры делятся на два типа:
- Веса (weights) — коэффициенты, управляющие тем, насколько один нейрон активирует другой.
- Смещения (biases) — константы, сдвигающие порог активации нейрона.
Вместе они формируют то, что можно назвать «закодированным знанием» модели. Аналогия: если бы человек хранил свой опыт не как образы и воспоминания, а как числовые зависимости между понятиями — «апельсин близко к "фрукт", далеко от "металл"» — вот это и были бы параметры.
Почему параметров должны быть миллиарды
Язык — принципиально многоуровневая структура. Чтобы понять смысл одного предложения, система должна одновременно учитывать орфографию, синтаксис, семантику, контекст предыдущих реплик и культурный фон. Каждый уровень абстракции требует отдельного набора связей, а каждая связь — своего параметра.
Вот как примерно распределяются задачи по слоям:
- Начальные слои — обрабатывают отдельные символы, учатся различать буквы, цифры, знаки препинания.
- Средние слои — выявляют слова, части речи, базовые синтаксические конструкции.
- Глубокие слои — работают с семантикой: намерением автора, логическими связями, многошаговыми рассуждениями.
Чем длиннее контекст, который нужно удержать, и чем сложнее задача — тем глубже должна быть сеть и тем больше в ней параметров.
Размер модели и реальные возможности
Практика показывает следующее соответствие между размером модели и её способностями:
- 3B — годится для несложных вопросов и коротких генеративных задач. Помещается на смартфон или слабый ноутбук.
- 7B — уверенно ведёт диалог, понимает нюансы, способна к базовым рассуждениям. Достаточно одной игровой видеокарты с 16–24 ГБ VRAM.
- 13B–30B — заметно лучше в аналитике, качественнее генерирует код, удерживает более длинный контекст.
- 70B — полноценные многошаговые рассуждения, глубокий технический анализ, работа с большими объёмами текста. Нужны несколько GPU.
- 405B — выходит за рамки буквального понимания: улавливает подтекст, ведёт сложные дискуссии, качественно решает нестандартные задачи. Требует мощного GPU-кластера.
Почему «больше параметров» не равно «умнее»
Простая экстраполяция («добавим ещё параметров — получим лучшую модель») не работает. Здесь важны несколько факторов.
Качество архитектуры. Хорошо спроектированная сеть меньшего размера может превзойти плохо настроенную большую. Например, DeepSeek R1 с 70 миллиардами параметров по ряду задач опережает более ранние модели с 175 миллиардами. Эффективность использования параметров — не менее важная характеристика, чем их количество.
Специализация. Модель на 7B, дообученная на конкретном предметном домене (юридические документы, медицинские тексты, узкоспециализированный код), нередко превосходит общую модель на 70B в этой нише — потому что её параметры «заточены» именно под нужные паттерны.
Технология Mixture of Experts (MoE). Вместо того чтобы задействовать все параметры при каждом запросе, MoE-архитектура активирует лишь нужное подмножество «экспертных» блоков. DeepSeek с 671B параметрами использует именно MoE: в реальных вычислениях участвуют лишь около 37 миллиардов параметров из 671B. Это кардинально снижает требования к VRAM.
Качество данных. Модель, обученная на тщательно отфильтрованных и размеченных данных, обходит конкурентов, которых «кормили» сырым интернетом — даже при меньшем числе параметров.
Крайний пример избыточности — модель Ling-1T (InclusionAI, дочерняя структура Alibaba) с одним триллионом параметров. Для её запуска требуется около 2 ТБ видеопамяти. Практического применения она так и не нашла — просто не существует инфраструктуры, которую реально можно собрать под такую нагрузку без космических затрат.
Параметры и память: математика VRAM
Каждый параметр — это конкретное число в памяти GPU. Размер числа зависит от типа данных:
- float32 — 4 байта на параметр (используется при обучении).
- float16 / bfloat16 — 2 байта (стандарт для инференса).
- int8 — 1 байт (квантизация с небольшой потерей качества).
- int4 — 0,5 байта (агрессивная квантизация, заметно снижает требования к VRAM).
Посчитаем требования для моделей DeepSeek при float16:
| Модель | Параметры | VRAM при float16 | VRAM при int8 |
|---|---|---|---|
| DeepSeek 7B | 7B | ~14 ГБ | ~7 ГБ |
| DeepSeek 70B | 70B | ~140 ГБ | ~70 ГБ |
| DeepSeek 405B | 405B | ~810 ГБ | ~405 ГБ |
| DeepSeek 671B (MoE) | 671B (активно ~37B) | ~350 ГБ | ~175 ГБ |
Эти цифры объясняют, почему GPU-ускорители с 80–141 ГБ видеопамяти (NVIDIA H100, H200, AMD Instinct MI300X, MI355X) стали стандартом для серьёзного ИИ-инференса. Для самых крупных моделей карты объединяют через NVLink или AMD Infinity Fabric, чтобы они работали как единое адресное пространство памяти.
В СервакМастер при проектировании GPU-серверов под задачи ИИ мы в первую очередь рассматриваем три параметра: суммарный объём VRAM, топологию межкарточного соединения и пропускную способность шины. Без правильно спроектированной инфраструктуры даже идеальная модель не сможет реализовать свой потенциал.
Как параметры влияют на инференс
Когда модель отвечает на запрос, она генерирует токены — слова или их части — один за другим. При каждом шаге система обращается ко всем зафиксированным параметрам. Именно поэтому скорость чтения видеопамяти важнее вычислительной мощности GPU: параметры нужно молниеносно считывать, а не вычислять заново.
Несколько техник ускоряют этот процесс:
- KV-Cache — кэширует вычисленные ключи и значения механизма внимания, чтобы не пересчитывать весь контекст при генерации каждого нового токена.
- FlashAttention — оптимизированная реализация механизма внимания, снижающая потребление памяти и повышающая пропускную способность.
- Квантизация (int8/int4) — переводит веса в форматы с меньшим числом бит, уменьшая объём VRAM в два-четыре раза при приемлемых потерях точности.
- Tensor Parallelism — распределяет вычисления матриц весов между несколькими GPU, линейно ускоряя инференс.
Если использовать образную аналогию: параметры — это фонд энциклопедии, а инференс — это скорость, с которой консультант находит нужную статью и формулирует ответ. Чем богаче фонд и быстрее доступ — тем ценнее такой консультант.
Практические рекомендации по подбору оборудования
Зная количество параметров целевой модели, можно сразу оценить минимальные требования к железу.
| Модель | Минимальная VRAM | Один из вариантов железа |
|---|---|---|
| DeepSeek 7B | 14 ГБ | 1× NVIDIA RTX 4090 (24 ГБ) или A10 (24 ГБ) |
| DeepSeek 70B | 140 ГБ | 2× NVIDIA A100 80G или 2× H100 80G |
| DeepSeek 405B | 810+ ГБ | Кластер из 8–16× H100 / H200 |
| DeepSeek 671B (MoE) | ~350 ГБ | 4–8× H100 / H200 — MoE снижает активную нагрузку |
Помимо VRAM важно учитывать:
- Пропускную способность памяти — именно она определяет скорость генерации токенов.
- Межкарточную топологию — NVLink существенно быстрее PCIe при работе нескольких GPU вместе.
- Систему охлаждения и питания — GPU уровня H100 потребляет до 700 Вт, и восемь таких карт в стойке требуют продуманного теплоотвода.
Итог
Параметры языковой модели — это её накопленный опыт, закодированный в миллиардах числовых коэффициентов. Каждый параметр хранит крошечный фрагмент закономерности, а вместе они дают модели способность понимать язык и рассуждать. Количество параметров напрямую определяет требования к серверной инфраструктуре: объём видеопамяти, межпроцессорную связность, мощность блоков питания и систему охлаждения.
При этом размер — не единственный критерий. Архитектура, данные обучения, квантизация и специализированное дообучение позволяют небольшим моделям уверенно конкурировать с гигантами в конкретных прикладных задачах.
В СервакМастер мы подходим к числам вроде «7B» или «405B» как к техническим спецификациям с конкретными требованиями к железу — точно так же, как к тактовой частоте процессора или объёму ОЗУ. Если вы планируете развернуть языковую модель на собственных мощностях, свяжитесь с нами — подберём оптимальную конфигурацию GPU-сервера под вашу модель и нагрузку.
В блоге СервакМастер также доступны материалы о токенах, механизме KV-Cache, алгоритме FlashAttention и квантизации — всё в привязке к реальным серверным платформам.
