🤖 Параметры модели и нагрузки ← К Сайзеру
ℹ️ Как пользоваться: заполните параметры вашей модели и сценария нагрузки. Калькулятор рассчитает требования к GPU, цену 1M токенов на своём железе и сравнит с API. Все формулы основаны на статье Habr.
🧠 Тип модели: MoE-модели (Qwen3 MoE, DeepSeek V3) при равном размере в 3–4× быстрее — читаются только активные параметры
Для dense = полные параметры. Для MoE: Qwen3-30B → 3B, DeepSeek V3 → 21B
Qwen3-30B: 48, Llama 3 70B: 80, GPT-2: 24
Обычно 512 (после группировки голов внимания)

📈 Параметры нагрузки:
Параллельные запросы через vLLM батчинг

💰 Параметры окупаемости:
Сколько месяцев готовы ждать, пока своя GPU станет дешевле API. Обычно 12–36 мес. Если точка окупаемости дальше — выгоднее облако.
Сколько млн токенов генерируете через API сейчас. Если не знаете — оставьте 50 (типично для команды из 10 чел)
Насколько растёт потребление токенов месяц к месяцу. 5% — стабильная команда, 15% — растущий продукт
На сколько месяцев вперёд строить график. 36 мес — типичный горизонт закупки сервера
📊 Требования к железу и стоимость

Заполните параметры модели и нажмите «Рассчитать требования»

💰 Сравнение с облачными API

Сначала рассчитайте требования к железу

💡 Как читать таблицу:
Цена 1M токенов на своём железе — зависит от утилизации и контекста. 1 ₽ — это идеальная синтетика; 20 726 ₽ — личный ассистент с утилизацией 2%.
Точка безубыточности — сколько млн токенов в месяц нужно генерировать, чтобы своя карта стала дешевле API.
Окупаемость — через сколько месяцев совокупные затраты на свою GPU станут меньше, чем суммарные затраты на API (с учётом роста потребления).
API дешевле = зелёная строка (рекомендация: облако). Своя карта дешевле = ваша экономия.
• Цены API актуальны на 31 июля 2026 года, курс USD = 79,86 ₽. Российские тарифы указаны с НДС, зарубежные — без (добавьте 22% как налоговому агенту).
Важно: расчёты — верхняя теоретическая граница. Реальная производительность ~30–35% от расчётной.
📈 График окупаемости: своя GPU vs API

Сначала рассчитайте требования к железу

💡 Как читать график:
Синяя линия (API) — совокупные затраты на токены через API. Растёт каждый месяц: потребление увеличивается на заданный %, цена фиксированная.
Коричневая линия (своя GPU) — совокупные затраты на своё железо. Стартует с капекс (покупка карты + обвязки), затем растёт линейно за счёт электричества и амортизации.
Точка пересечения — месяц, начиная с которого своя GPU становится дешевле API. До этого — переплата, после — экономия.
Зелёная зона — экономия от своей GPU после окупаемости. Красная зона — переплата до окупаемости.
• Если линии не пересекаются в пределах горизонта планирования — API всегда дешевле, своя GPU не окупается.
🎯 Рекомендации по архитектуре
💡 Расширенные рекомендации (ИИ-инференс):
Одна карта vs несколько: многокарточная сборка имеет смысл ТОЛЬКО когда модель физически не влезает в одну карту. Как способ сэкономить на гигабайте не работает почти никогда.
NVLink: у RTX 3090 есть, у 4090/5090 уже нет. Без NVLink межкарточный обмен через PCIe в 10× медленнее внутренней памяти.
Питание: 4× RTX 3090 = 1,5–2 кВт под нагрузкой, БП от 2000 Вт, розетка 16А. Вместе с чайником — уже не вытягивает.
Охлаждение: в 4-слотовой сборке карты душат друг друга. Нужен серверный корпус с продухами.
vLLM vs Ollama: при 8 одновременных пользователях vLLM даёт 187 ток/с vs 82 у Ollama. Чем больше параллельных запросов — тем сильнее расходятся.
Квантизация для агентов: для tool calling и structured extraction держите Q6 и выше, KV-кэш не ниже Q8. Иначе ломается формат JSON.
Базовая RAM сервера: 128 ГБ минимум — иначе придётся ждать загрузки весов и материться.
NVMe: обязателен для быстрой загрузки моделей. SATA SSD — узкое место при загрузке 70B+ моделей.
Кириллица в токенизаторе: западные токенизаторы (o200k у GPT-4o) расходуют в 1,27× больше токенов на русский текст. У YandexGPT — в 1,5× эффективнее. Считайте цену ваших символов, а не токенов.
🖥️ Справочник GPU (цены на июль 2026)
GPUVRAMЦена₽/ГБС обвязкой₽/час₽/мес 24/7Пропуск. памяти
RTX 309024 ГБ92 000 ₽3 833 ₽242 000 ₽9,0 ₽6 573 ₽936 ГБ/с
RTX 4090 (моддинг 48 ГБ)48 ГБ549 930 ₽11 457 ₽700 000 ₽18,9 ₽13 809 ₽1 008 ГБ/с
RTX 509032 ГБ429 990 ₽13 437 ₽580 000 ₽17,0 ₽12 435 ₽1 792 ГБ/с
RTX PRO 6000 (Ada)96 ГБ1 050 000 ₽10 938 ₽1 200 000 ₽29,2 ₽21 339 ₽2 880 ГБ/с
A100 80GB (SXM)80 ГБ~2 400 000 ₽30 000 ₽3 000 000 ₽~70 ₽~51 100 ₽2 039 ГБ/с
H100 80GB (SXM)80 ГБ~3 800 000 ₽47 500 ₽4 500 000 ₽~110 ₽~80 300 ₽3 350 ГБ/с

Цены актуальны на 31 июля 2026. Курс USD = 79,86 ₽. «С обвязкой» = карта + платформа + БП + 128 ГБ RAM + NVMe (~150 тыс ₽).

Правило выбора: до 24 ГБ — RTX 3090 (дешевле всех за ГБ). 24–48 ГБ — моддинговая 4090. Свыше 48 ГБ — профессиональная линейка или облако.