Какие GPU дают лучший баланс между скоростью генерации (tok/s), качеством моделей, которые реально влезают в память, и ценой — с учётом аномального рынка сентября 2026 года.
Контекст критически важен: сентябрь 2026 — худший момент для покупки GPU за последние 5 лет. Мировой дефицит DRAM/GDDR7 разогнал цены: RTX 5090 подорожал с $2,000 до ~$4,700–5,200 (медиана Newegg, август 2026), RTX PRO 6000 96GB — до $16,000 (вдвое дороже запуска), 16GB-карты среднего класса — на +30–40%.
Это разворачивает весь анализ: б/у-рынок, AMD и нестандартные решения впервые за долгое время выглядят рациональнее новых флагманов NVIDIA. Оценивайте покупки через этот призму.
Если не хочется читать весь анализ: вот три конфигурации, закрывающие 90% сценариев локального инференса. Подробное обоснование — в секциях 4–8.
Выбор GPU для LLM — это не «сколько TFLOPS». Генерация текста — почти полностью задача чтения весов из памяти. Понимание трёх метрик ниже объясняет 90% результатов бенчмарков.
Жёсткий потолок: модель, не поместившаяся в vRAM, «сваливается» в системную RAM, и скорость падает в 5–20 раз.
Правило: ~0.55 ГБ на 1 млрд параметров в Q4, плюс 1–4 ГБ на KV-кэш контекста.
27B Q4 ≈ 16 ГБ · 70B Q4 ≈ 40 ГБ
На каждом токене GPU перечитывает активные веса. Скорость генерации почти линейно следует за GB/s, а не за TFLOPS. Поэтому 5090 (1,792 ГБ/с) вдвое быстрее 4090 (1,008) на одной модели — и вдвое быстрее 3090 (936).
MoE-модель (gpt-oss, Qwen3.6-35B-A3B) активирует лишь 3–5 млрд параметров на токен, но хранит все 35–120 млрд. Итог: vRAM нужна как у большой модели, скорость — как у маленькой. Это главный тренд 2025–2026 и главный фактор в пользу больших объёмов vRAM.
Пример: RTX 3090, Qwen3.6-27B Q4 (≈17 ГБ): 936 ÷ 17 × 0.45 ≈ 25–35 tok/s — комфортно интерактивно. Та же модель на Tesla P40 (347 ГБ/с): ~10 tok/s — на грани терпения. Отсюда видно, почему «дешёвые 24 ГБ» без полосы не спасают.
О терминах: под «инференсом» (в запросе — «референс») понимается локальная генерация ответов моделью. «Качество» задаётся тем, какая модель помещается в vRAM и в каком квантовании: Q4_K_M почти без потерь, Q2–Q3 — заметная деградация. Поэтому vRAM — это не «спецификация», это и есть качество ответов.
AI-бум съел мировое производство DRAM. Память подорожала в 2–3 раза, и NVIDIA транслирует это в розницу: подъём цен волнами июнь→август 2026 (+3…+39% по моделям). Источники: Tom's Hardware (трекинг Newegg), TechSpot, TechPowerUp.
AMD RX 7900 XTX ($899, 24GB) — лучший новый 24GB-карт по цене: на ~70% дешевле RTX 5090 за ту же память. Intel Arc Pro B60/B70 ($649/$950) — 24–32 ГБ vRAM по цене gaming-карты, осмысленно в связках 2–4 штук. Tesla P40 ($240–350) — самый дешёвый вход в 24 ГБ вообще, несмотря на все компромиссы. Mac / Strix Halo — unified-память дорожает медленнее GDDR.
RTX 5090 — великолепная карта, купленная по MSRP в 2025-м; переоценённая по $4,700+ в 2026-м. 16GB-карты NVIDIA ($700–1,000) — средний класс стал худшей сделкой рынка: за 16 ГБ без полосы для MoE-эпохи. RTX PRO 6000 — $16,000 за 96 ГБ: карты размазаны по облакам, локальная покупка потеряла смысл для частника. Любой апгрейд ради +8 ГБ — сейчас переплата ×2 к нормальной цене.
Цены — США, сентябрь 2026 (street/б/у-рынок). Скорости — одиночный пользователь, llama.cpp/Ollama, Q4-квантование, короткий контекст. «Модель-цель» — крупнейший класс моделей, который карта держит на интерактивной скорости (25+ tok/s). Кликайте по заголовкам колонок для сортировки.
| Карта | vRAM | ППК, ГБ/с | Цена, $ | $ / ГБ vRAM | tok/s · 8B Q4 | Модель-цель | Вердикт |
|---|---|---|---|---|---|---|---|
| RTX 3090 (б/у)Ampere · 350 Вт | 24 ГБ | 936 | 1,000–1,300 | ~52 | ~85 | Qwen3.6-27B / Gemma 4 31B | 🏆 Главный выбор |
| RTX 5090Blackwell · 575 Вт | 32 ГБ | 1,792 | 4,700–5,200 | ~147 | ~220 | Qwen3.6-35B-A3B + контекст | Самая быстрая одиночная |
| 2× RTX 3090 (б/у)48 ГБ · 700 Вт | 48 ГБ | 936×2 | 2,000–2,600 | ~48 | ~85 | gpt-oss-120b целиком | 🏆 Максимум за деньги |
| RX 7900 XTXAMD · ROCm 7.2 · 355 Вт | 24 ГБ | 960 | ~899 | ~37 | ~95 | 27B Q4, 70B Q4 на 14–18 t/s | Лучший новый $/ГБ |
| RTX 4090 (б/у)Ada · 450 Вт | 24 ГБ | 1,008 | 1,800–2,200 | ~75 | ~120 | 27B Q4 (+30% скорости к 3090) | Если хочется быстрее 3090 |
| Intel Arc Pro B60Battlemage · 24 ГБ ECC | 24 ГБ | 456 | ~649 | ~27 | ~60 | 13–14B комфортно, 27B медленно | VRAM за копейки, но софт сырой |
| Intel Arc Pro B7032 ГБ ECC · 230 Вт | 32 ГБ | 608 | ~950 | ~30 | ~70 | 27B Q4 впритык-интерактивно | Дешёвые 32 ГБ / связки 4× |
| 4× Intel Arc Pro B60/B7096–128 ГБ суммарно | 96–128 ГБ | 608×4 | 2,600–3,800 | ~27–30 | ~70/карта | gpt-oss-120b на ~25–30 t/s | Бюджетный «фронтир-компьютер» |
| RTX 508016 ГБ · 300 Вт | 16 ГБ | 960 | 1,500–1,580 | ~94 | ~140 | gpt-oss-20b / Gemma 4 12B | Быстро, но 16 ГБ — мало в 2026 |
| RTX 5070 Ti16 ГБ · 300 Вт | 16 ГБ | 896 | 1,100–1,150 | ~69 | ~100 | gpt-oss-20b / 14B Q4 | Игровая карта, не LLM-карта |
| RTX 5060 Ti 16GB+39% к цене за полгода | 16 ГБ | 448 | 758–805 | ~49 | ~65 | gpt-oss-20b / 12–13B Q4 | Вход в CUDA, но переплата |
| RX 9070 XTAMD · RDNA4 · 16 ГБ | 16 ГБ | 640 | ~700 | ~44 | ~95 | gpt-oss-20b / 13B Q4 | Разумный вход в 16 ГБ |
| Tesla P40 (б/у)Pascal 2016 · поддержка CUDA заканчивается | 24 ГБ | 347 | 240–350 | ~13 | ~35 | batch/embeddings, вторая машина | Дёшево влезть, больно жить |
| Strix Halo mini-PCRyzen AI Max+ 395 · 128 ГБ shared | 128 ГБ | ~212 | 1,800–2,400 | ~16 | ~80 | MoE-модели до 120B, 10–20 t/s | MoE-король за деньги |
| Mac Studio M3 Ultra 128–192GB546 ГБ/с unified · ~200 Вт | 128–192 ГБ | 546 | 6,500–9,000 | ~34 | ~150* | 70B Q4: 8–15 t/s, GLM-5.1 влезает | Для больших MoE и тишины |
| RTX PRO 6000 96GBBlackwell · ECC · 300–600 Вт | 96 ГБ | 1,792 | ~16,000 | ~167 | ~245 | gpt-oss-120b: 170 tok/s (!) | Тех-совершенство, ценовое безумие |
* Mac Studio: tok/s указан для gpt-oss-20b (MLX), для 70B dense падает до 8–15 t/s — unified-память огромна, но полоса 546 ГБ/с ограничивает dense-модели. MoE на Mac раскрываются лучше. «ППК» — пропускная способность памяти. Полную детализацию по каждой карте — в карточках ниже.
Каждая точка — конфигурация. Ось X — цена (лог. шкала), ось Y — пропускная способность памяти (главный предиктор скорости генерации). «Идеальный баланс» — правый нижний угол: максимум ГБ/с за минимум долларов. Линия тренда помогает увидеть, кто над линией (переплата) и кто под ней (выгодная сделка).
Как читать: диаграмма показывает физику, а не маркетинг. Точка «4× Arc B60» стоит по совокупной полосе всех карт — в реальности это 4 независимых GPU (тензор-параллеллизм с однойCCL/vLLM), что даёт агрегированную скорость на MoE-моделях, но не на dense. Аналогично 2×3090: удвоение полосы работает на split-моделях в llama.cpp почти линейно для MoE, и с потерями 10–20% для dense.
Развёрнутый разбор каждой значимой конфигурации: что получите, чем заплатите, какие модели запускать.
Железо — средство; интеллект — это модели. Ландшафт сентября 2026: Qwen3.6 и Gemma 4 доминируют в consumer-тирах, OpenAI gpt-oss — лучший «фронтир за копейки», Kimi/GLM — вершина, недостижимая локально. Данные: Onyx leaderboard, BenchLM, Unsloth, Pinggy (авг–сент 2026).
Тренд года: MoE-архитектуры (малые активные параметры) разрушили старую связку «больше параметров = медленнее». Qwen3.6-35B-A3B отвечает качеством 35B-класса со скоростью 3B-модели — поэтому в 2026 vRAM важнее TFLOPS, а «24 ГБ + хорошая полоса» остаётся золотым тиром, каким был в 2024-м.
Пять типовых ситуаций. Цены сентября 2026, США; в других регионах закладывайте +20–60%.
Сбалансированная GPU для локального LLM — это не «самая быстрая» и не «самая дешёвая». Это карта, где три кривые пересекаются в оптимуме: скорость (полоса 936 ГБ/с даёт 28–35 t/s на моделях 27B-класса и 160 t/s на gpt-oss-20b — комфортно выше порога интерактивности в 25 t/s), качество (24 ГБ — точный размер под сильнейшие модели consumer-тира: Qwen3.6-27B, Gemma 4 31B, и gpt-oss-120b в режиме offload), и цена (~$52/ГБ — втрое дешевле RTX 5090, при этом б/у 3090 не потеряет стоимость: она уже «в дне»).
Решающий аргумент 2026 года — рынок. В нормальные времена я бы советовал RTX 5090 за $2,000 MSRP: она объективно вдвое быстрее 3090. Но по $4,700+ она перестаёт быть «балансом»: за её цену собирается 2× 3090 (48 ГБ) + весь бюджет электричества на год. Кризис памяти инвертировал рейтинг выгодности: б/у Ampere и нестандартные игроки (RX 7900 XTX, Arc Pro, Strix Halo) сегодня рациональнее новых флагманов.
Стратегия на 12 месяцев: купить одну 3090 сейчас, жить на 27B-классе и gpt-oss-20b (это покрывает 95% задач), наблюдать за ценами GDDR7 (прогнозы сходятся: нормализация не раньше конца 2027), и докупить вторую 3090 → 48 ГБ, когда появится реальная потребность в 120B-моделях целиком. Это дешевле, быстрее и умнее, чем платить $4,700 за одну 5090 в самый разгар пузыря.
• 16 ГБ NVIDIA за $700–1,100 (5060 Ti 16GB, 5070 Ti): +39% к цене полугодом ранее и потолок 14B — худшая $/ценность на рынке.
• RTX 5090 по $4,700+ — если только скорость не приносит вам деньги.
• PRO 6000 по $16,000 — частнику не оправдать.
• P40 как единственная карта — дешёвый VRAM, дорогие нервы.
• Любая карта менее 16 ГБ — в 2026 это не LLM-железо.
• Нормализация цен DRAM (конец 2027): 5090 вернётся к ~$2.5K — вот тогда апгрейд.
• RTX 50 Super «готовы, но в подвешенном состоянии» (июль 2026): 24 ГБ-варианты могут выйти и сместить 3090.
• ROCm 7.3+ и SYCL: если Intel/AMD дожмут софт-стек, их $/ГБ станет неуязвимым.
• MoE-модели 2027: если тренд «мало активных параметров» продолжится, полоса станет менее критичной — и Arc Pro B70-связки взлетят.
• M5 Ultra Mac (конец 2026?): 1,200+ ГБ/с unified — сильный кандидат на «большой MoE-бокс».
Все цифры в отчёте — из публичных источников, доступных на 9 сентября 2026. Бенчмарки single-user (llama.cpp/Ollama) если не указано иное; vLLM-цифры отражают batch-режим.
Метасёрч по 6 тематическим срезам (GPU-гайды 2026, бенчмарки llama.cpp, цены street/б/у, MoE-модели, лидерборды LLM, Intel Arc), ~180 первичных страниц, чтение топ-источников, кросс-проверка каждой ключевой цифры минимум в двух независимых источниках. Расхождения (например, 5090 на 8B: 130 vs 220 t/s в разных тестах) отражены диапазонами.
• Цены волатильны: сентябрьские цифры могут отличаться от ваших локальных на ±30%.
• tok/s зависит от quant (Q4_K_M), контекста, движка (llama.cpp vs vLLM: разрыв до 19×) и ОС.
• «BenchLM score» и MMLU-баллы — прокси качества, не абсолютная истина.
• Б/у-цены — eBay/Avito-медианы, разброс реальных сделок большой.