Исследование · данные сентября 2026

Видеокарты для локального LLM-инференса:
полный анализ цены, скорости и vRAM

Какие GPU дают лучший баланс между скоростью генерации (tok/s), качеством моделей, которые реально влезают в память, и ценой — с учётом аномального рынка сентября 2026 года.

📊 16 GPU-конфигураций · NVIDIA / AMD / Intel / альтернативы 🧠 30+ моделей сентября 2026 по VRAM-тирам ⏱ Бенчмарки: llama.cpp, vLLM, сообщество r/LocalLLaMA
⚠️

Контекст критически важен: сентябрь 2026 — худший момент для покупки GPU за последние 5 лет. Мировой дефицит DRAM/GDDR7 разогнал цены: RTX 5090 подорожал с $2,000 до ~$4,700–5,200 (медиана Newegg, август 2026), RTX PRO 6000 96GB — до $16,000 (вдвое дороже запуска), 16GB-карты среднего класса — на +30–40%.

Это разворачивает весь анализ: б/у-рынок, AMD и нестандартные решения впервые за долгое время выглядят рациональнее новых флагманов NVIDIA. Оценивайте покупки через этот призму.

01 · Вердикт сразу

TL;DR — три победителя

Если не хочется читать весь анализ: вот три конфигурации, закрывающие 90% сценариев локального инференса. Подробное обоснование — в секциях 4–8.

🥇
Идеальный баланс цена / скорость / качество

RTX 3090 (б/у) · 24 GB

≈ $1,000–1,300
936 ГБ/с · Ampere · 350 Вт
  • Лучшие модели сентября 2026 (Qwen3.6-27B, Gemma 4 31B в Q4) — целиком в vRAM, на интерактивной скорости
  • gpt-oss-20b: ~160 tok/s — быстрее, чем печатает человек
  • gpt-oss-120b с CPU-offload MoE-слоёв: 10–15 tok/s — «фронтир-лайт» за копейки
  • Цена за грамм vRAM ниже, чем у любой новой карты NVIDIA
Почему: в условиях memory-crisis это единственный способ купить «правильные» 24 ГБ с полосой ~1 ТБ/с, не переплачивая в 3–4 раза за новый флагман.
🥈
Если бюджет позволяет и нужно новое

RTX 5090 · 32 GB

≈ $4,700–5,200
1,792 ГБ/с · Blackwell · 575 Вт
  • Самая высокая плотная скорость декода в потребительском сегменте: 1.8 ТБ/с
  • 32 ГБ = Qwen3.6-35B-A3B целиком + огромный контекст, или 70B в Q2/Q3
  • 30B Q4: 40–55 tok/s · 8B Q4: ~220 tok/s
  • Но: цена ×2.3 к MSRP из-за дефицита GDDR7 — покупайте только если скорость решает
Почему: это лучшая одиночная карта для скорости, но сентябрь 2026 — плохой момент платить за неё: цена оторвана от MSRP.
🥉
Максимум интеллекта за разумные деньги

2× RTX 3090 (б/у) · 48 GB

≈ $2,000–2,600
2× 936 ГБ/с · NVlink опционально
  • gpt-oss-120b (frontier-класс Apache 2.0) — целиком в vRAM, 25–35 tok/s
  • Qwen3-Coder-Next 80B и любой 70B dense в Q4 на полной скорости
  • Дешевле одной RTX 5090, при этом +16 ГБ памяти и в 2.5 раза больше VRAM-бюджет
  • Риск: б/у-железо, 700 Вт под нагрузкой, нужен БП 1000+ Вт
Почему: если цель — максимум качества ответов локально, 48 ГБ vRAM решают больше, чем любая одиночная потребительская карта 2026 года.
02 · Фундамент

Как устроен инференс: три числа, которые решают всё

Выбор GPU для LLM — это не «сколько TFLOPS». Генерация текста — почти полностью задача чтения весов из памяти. Понимание трёх метрик ниже объясняет 90% результатов бенчмарков.

🧠

vRAM — что влезет

Жёсткий потолок: модель, не поместившаяся в vRAM, «сваливается» в системную RAM, и скорость падает в 5–20 раз. Правило: ~0.55 ГБ на 1 млрд параметров в Q4, плюс 1–4 ГБ на KV-кэш контекста.

27B Q4 ≈ 16 ГБ · 70B Q4 ≈ 40 ГБ

Пропускная способность — как быстро

На каждом токене GPU перечитывает активные веса. Скорость генерации почти линейно следует за GB/s, а не за TFLOPS. Поэтому 5090 (1,792 ГБ/с) вдвое быстрее 4090 (1,008) на одной модели — и вдвое быстрее 3090 (936).

🧩

MoE — играchanger

MoE-модель (gpt-oss, Qwen3.6-35B-A3B) активирует лишь 3–5 млрд параметров на токен, но хранит все 35–120 млрд. Итог: vRAM нужна как у большой модели, скорость — как у маленькой. Это главный тренд 2025–2026 и главный фактор в пользу больших объёмов vRAM.

Приблизительная скорость генерации (dense-модель, single user):

tok/s ≈ пропускная способность (ГБ/с) ÷ размер активных весов (ГБ) × эффективность (0.4–0.6)

Пример: RTX 3090, Qwen3.6-27B Q4 (≈17 ГБ): 936 ÷ 17 × 0.45 ≈ 25–35 tok/s — комфортно интерактивно. Та же модель на Tesla P40 (347 ГБ/с): ~10 tok/s — на грани терпения. Отсюда видно, почему «дешёвые 24 ГБ» без полосы не спасают.

О терминах: под «инференсом» (в запросе — «референс») понимается локальная генерация ответов моделью. «Качество» задаётся тем, какая модель помещается в vRAM и в каком квантовании: Q4_K_M почти без потерь, Q2–Q3 — заметная деградация. Поэтому vRAM — это не «спецификация», это и есть качество ответов.

03 · Рынок

Memory-crisis 2026: что произошло с ценами

AI-бум съел мировое производство DRAM. Память подорожала в 2–3 раза, и NVIDIA транслирует это в розницу: подъём цен волнами июнь→август 2026 (+3…+39% по моделям). Источники: Tom's Hardware (трекинг Newegg), TechSpot, TechPowerUp.

RTX 5090 · 32GB
$1,999 MSRP
≈ $4,700–5,200
+135…160%
RTX PRO 6000 · 96GB
$8,565 запуск
$16,000 (офиц. магазин NVIDIA)
+87%
RTX 5060 Ti 16GB
$569 медиана, июнь
$805 медиана, август
+39%
RTX 5070 · 12GB
$660 медиана, июнь
$900 медиана, август
+36%
RTX 4090 · 24GB (новая)
$1,599 запуск
≈ $3,499 (снят с пр-ва)
+119%
Б/у RTX 3090 · 24GB
$700–800 (2025)
$1,000–1,300
+40…60%

🟢 Кто выиграл от кризиса

AMD RX 7900 XTX ($899, 24GB) — лучший новый 24GB-карт по цене: на ~70% дешевле RTX 5090 за ту же память. Intel Arc Pro B60/B70 ($649/$950) — 24–32 ГБ vRAM по цене gaming-карты, осмысленно в связках 2–4 штук. Tesla P40 ($240–350) — самый дешёвый вход в 24 ГБ вообще, несмотря на все компромиссы. Mac / Strix Halo — unified-память дорожает медленнее GDDR.

🔴 Кто проиграл

RTX 5090 — великолепная карта, купленная по MSRP в 2025-м; переоценённая по $4,700+ в 2026-м. 16GB-карты NVIDIA ($700–1,000) — средний класс стал худшей сделкой рынка: за 16 ГБ без полосы для MoE-эпохи. RTX PRO 6000 — $16,000 за 96 ГБ: карты размазаны по облакам, локальная покупка потеряла смысл для частника. Любой апгрейд ради +8 ГБ — сейчас переплата ×2 к нормальной цене.

04 · Сравнение

Все 16 конфигураций в одной таблице

Цены — США, сентябрь 2026 (street/б/у-рынок). Скорости — одиночный пользователь, llama.cpp/Ollama, Q4-квантование, короткий контекст. «Модель-цель» — крупнейший класс моделей, который карта держит на интерактивной скорости (25+ tok/s). Кликайте по заголовкам колонок для сортировки.

Быстрая сортировка:
Карта vRAM ППК, ГБ/с Цена, $ $ / ГБ vRAM tok/s · 8B Q4 Модель-цель Вердикт
RTX 3090 (б/у)Ampere · 350 Вт 24 ГБ 936 1,000–1,300 ~52 ~85
Qwen3.6-27B / Gemma 4 31B 🏆 Главный выбор
RTX 5090Blackwell · 575 Вт 32 ГБ 1,792 4,700–5,200 ~147 ~220
Qwen3.6-35B-A3B + контекст Самая быстрая одиночная
2× RTX 3090 (б/у)48 ГБ · 700 Вт 48 ГБ 936×2 2,000–2,600 ~48 ~85
gpt-oss-120b целиком 🏆 Максимум за деньги
RX 7900 XTXAMD · ROCm 7.2 · 355 Вт 24 ГБ 960 ~899 ~37 ~95
27B Q4, 70B Q4 на 14–18 t/s Лучший новый $/ГБ
RTX 4090 (б/у)Ada · 450 Вт 24 ГБ 1,008 1,800–2,200 ~75 ~120
27B Q4 (+30% скорости к 3090) Если хочется быстрее 3090
Intel Arc Pro B60Battlemage · 24 ГБ ECC 24 ГБ 456 ~649 ~27 ~60
13–14B комфортно, 27B медленно VRAM за копейки, но софт сырой
Intel Arc Pro B7032 ГБ ECC · 230 Вт 32 ГБ 608 ~950 ~30 ~70
27B Q4 впритык-интерактивно Дешёвые 32 ГБ / связки 4×
4× Intel Arc Pro B60/B7096–128 ГБ суммарно 96–128 ГБ 608×4 2,600–3,800 ~27–30 ~70/карта
gpt-oss-120b на ~25–30 t/s Бюджетный «фронтир-компьютер»
RTX 508016 ГБ · 300 Вт 16 ГБ 960 1,500–1,580 ~94 ~140
gpt-oss-20b / Gemma 4 12B Быстро, но 16 ГБ — мало в 2026
RTX 5070 Ti16 ГБ · 300 Вт 16 ГБ 896 1,100–1,150 ~69 ~100
gpt-oss-20b / 14B Q4 Игровая карта, не LLM-карта
RTX 5060 Ti 16GB+39% к цене за полгода 16 ГБ 448 758–805 ~49 ~65
gpt-oss-20b / 12–13B Q4 Вход в CUDA, но переплата
RX 9070 XTAMD · RDNA4 · 16 ГБ 16 ГБ 640 ~700 ~44 ~95
gpt-oss-20b / 13B Q4 Разумный вход в 16 ГБ
Tesla P40 (б/у)Pascal 2016 · поддержка CUDA заканчивается 24 ГБ 347 240–350 ~13 ~35
batch/embeddings, вторая машина Дёшево влезть, больно жить
Strix Halo mini-PCRyzen AI Max+ 395 · 128 ГБ shared 128 ГБ ~212 1,800–2,400 ~16 ~80
MoE-модели до 120B, 10–20 t/s MoE-король за деньги
Mac Studio M3 Ultra 128–192GB546 ГБ/с unified · ~200 Вт 128–192 ГБ 546 6,500–9,000 ~34 ~150*
70B Q4: 8–15 t/s, GLM-5.1 влезает Для больших MoE и тишины
RTX PRO 6000 96GBBlackwell · ECC · 300–600 Вт 96 ГБ 1,792 ~16,000 ~167 ~245
gpt-oss-120b: 170 tok/s (!) Тех-совершенство, ценовое безумие

* Mac Studio: tok/s указан для gpt-oss-20b (MLX), для 70B dense падает до 8–15 t/s — unified-память огромна, но полоса 546 ГБ/с ограничивает dense-модели. MoE на Mac раскрываются лучше. «ППК» — пропускная способность памяти. Полную детализацию по каждой карте — в карточках ниже.

05 · Визуализация

Цена против скорости: карта рынка

Каждая точка — конфигурация. Ось X — цена (лог. шкала), ось Y — пропускная способность памяти (главный предиктор скорости генерации). «Идеальный баланс» — правый нижний угол: максимум ГБ/с за минимум долларов. Линия тренда помогает увидеть, кто над линией (переплата) и кто под ней (выгодная сделка).

0 500 1000 1500 1900 $250 $1,000 $3,000 $8,000 $16,000 Цена, USD (лог. шкала) → Память: ГБ/с → ЗОНА ВЫГОДЫ высокая полоса за низкую цену P40 24GB Arc B60 24GB Arc B70 32GB 5060 Ti 16GB RX 9070 XT 16GB RX 7900 XTX 3090 🏆 5070 Ti 16GB 4090 б/у 24GB 2× RTX 3090 (48GB) 🏆 5080 16GB Strix Halo 128GB 4× Arc B60 (96GB) RTX 5090 32GB Mac Studio 192GB PRO 6000 96GB
выгодные сделки (над/под линией в вашу пользу) сбалансированные флагманы (плата за скорость) нестандартные (Intel/AMD-связки) проблемные сделки сентября 2026

Как читать: диаграмма показывает физику, а не маркетинг. Точка «4× Arc B60» стоит по совокупной полосе всех карт — в реальности это 4 независимых GPU (тензор-параллеллизм с однойCCL/vLLM), что даёт агрегированную скорость на MoE-моделях, но не на dense. Аналогично 2×3090: удвоение полосы работает на split-моделях в llama.cpp почти линейно для MoE, и с потерями 10–20% для dense.

06 · Детали

Карточки финалистов: плюсы и минусы

Развёрнутый разбор каждой значимой конфигурации: что получите, чем заплатите, какие модели запускать.

🥇 Идеальный баланс

RTX 3090 (б/у)

Ampere · 24 ГБ GDDR6X · 10496 CUDA · NVlink ×2
$1,000–1,300
б/у рынок, сент. 2026
Память
24 ГБ / 936 ГБ/с
8B Q4
~85 t/s
gpt-oss-20b
~160 t/s
27B Q4
~28–35 t/s
Плюсы
  • Точный размер под лучшие модели сентября 2026: Qwen3.6-27B Q4 (~16 ГБ) и Gemma 4 31B Q4 — с полным KV-кэшем и запасом
  • Полоса 936 ГБ/с — на уровне RTX 4090 за половину цены б/у
  • gpt-oss-20b на llama.cpp: 160+ tok/s — reasoning-модель со скоростью чата
  • gpt-oss-120b с --n-cpu-moe: MoE-слои в RAM, 10–15 tok/s — фронтир-качество за $1,200
  • Последнее поколение с NVlink — пара карт работает без PCIe-потерь
Минусы
  • Б/у-риск: майнинг-прошлое, менять термопасту почти обязательно, проверка под нагрузкой обязательна
  • 350 Вт в пике — нужен качественный БП 750+ Вт и продуманное охлаждение
  • Нет native FP8/FP4: новые Blackwell-кванты недоступны (для Q4-инференса неважно)
  • Цена б/у уже выросла на 40–60% из-за кризиса — «дёшево» относительно, не абсолютно
Берите, если: нужен один GPU на каждый день, бюджет $800–1,400, и вы хотите лучшие доступные модели на интерактивной скорости. Компанию к ней через год составит вторая такая же → 48 ГБ.

RTX 5090

Blackwell · 32 ГБ GDDR7 · 21,760 CUDA · 575 Вт
$4,700–5,200
street, сент. 2026 (MSRP $1,999)
Память
32 ГБ / 1,792 ГБ/с
8B Q4
~220 t/s
30B Q4
40–55 t/s
70B Q4 (offload)
14–22 t/s
Плюсы
  • Самая высокая скорость генерации среди потребительских карт — 1.8 ТБ/с полосы
  • 32 ГБ: Qwen3.6-35B-A3B MoE целиком + 100K+ контекста — «лучший all-rounder» 2026 без компромиссов
  • Native FP4/FP8: future-proof под новые кванты и speculative decoding
  • pp (prefill) скорость — огромная: длинные промпты не заставляют ждать
Минусы
  • Цена ×2.3 к MSRP: $4,700+ — худшая сделка на рынке в пересчёте $/ГБ (~$147/ГБ против $52 у б/у 3090)
  • 70B dense Q4 (~40 ГБ) не влезает — для этого класса нужны 48 ГБ или offload
  • 575 Вт, 16-pin коннектор (истории о плавленных кабелях), требования к БП 1200 Вт
  • Санкционные/региональные наценки: вне США часто ещё дороже
Берите, если: скорость генерации критична (агенты, reasoning-модели с длинными цепочками), бюджет $5K не жалко, и есть 1200-ваттный БП. Иначе — деньги на ветер в этом квартале.
🥉 Максимум качества за деньги

2× RTX 3090 (б/у)

48 ГБ суммарно · NVlink мост (опц.)
$2,000–2,600
за пару, б/у
Память
48 ГБ / 1,872 ГБ/с
gpt-oss-120b
25–35 t/s
70B Q4
~30–40 t/s
TDP
700 Вт пара
Плюсы
  • 48 ГБ — порог, на котором gpt-oss-120b (59 ГБ MXFP4 в Q4-репаке ~45 ГБ) и Nemotron 3 Super работают целиком без offload
  • gpt-oss-120b целиком в vRAM: 25–35 tok/s — frontier-класс reasoning локально
  • Qwen3-Coder-Next 80B (агент-кодинг) и любые 70B dense Q4 — на полной скорости
  • Дешевле одной RTX 5090 при большем VRAM-бюджете; апгрейд-путь: начать с одной, докупить вторую
Минусы
  • llama.cpp multi-GPU: слои сплитятся хорошо, но dense-модели теряют 10–20% скорости против идеала; NVlink-мост частично лечит (только у 3090!)
  • 700 Вт суммарно: БП 1000+ Вт, тепло в комнате, лето без кондиционера — страдание
  • Две б/у-карты = двойной риск деградации; покупать у проверенных продавцов
  • Не все фреймворки дружат с multi-GPU из коробки (vLLM требует компиляции, Ollama/LM Studio — ок)
Берите, если: главное — качество ответов (120B MoE > 27B dense), бюджет $2–2.6K, есть корпус E-ATX и киловатт энергии. Лучший «мозг за деньги» 2026.

AMD RX 7900 XTX

RDNA3 · 24 ГБ GDDR6 · ROCm 7.2
~$899
новая, сент. 2026
Память
24 ГБ / 960 ГБ/с
8B Q4
~95 t/s
70B Q4
14–18 t/s
$ / ГБ
~$37
Плюсы
  • Лучший новый 24 ГБ-карт по $/ГБ на рынке NVIDIA+AMD — вдвое дешевле б/у 4090
  • ROCm 7.2 (2026) наконец-то починил софт-историю: llama.cpp/vLLM работают стабильно на RDNA3
  • 70B Q4 на 14–18 tok/s — редкая возможность потрогать 70B на карте дешевле $1,000
  • Новая карта = гарантия, никакой б/у-лотереи
Минусы
  • Софт всё ещё второсортный: FlashAttention на ROCm — местами, кванты — через Vulcan-бэкенды, vLLM-фичи отстают от CUDA
  • Нативные GGUF-ядра (RowSplit/MMA) медленнее CUDA-аналогов на 10–25% в отдельных моделях
  • Нет CUDA: unsloth/fine-tuning生态 недоступна, speculative decoding ограничен
  • Производство RDNA3 сворачивается — к 2027 это будет «б/у-эквивалент» без цены 3090
Берите, если: хотите новую карту с гарантом за <$1K, готовы к шаманству с ROCm ради экономии $300–500 против б/у 3090. Vulkan-бэкенд llama.cpp — ваш друг.

Intel Arc Pro B60 / B70

Battlemage · 24/32 ГБ GDDR6 ECC · 200–230 Вт
$649 / $950
новые
Память
24–32 ГБ / 456–608 ГБ/с
8B Q4
~50–70 t/s
4× B70 = 128 ГБ
~$3,800
$ / ГБ
$27–30
Плюсы
  • Самый дешёвый новый VRAM на рынке: $27–30/ГБ — втрое дешевле 5090
  • ECC-память и низкий TDP (230 Вт) — серверная дисциплина по потребительской цене
  • 4× B70 = 128 ГБ за $3,800: gpt-oss-120b на 25–30 t/s, DeepSeek-V4-Flash 284B влезает
  • SR-IOV виртуализация — единственные карты, честно отдающие vGPU-срезы
  • llama.cpp Vulkan работает прилично; llama.cpp SYCL — быстро развивается
Минусы
  • Полоса 456–608 ГБ/с: dense-модели медленные — 27B Q4 на грани интерактива (~15–18 t/s)
  • Софт-стек «кость в горле»: vLLM только через intel/llm-scaler контейнер, quants — «untested», llama.cpp — «roll of the dice» (слова HN-комьюнити)
  • Одна карта медленнее RTX 5090 в 4–5 раз на инференсе — смысл только в связках
  • Экосистема: неожиданные баги драйверов, слабое сообщество, нет unsloth/fine-tuning
Берите, если: строите бюджетный multi-GPU-бокс «128 ГБ за $4K» под MoE-модели и готовы бороться с софтом. Одиночная B60/B70 — только для экспериментов.

RTX PRO 6000 Blackwell 96 ГБ

Blackwell · 96 ГБ GDDR7 ECC · блауэр-кулер
~$16,000
официальный магазин NVIDIA, сент. 2026
Память
96 ГБ / 1,792 ГБ/с
gpt-oss-120b
170 t/s (!)
Prefill
4,500 t/s
Max-Q (300 Вт)
~90% скор.
Плюсы
  • Единственная одиночная карта, где gpt-oss-120b летает: 170 tok/s generation, 4,500 tok/s prefill (llama-bench, MXFP4)
  • 96 ГБ: 70B FP8, Mistral Medium 3.5 128B Q4, Nemotron Ultra 253B Q3 — всё влезает
  • ECC, enterprise-драйверы, 2-слотовый блауэр — можно ставить 4 в станок без водянки
  • Максимум локального интеллекта без offload-компромиссов
Минусы
  • $16,000 — вдвое дороже запуска (март 2025: $8,565): GDDR7-дефицит бьёт по этой карте сильнее всех
  • За эти деньги — 8× б/у 3090 (192 ГБ) или Mac Studio M5 Ultra с лучшим $/ГБ
  • GeForce-драйвер vs Enterprise: часть софта (unsloth) официально не поддерживается
  • Для частного лица окупаемость сомнительна: 4× Arc B70 дают те же 128 ГБ за $3,800
Берите, если: это рабочий инструмент с бизнес-обоснованием (приватность, SLA, 24/7 инференс 120B-моделей) — или очень хобби-богатый энтузиаст. Частнику в сентябре 2026 — нет.

Strix Halo (mini-PC, 128 ГБ)

Ryzen AI Max+ 395 · unified LPDDR5X-8000 · ~200 Вт
$1,800–2,400
Framework Desktop / GMKtec EVO-X2
Память
128 ГБ / ~212 ГБ/с
Llama 4 Scout MoE
10–20 t/s
70B dense Q4
3–5 t/s
Потребление
~140 Вт
Плюсы
  • 128 ГБ памяти за $2K — лучший $/ГБ среди «новых» систем: gpt-oss-120b, Qwen3.5-122B, Mistral Medium 128B — всё влезает
  • MoE-модели — его стихия: Llama 4 Scout (17B активных) на 10–20 tok/s, комфортно
  • Мини-ПК: 1.2 л, ~140 Вт под нагрузкой, тишина — «сервер» на полке
  • Vulkan llama.cpp на Strix Halo быстрее ROCm — забавный поворот 2026 года
Минусы
  • 212 ГБ/с убивает dense-модели: 70B Q4 — 3–5 tok/s, это batch-only
  • Только MoE-ворклоады: планирование должно быть «MoE-first», иначе разочарование
  • Апгрейда нет: что купил — то навсегда (память распаяна)
  • Игры/3D — посредственно; это специализированный AI-бокс, не универсальный ПК
Берите, если: ваш профиль — большие MoE с рассуждениями, а не dense-скорость; важны тишина и экономия энергии. Идеальная вторая машина к десктопу с GPU.

Tesla P40 (б/у)

Pascal 2016 · 24 ГБ GDDR5 · пассивный кулер
$240–350
eBay/б/у, сент. 2026
Память
24 ГБ / 347 ГБ/с
8B Q4
~35 t/s
$ / ГБ
~$13
FP16
1/64 FP32 (!)
Плюсы
  • Самые дешёвые 24 ГБ в мире: $10–15/ГБ — втрое дешевле б/у 3090
  • Q4-инференс не требует tensor cores: 14B Q4 на ~10–12 t/s, embeddings/batch — без проблем
  • gpt-oss-120b в 4×P40-сборках: ~28 t/s (MoE прощает слабую полосу активных слоёв)
  • Господин б/у-хомелаб: серверный форм-фактор, 250 Вт, бесконечные мануалы сообщества
Минусы
  • Поддержка NVIDIA заканчивается: CUDA 13 / 580-драйвер — последний, 2016-архитектура
  • FP16 = 1/64 FP32: никакой fine-tuning, никакие новые движки, только Q4-Q8 инференс
  • Пассивное охлаждение: нужен турбина-блашер или 3D-принт-шрауд, иначе троттлинг
  • 347 ГБ/с = интерактив на грани: 8B — 35 t/s, 14B — терпимо, 27B — слайд-шоу
Берите, если: это вторая машина для batch/embeddings/экспериментов за $300, а не основной ПК. Как «единственная карта» — категорически нет, вопреки хайпу r/homelab.
07 · Модели

Что запускать в сентябре 2026: модели по VRAM-тирам

Железо — средство; интеллект — это модели. Ландшафт сентября 2026: Qwen3.6 и Gemma 4 доминируют в consumer-тирах, OpenAI gpt-oss — лучший «фронтир за копейки», Kimi/GLM — вершина, недостижимая локально. Данные: Onyx leaderboard, BenchLM, Unsloth, Pinggy (авг–сент 2026).

16 ГБЛёгкий тир — качество выше ожиданий
Gemma 4 12BGoogle · dense · мультимодальная, 262K контекст · общий балл 77+ (MMLU-Pro)~7 ГБ Q4Gemma
gpt-oss-20bOpenAI · MoE (3.6B активных) · reasoning с adjustable effort, tool calling · Apache 2.0~14–16 ГБApache
Qwen3.5-9BAlibaba · dense · сильнейший в классе <10B, 262K контекст~6 ГБ Q4Apache
Phi-4 14BMicrosoft · dense · математика/рассуждения~9 ГБ Q4MIT
24 ГБЗолотой тир — здесь живёт лучшее соотношение «качество/размер» в 2026
Qwen3.6-27BAlibaba · dense · лучший реалистичный выбор одиночной карты (BenchLM 47.8) · 262K контекст~15–16 ГБ Q4Apache
Gemma 4 31BGoogle · dense · сильнейшая dense-Gemma (BenchLM 52.6), 256K~18–20 ГБ Q4Gemma
Qwen3.6-35B-A3BAlibaba · MoE (3B активных!) · «лучший all-rounder 2026»: качество 35B при скорости 3B · ~20 t/s на 24 ГБ~23 ГБ Q4Apache
gpt-oss-120b (offload)OpenAI · MoE · --n-cpu-moe: 25 экспертов в RAM → 10–15 t/s на 24 ГБ-карте. Фронтир-лайт!~16 ГБ на GPUApache
32 ГБПлюс к 24 ГБ: комфорт для MoE + длинный контекст
Qwen3.6-35B-A3B + 128K контекстТа же модель, но KV-кэш не душит; 40–60 t/s на RTX 5090~23 ГБ + кэшApache
Qwen3-Coder-Next 80BAlibaba · MoE (3B активных) · агентный кодинг: 30–40 t/s на 32 ГБ (влезает в MXFP4-репаке ~28 ГБ)~28–46 ГБApache
Llama 4 Scout 109BMeta · MoE (17B активных) · 10M контекст; на 32 ГБ — впритык, скорость скромная~55 ГБ INT4Llama
48–64 ГБПорог «фронтир-локально» — 120B-класс целиком в vRAM
gpt-oss-120bOpenAI · MoE (5.1B активных) · SWE 62.4%, reasoning уровнем o4-mini · 25–35 t/s на 2×3090, 45+ на PRO 6000~59 ГБ MXFP4Apache
Nemotron 3 Super 120B-A12BNVIDIA · MoE · 1M контекст, reasoning · сильный претендент на «лучший MoE 2026»~64–72 ГБ Q4Open
Qwen3.5-122B-A10BAlibaba · MoE · «frontier-ish» общий интеллект, 256K~70 ГБ Q4Apache
Llama 3.3 70B / Qwen2.5-72B denseКлассика 70B dense Q4 — по-прежнему сильна в коде и знаниях; 30–40 t/s на 2×3090~40–42 ГБ Q4Llama
96–128+ ГБПрофессиональная лига
Mistral Medium 3.5 (128B dense)Mistral · dense · мультимодальная, многоязычная~80 ГБ Q4Com.
DeepSeek-V4-Flash 284BDeepSeek · MoE (13B активных) · потолок 128 ГБ Strix Halo в 3-bit~110–135 ГБ Q3MIT
GLM-4.7 355BZ.ai · MoE · топ MIT-лицензии, SWE 73.8% — 512 ГБ Mac Studio territory~180 ГБ Q4MIT
GLM-5.1/5.2 · Kimi K2.6Вершина open-weight (BenchLM 63–65, SWE 80%+) — но 420+ ГБ: только Mac Studio M3 Ultra 512 ГБ или кластер~420 ГБ Q4MIT

Тренд года: MoE-архитектуры (малые активные параметры) разрушили старую связку «больше параметров = медленнее». Qwen3.6-35B-A3B отвечает качеством 35B-класса со скоростью 3B-модели — поэтому в 2026 vRAM важнее TFLOPS, а «24 ГБ + хорошая полоса» остаётся золотым тиром, каким был в 2024-м.

08 · Сценарии

Рекомендации по бюджету: от $350 до $16,000

Пять типовых ситуаций. Цены сентября 2026, США; в других регионах закладывайте +20–60%.

≈ $350
максимальный бюджет входа
Попробовать LLM локально без кредиток и API. Готовы к компромиссам в скорости.
Tesla P40 · 24 ГБ
+ блашер-кулер $30. Gemma 4 12B и gpt-oss-20b — работает; 14B Q4 — терпимо. Только как машина-экспериментатор.
≈ $900
новая карта с гарантией
Полноценный ежедневный ассистент: Qwen3.6-27B Q4 на интерактивной скорости.
AMD RX 7900 XTX · 24 ГБ
Лучший $/ГБ среди новых. ROCm 7.2 + llama.cpp Vulkan = стабильные 30–45 t/s на 27B. Бонус: 70B Q4 на 14–18 t/s.
≈ $1,200
оптимальная точка рынка ★
Лучший баланс: 24 ГБ с честной полосой под топ-модели тира, апгрейд-путь до 48 ГБ.
RTX 3090 (б/у) · 24 ГБ
Qwen3.6-27B Q4 на 28–35 t/s, gpt-oss-20b на 160 t/s, gpt-oss-120b с offload на 10–15 t/s. Через год — вторая 3090.
≈ $2,600
серьёзное железо
Максимум качества ответов: 120B-класс reasoning локально, без компромиссов offload.
2× RTX 3090 · 48 ГБ
gpt-oss-120b целиком на 25–35 t/s. Альтернатива-радикал: 4× Arc Pro B60 (96 ГБ) — если готовы воевать с софтом.
≈ $4,700+
без компромиссов в скорости
Скорость решает: агенты, reasoning-модели с тысячами токенов, длинные контексты, prefill без ожидания.
RTX 5090 · 32 ГБ
Либо, для «максимума интеллекта»: Strix Halo 128 ГБ ($2K, MoE-first) + ваша текущая GPU. Комбо умнее одной 5090.
09 · Итог

Идеальный баланс: окончательный ответ

Вердикт исследования

Б/у RTX 3090 — идеальный баланс «цена / скорость / качество» сентября 2026.

Сбалансированная GPU для локального LLM — это не «самая быстрая» и не «самая дешёвая». Это карта, где три кривые пересекаются в оптимуме: скорость (полоса 936 ГБ/с даёт 28–35 t/s на моделях 27B-класса и 160 t/s на gpt-oss-20b — комфортно выше порога интерактивности в 25 t/s), качество (24 ГБ — точный размер под сильнейшие модели consumer-тира: Qwen3.6-27B, Gemma 4 31B, и gpt-oss-120b в режиме offload), и цена (~$52/ГБ — втрое дешевле RTX 5090, при этом б/у 3090 не потеряет стоимость: она уже «в дне»).

Решающий аргумент 2026 года — рынок. В нормальные времена я бы советовал RTX 5090 за $2,000 MSRP: она объективно вдвое быстрее 3090. Но по $4,700+ она перестаёт быть «балансом»: за её цену собирается 2× 3090 (48 ГБ) + весь бюджет электричества на год. Кризис памяти инвертировал рейтинг выгодности: б/у Ampere и нестандартные игроки (RX 7900 XTX, Arc Pro, Strix Halo) сегодня рациональнее новых флагманов.

Стратегия на 12 месяцев: купить одну 3090 сейчас, жить на 27B-классе и gpt-oss-20b (это покрывает 95% задач), наблюдать за ценами GDDR7 (прогнозы сходятся: нормализация не раньше конца 2027), и докупить вторую 3090 → 48 ГБ, когда появится реальная потребность в 120B-моделях целиком. Это дешевле, быстрее и умнее, чем платить $4,700 за одну 5090 в самый разгар пузыря.

Цена входа
$1,000–1,300
$ / ГБ vRAM
~$52
Целевые модели
27B–120B MoE
Скорость на цели
28–35 t/s

🚫 Чего избегать в сентябре 2026

16 ГБ NVIDIA за $700–1,100 (5060 Ti 16GB, 5070 Ti): +39% к цене полугодом ранее и потолок 14B — худшая $/ценность на рынке.
RTX 5090 по $4,700+ — если только скорость не приносит вам деньги.
PRO 6000 по $16,000 — частнику не оправдать.
P40 как единственная карта — дешёвый VRAM, дорогие нервы.
• Любая карта менее 16 ГБ — в 2026 это не LLM-железо.

🔮 Что может изменить расклад

Нормализация цен DRAM (конец 2027): 5090 вернётся к ~$2.5K — вот тогда апгрейд.
RTX 50 Super «готовы, но в подвешенном состоянии» (июль 2026): 24 ГБ-варианты могут выйти и сместить 3090.
ROCm 7.3+ и SYCL: если Intel/AMD дожмут софт-стек, их $/ГБ станет неуязвимым.
MoE-модели 2027: если тренд «мало активных параметров» продолжится, полоса станет менее критичной — и Arc Pro B70-связки взлетят.
M5 Ultra Mac (конец 2026?): 1,200+ ГБ/с unified — сильный кандидат на «большой MoE-бокс».

10 · Прозрачность

Методология и источники

Все цифры в отчёте — из публичных источников, доступных на 9 сентября 2026. Бенчмарки single-user (llama.cpp/Ollama) если не указано иное; vLLM-цифры отражают batch-режим.

Как собирались данные

Метасёрч по 6 тематическим срезам (GPU-гайды 2026, бенчмарки llama.cpp, цены street/б/у, MoE-модели, лидерборды LLM, Intel Arc), ~180 первичных страниц, чтение топ-источников, кросс-проверка каждой ключевой цифры минимум в двух независимых источниках. Расхождения (например, 5090 на 8B: 130 vs 220 t/s в разных тестах) отражены диапазонами.

Главные оговорки

• Цены волатильны: сентябрьские цифры могут отличаться от ваших локальных на ±30%.
• tok/s зависит от quant (Q4_K_M), контекста, движка (llama.cpp vs vLLM: разрыв до 19×) и ОС.
• «BenchLM score» и MMLU-баллы — прокси качества, не абсолютная истина.
• Б/у-цены — eBay/Avito-медианы, разброс реальных сделок большой.