Для ежедневной локальной работы с кодом GeForce RTX 5070 Ti — самый сбалансированный новый GPU в классе 16 ГБ. У него 256-битная шина, заявленная пропускная способность памяти 896 ГБ/с и TGP 300 Вт. RTX 5080 быстрее, но имеет те же 16 ГБ, а RTX 5060 Ti 16GB заметно экономичнее и может быть правильнее, если её задержка уже приемлема.
Главное условие сильнее названия карты: модель, KV cache и служебные буферы должны помещаться при рабочей, а не демонстрационной длине контекста. Если на всех 16-ГБ картах начинается offload в RAM или OOM, дорогая RTX 5080 не решит задачу вместимости. Тогда сравнивайте 24 ГБ, включая аккуратно проверенную б/у RTX 3090, либо hosted coding.
Четыре ворот перед покупкой
Правильный тест проходит последовательно четыре ворот:
- VRAM: вся ли модель остаётся на GPU вместе с контекстом и buffers.
- Контекст: хватает ли реального окна для файлов, инструкций, логов и ответа.
- Энергия и время: сколько длится весь цикл до завершения проверок и сколько энергии он требует.
- Принятая работа: выполняет ли patch задачу, остаётся ли в разрешённых файлах и проходят ли тесты.
Tokens per second полезны только внутри второго и третьего ворот. Быстрая генерация неверного или неприменимого diff не создаёт полезной работы.
Что различает современные 16-ГБ карты
В актуальной таблице NVIDIA новые модели разделяются так:
| GPU | Путь памяти по спецификации | TGP | Рациональный сценарий |
|---|---|---|---|
| RTX 5060 Ti 16GB | GDDR7, 128 bit, 448 ГБ/с | 180 Вт | Один разработчик, умеренная задержка, важны цена и тепло |
| RTX 5070 Ti 16GB | GDDR7, 256 bit, 896 ГБ/с | 300 Вт | Частые интерактивные циклы, нужен баланс скорости и питания |
| RTX 5080 16GB | GDDR7, 256 bit, 960 ГБ/с | 360 Вт | Контур точно помещается, а стоимость ожидания высока |
| RTX 4070 Ti SUPER | GDDR6X, 256 bit | 285 Вт | Хорошая скидка или проверенный вторичный рынок |
| RTX 4080 / 4080 SUPER | GDDR6X, 256 bit | 320 Вт | Цена ниже соседней новой модели при нужной скорости |
TGP помогает проверить блок питания, охлаждение и класс платы. Это не потребление всей системы из розетки. Спецификации также не доказывают скорость конкретного GGUF, quantization или backend.

У RTX 5070 Ti почти вдвое выше заявленная bandwidth, чем у 5060 Ti, поэтому она логичный performance-кандидат для memory-heavy decoding. Но покупать это отличие вслепую нельзя: выгодой становится только сокращение времени до принятого результата. RTX 5080 прибавляет к 896 ГБ/с сравнительно небольшой шаг до 960 ГБ/с и поднимает TGP до 360 Вт, сохраняя потолок 16 ГБ.
Как проверить реальную вместимость
Файл модели делит память с KV cache, compute buffers, runtime и другими процессами. Размер quantized-файла меньше 16 ГБ не гарантирует рабочий запуск.
В текущей документации Ollama о context length для систем с менее чем 24 GiB VRAM по умолчанию используется 4K. Увеличение context требует больше памяти. Во время активной задачи проверяйте:
bashollama ps
Смотрите на PROCESSOR и CONTEXT. Если короткий prompt показывает 100% GPU, повторите с объёмом, который реально поступает из редактора или агента. Частичный CPU placement, OOM или резкий рост задержки — это не мелкая настройка, а изменение класса решения.
Проведите три прогона: узкий patch с ближайшим тестом; обычное многофайловое изменение; тяжёлый debugging case с логами и правилами репозитория. Не ставьте максимальное окно ради цифры. Повышайте context только когда предыдущий уровень теряет необходимые зависимости.
Ollama отдельно предупреждает в FAQ, что параллельные запросы умножают контекстное выделение памяти. Результат для одного VS Code session нельзя переносить на сервер для команды без повторного теста.
Отделите аппаратную скорость от качества patch
Для повторяемой аппаратной базы используйте llama-bench:
bashllama-bench -m model.gguf -p 2048 -n 256 -r 5 -o json
Он отдельно измеряет prompt processing и generation, умеет повторять тесты и отдавать JSON. Зафиксируйте checksum модели, quantization, версию llama.cpp, context, offload, batch, sampling и concurrency. Документация инструмента отмечает, что tokenization и sampling не входят в его время, поэтому это не end-to-end результат.
Теперь подготовьте задания, которые имеют объективный финал. Подходящий контракт выглядит так: конкретный commit; один дефект; допустимые файлы; команда unit tests; команда lint или typecheck. Работа принимается, если:
- требуемое поведение воспроизводимо исправлено;
- заданные проверки завершаются с кодом 0;
- diff не выходит за границы;
- не появились лишние зависимости и сгенерированные файлы;
- разработчику не приходится переписывать основное решение.
Считайте не только успехи, но и неудачные попытки:
textacceptance rate = принятые задачи / все попытки принятые задачи в час = принятые задачи / суммарное время
Это локальная метрика вашего стека, а не универсальный рейтинг моделей. Именно поэтому она полезна при покупке: карта оценивается в том контуре, ради которого вы тратите деньги.

Мощность измеряется до конца тестов
Для NVIDIA можно раз в секунду записывать занятое VRAM и мощность GPU:
bashnvidia-smi \ --query-gpu=timestamp,memory.used,memory.total,power.draw,utilization.gpu \ --format=csv -l 1
Начинайте запись перед запросом и заканчивайте после завершения repo tests. Если важны тариф, тепло и PSU, добавьте измеритель в розетку: он увидит CPU, вентиляторы, накопители и потери блока питания. GPU telemetry этого не показывает.
textэнергия, кВт·ч = средняя мощность системы, Вт × часы / 1000 принятые задачи на кВт·ч = принятые задачи / энергия
CPU offload иногда снижает видимую мощность GPU, но растягивает процесс. Поэтому сравнивайте полный цикл, а не максимальный watt sample. Локальный тариф берите из собственного счёта.
Когда RX 9060 XT 16GB — реальная альтернатива
AMD указывает для Radeon RX 9060 XT 16GB пропускную способность до 320 ГБ/с и typical board power 160 Вт. По ёмкости и тепловому бюджету это интересный кандидат. Но его ценность зависит от программного пути.
Текущая страница Ollama по GPU включает RX 9060 XT в Linux ROCm list; native Windows и драйверные требования отличаются. Матрицы Radeon ROCm также разделяют Linux, WSL и версии frameworks. До покупки запустите smoke task на точных OS, driver, runtime build, model format и context. Если приложение уходит на CPU или нужный kernel отсутствует, экономия на карте не превращается в рабочую производительность.
RTX 3090: не «лучшая вообще», а проверка потолка 16 ГБ
NVIDIA публикует для RTX 3090 24 ГБ GDDR6X и мощность карты 350 Вт. На вторичном рынке она может стоить рядом с новой быстрой 16-ГБ моделью, но цена зависит от региона, а риски включают состояние памяти, охлаждение, гарантию и блок питания.
Сравнивать её нужно, когда целевой context не помещается в 16 ГБ. Если всё помещается и RTX 5060 Ti даёт приемлемое число принятых задач в час, лишнее тепло 3090 не обязательно оправдано. Если каждая 16-ГБ карта offload'ит один и тот же рабочий контур, 24 ГБ меняют саму возможность запуска.
Финальное правило:
- берите RTX 5060 Ti 16GB, если fit подтверждён, а задержка уже рабочая;
- доплачивайте за RTX 5070 Ti, если собственный тест показывает заметный прирост принятых задач в час;
- рассматривайте RTX 5080 только как ускорение подходящей 16-ГБ нагрузки;
- переходите к 24 ГБ, если блокирует память, а не время;
- выбирайте AMD после proof-of-stack, а не по одной цене и VRAM.
После определения класса железа отдельно выберите модель и quantization. Это делает соседний материал о локальной coding LLM для 16 ГБ VRAM. Разделение двух решений не даёт быстрой карте скрыть нехватку памяти, а рейтингу моделей — навязать неподходящую видеокарту.



