Почему самый мощный ПК для локального ИИ может обойтись без видеокарты
Сборку под локальный ИИ оценивают по строке памяти — сколько ее и общая ли она у процессора с графикой.

Самый мощный ПК под локальный ИИ логично взять с топовой видеокартой — как игровой. Но впереди в играх и в нейросетях оказываются разные машины: там, где геймерский риг уходит вперед по кадрам, большую языковую модель локально запускает компактная коробка без дискретной графики. Мощный ПК под нейросети упирается в память — она и задает потолок модели. Разберем, почему ОЗУ решает больше видеокарты и где граница между двумя классами сборок.
Языковая модель работает из памяти целиком
Текст модель выдает по токену за раз и на каждый прогоняет через чип весь массив весов. Скорость зависит от одного: как быстро память подает веса вычислительным блокам. Мощность чипа тут вторична. А чтобы прогонять этот массив целиком, все параметры должны лежать в памяти разом.
Сколько памяти нужно модели, задает вес одного параметра — он зависит от точности:
- при FP16 — 2 байта на параметр;
- при INT8 — 1 байт;
- при INT4 — около половины байта.
Например, 8 миллиардов параметров в FP16 требуют 16 гигабайт, чтобы загрузиться в память.
Где топовая видеокарта упирается в потолок
У дискретной видеокарты память своя, и ее объем намертво задает чип. Например, у RTX 5090 это 32 ГБ GDDR7 — предел для потребительской карты. Модель до 35 миллиардов параметров в четырехбитном сжатии сюда влезает, а 70 миллиардов — около 40 ГБ — уже нет.
Модель либо целиком помещается в видеопамяти, либо не запускается — здесь жесткий потолок. Сколько ни добавь оперативной памяти, для модели она не в счет — уложиться все равно нужно в 32 гигабайта видеопамяти, а системную от нее отделяет медленная шина PCIe.
Что дает единая память процессора и графики
Память можно не делить на видео- и системную — если процессор и графика обращаются к одному пулу. Так устроен GIGABYTE AI Top Atom — станция на суперчипе NVIDIA GB10 Grace Blackwell под Linux. Ее 128 гигабайт общие для процессора и графики, поэтому модель до 200 миллиардов параметров умещается целиком.
Графический блок GB10 не мощнее средней игровой карты, между RTX 5070 и 5070 Ti. Но LLM доступны именно ему. Плата за емкость — скорость: единая память медленнее видеопамяти флагмана, и та же 70-миллиардная модель отдает около трех токенов в секунду — небыстро, зато вы не упираетесь в потолок VRAM.
На что смотреть при выборе ИИ-ПК
Отсюда практическое правило: сборку под локальный ИИ оценивают по строке памяти — сколько ее и общая ли она у процессора с графикой. Именно этот объем отсекает, какая модель на машине запустится, а какая нет. Класс видеокарты остается важным для скорости, а потолок задает доступная емкость — потому под самые тяжелые LLM сильнейшей выходит конфигурация без дискретной графики, с большим общим пулом.
Последние новости
Зеленский раскрыл детали встречи с Lockheed Martin: Украина и США расширяют оборонное партнерство
21:44Операция "МоЛоЧКа": СБС подбили 201 корабль "теневого флота" РФ, Керченский пролив заблокирован
19:49