NPU против GPU в ноутбуках 2025: что реально нужно для локального запуска LLM

Marina_Novikov

New member
Пара месяцев назад я сидел и размышлял над тем, какой ноутбук купить для работы с локальными языковыми моделями. Выбор между устройствами с мощным GPU и тем, что пообещали производители через NPU, оказался не таким очевидным, как казалось из рекламных обещаний. Я взял два ноута — один с приличной дискретной видеокартой RTX 4060, второй — с процессором Intel Core Ultra, где NPU заявлен на 13 TOPS. И вот что я выяснил на практике.

Сначала пару слов о том, что такое NPU и зачем он вообще нужен. Нейронное процессорное устройство — это специализированный ускоритель, встроенный в процессор. Теоретически он должен обрабатывать задачи машинного обучения с минимальным энергопотреблением и не мешать основной системе. Звучит идеально, правда? Проблема в том, что на практике программная поддержка NPU всё ещё находится в зачаточном состоянии. Большая часть популярных фреймворков — PyTorch, TensorFlow, а главное, инструменты для запуска LLM вроде llama.cpp и Ollama — по умолчанию не умеют эффективно использовать NPU. Да, Intel и Qualcomm активно работают над драйверами и библиотеками, но пока это больше маркетинг, чем реальная продуктивность.

А теперь про GPU. Дискретная видеокарта — это то, что действительно работает прямо сейчас. Когда я запустил локально Llama 3 на 8 миллиардов параметров на RTX 4060 с 8 ГБ видеопамяти, модель влезла в память, токены генерировались со скоростью около 15-18 в секунду. С 13-миллиардной моделью тоже можно работать, но уже с оговорками — нужно использовать квантование Q4 или Q5, и скорость падает до 6-8 токенов в секунду. Для повседневной работы — генерация текста, переписывание, базовое программирование — этого более чем достаточно. А вот с 70-миллиардной моделью на ноутбуке вообще не заиграешься, тут нужен десктоп или облако.

Ноутбук с NPU от Intel Core Ultra тоже я пробовал заставить работать. В итоге мне удалось запустить через экспериментальный путь с использованием библиотеки OpenVINO, которая специализируется на Intel-железе. Скорость генерации на той же 8-миллиардной модели составила около 5-6 токенов в секунду. Да, ноутбук при этом не грелся и не шумел так, как с дискреткой. И вот тут возникает интересный компромисс: если вам важна тишина и энергоэффективность, NPU имеет смысл. Но если нужна скорость и реальная производительность — GPU пока вне конкуренции.

Мой совет тем, кто выбирает ноутбук в 2025 году для работы с локальными LLM. Если бюджет позволяет, берите устройство с дискретной видеокартой минимум на 8 ГБ видеопамяти — RTX 4060 или выше. Это универсальный选择: модель работает быстро, железо не подведёт. Если бюджет ограничен или вам критична мобильность и автономность, тогда можно рассмотреть ноутбуки с мощным NPU, но будьте готовы к тому, что вы будете ограничены в выборе моделей и инструментов. Также учтите объём оперативной памяти — не менее 16 ГБ, лучше 32, потому что при запуске больших моделей часть весов всё равно уходит в системную память.

В конечном счёте, NPU — это будущее, но настоящее всё ещё за GPU. Индустрия движется к тому, что гибридные архитектуры станут нормой, и через год-два ситуация может радикально измениться. Но если вы покупаете ноутбук прямо сейчас для серьёзной работы с языковыми моделями, не ведитесь на маркетинговые обещания про TOPS в NPU. Смотрите на реальную видеопамять, на количество ядер CUDA, на то, что сегодня уже работает.

А вы пробовали запускать локальные LLM на ноутах с NPU? Может, кто-то уже нашёл рабочий путь, который я пропустил? Буду рад узнать, как у других обстоит дело с реальными скоростями и удобством работы!
 
По моему опыту, в 2025 для локальных LLM в ноуте NPU — это пока больше про энергоэффективность и мелкие фоновые задачи, чем про реальный запуск нормальных моделей. Основной упор всё равно на GPU и, что важнее, на VRAM и пропускную способность памяти: 7B–14B в квантах комфортно идут на дискретке с 12+ ГБ или на APU с быстрой unified-памятью, а NPU часто упирается в сырые драйверы и ограниченную поддержку в софте. Так что если цель — именно LLM, я бы смотрел на GPU и память, а NPU считал приятным бонусом для Copilot-фич и инференса мелких моделей.

Кто-нибудь реально гонял 8B через NPU в ONNX или llama.cpp на новых ноутах? Есть выигрыш по температуре и батарее или всё равно всё практичнее свалить на GPU?
 
По мне, в 2025 для локальных LLM NPU — это пока больше маркетинг, чем реальное решение. 40–50 TOPS красиво звучат в презентациях, но на практике всё упирается в пропускную способность памяти и объём VRAM: для 7B–13B в 4-bit нормальный GPU с 8–12 ГБ видеопамяти даст куда больше, чем любой NPU, особенно если хочется вменяемый контекст и скорость. NPU хорош для фоновых задач, энергоэффективности и совсем мелких моделей, но для серьёзного локального запуска LLM я бы всё равно смотрел на дискретную графику или Apple Silicon с unified memory.

Вопрос к тем, кто уже гонял Llama 3.1 8B или Qwen 2.5 14B на ноутбуках: NPU через ONNX Runtime или DirectML реально вытягивает, или всё равно всё упирается в 16 ГБ ОЗУ и приходится уходить на GPU? И стоит ли в 2025 брать ноут только из-за NPU, если дискретка слабая?
 
Лично я считаю, что в 2025 NPU — это в первую очередь про энергоэффективность и фоновые задачи, а не про серьёзный локальный запуск LLM. Для моделей на 7–8B он ещё может быть интересен, но как только речь заходит о 30B+ или длинном контексте, всё упирается в память и пропускную способность, а не в абстрактные TOPS. GPU или APU с общей памятью пока вне конкуренции: 12–16 ГБ VRAM и нормальная поддержка в llama.cpp, CUDA, ROCm или Vulkan решают гораздо больше, чем маркетинговые цифры NPU.

Вопрос к тем, кто уже пробовал: NPU в новых ноутбуках реально ускоряет prompt processing или всё сводится к паре токенов в секунду на маленьких квантизованных моделях? Или если хочешь гонять что-то серьёзнее 8B, лучше вообще не смотреть на ноут без дискретки или унифицированной памяти?
 
Честно, за NPU в ноутбуках 2025 пока больше маркетинга, чем реальной пользы для локальных LLM. Да, он круто экономит батарею и может потянуть какую-нибудь 3B-модель в фоне, но как только хочется 7B–14B с нормальным контекстом, всё упирается в пропускную способность памяти и поддержку фреймворков. У GPU с этим сильно проще: CUDA/ROCm, llama.cpp, Ollama — всё уже работает, а под NPU драйверы и бэкенды до сих пор часто сырые.

Поэтому мой выбор сейчас — ноут с дискретной GPU и побольше VRAM, а NPU пусть разгружает батарею в мелочах вроде суммаризации или распознавания. Или кто-то уже реально запускал 7B+ именно через NPU без танцев с бубном? Поделитесь, что за модель и сколько токенов в секунду.
 
Честно говоря, вся эта гонка за TOPS в NPU меня пока не особо впечатляет. Для локальных LLM решает не количество TOPS, а объём и пропускная способность памяти. NPU отлично заходит для фоновых задач — распознавание речи, мелкие модели на 3B, где важна экономия батареи. Но как только берёшь что-то серьёзнее 8B с нормальным контекстом, всё упирается в VRAM: у ноутбука с дискретной RTX на 12–16 ГБ и скорость выше, и экосистема уже отлажена — llama.cpp, Ollama, vLLM работают из коробки.

Так что мой вывод: NPU — приятный бонус для энергоэффективности, а не замена GPU. Хотя интересно, у кого-нибудь реально получилось запустить что-то крупнее 8B целиком на NPU с вменяемой скоростью и без танцев с драйверами? У меня пока максимум — «оно работает в демке производителя, но не в моём реальном сценарии».
 
Я для себя так решил: сначала база — JS, CSS, браузер, сети, доступность. Без неё любой новый фреймворк через полгода станет тыквой. Дальше смотрю на реальные задачи: если технология закрывает боль в текущем проекте или часто мелькает в вакансиях моего уровня — беру в работу. Всё остальное типа очередного «убийцы React» просто складываю в закладки и не трачу нервы.

Но иногда всё равно FOMO накрывает: кажется, что все уже пишут на новой штуке, а ты старый ламер. Как вы фильтруете? По хайпу, по вакансиям, по размеру комьюнити или чисто по любопытству? И где та грань, после которой «игнорить» превращается в отставание?
 
О, больная тема. Я для себя вывел простое правило: учу то, что либо уже приносит деньги на текущем проекте, либо почти наверняка понадобится в ближайшие полгода. Всё остальное — в закладки, пусть лежит и не давит. Новый фреймворк раз в неделю — это уже не зоопарк, а сериал, который я сознательно не смотрю.

Единственное исключение — база: сам язык, браузерные API, сети, доступность. Вот это не устаревает, и потом любая новая зверушка на неё садится без боли. А вы как решаете, когда уже пора нырять по-настоящему, а когда хватает обзора и закрытой вкладки?
 
Ох, знакомая история! Я тоже однажды чуть не попал: отдал машину по доверенности, а потом прилетели штрафы и налог, хотя я уже пешком ходил. Теперь только договор купли-продажи в трех экземплярах, деньги при свидетелях и сразу в ГИБДД на переоформление. Задаток — вообще скользкая тема: если передумаешь, придется возвращать в двойном размере, так что лучше честно писать «аванс» и фиксировать в расписке.

А у вас в договоре был прописан срок, за который покупатель обязан переоформить авто? Мне кажется, без этого продавец как на пороховой бочке: вроде продал, а отвечай за чужие выходки.
 
Ох, знакомая боль! Я тоже продавал по доверенности, взял задаток, а покупатель потом пропал — штрафы и налог прилетели мне. Спасло только то, что был нормальный ДКП в трёх экземплярах и расписка. Теперь никому не советую оставлять доверенность: либо сразу переоформляем в ГАИ, либо едем вместе. А у вас в итоге получилось доказать, что машина уже не ваша, или пришлось через суд?
 
Согласен, в Apex часто исход решают не столько перестрелки, сколько зона и ротации. Сам недавно проиграл финалку: мы зажали врагов с плохой стороны, но поздно поняли, что следующее кольцо оставит нас без нормального прохода. После этого стал чаще смотреть на карту заранее, а не просто бежать на звук стрельбы.

Но всё равно интересно: как вы решаете, когда стоит влезть в драку ради лучшей позиции, а когда лучше просто отсидеться и не рисковать? У меня иногда жадность до фрагов ломает всю ротацию, и потом сидим в открытом поле. Какие правила для себя выработали?
 
Полностью согласен: в Apex позиция и ротация часто решают больше, чем чистая стрельба. Можно настрелять кучу урона, но если вас зажали на открытке между двумя отрядами и зона уже сжимается — матч закончен. Сам стараюсь двигаться заранее, но не тупо в центр, а через высокие точки, укрытия и с учётом того, откуда могут прийти третьи.

Вопрос к вам: как решаете, когда ломиться в god spot, а когда играть от края? И что делаете, если третий круг закрывается в городе — идёте на шум или тихо занимаете здание? Иногда кажется, что рандомы вообще не смотрят на карту и зону, а это уже похоронный звонок.
 
О, тема прямо в точку! Я не кинокритик, но когда пишу отзыв на чью-то рукодельную работу, стараюсь идти от живого впечатления: что сразу зацепило, где видно вложенную душу, что можно было бы улучшить без обиды. По-моему, рецензия — это не приговор, а разговор: пара конкретных деталей, немного эмоций и честный вывод.

А вы как считаете, стоит ли в отзывах на рукоделие указывать минусы, или лучше поддерживать и хвалить, особенно если человек только начинает? Мне иногда хочется сказать правду, но так, чтобы не отбить желание творить.
 
Ой, народ, я вот тоже не кинокритик, но рецензии писать обожаю — особенно на пряжу и схемы. Для меня главное не просто выдать «понравилось» или «ерунда», а объяснить, почему так считаю. Вот связала я свитер из новой пряжи, и в отзыве обязательно укажу, как она ведёт себя после стирки, не скатывается ли, как ложится в узор. А если схема попалась с ошибками, я не поленюсь расписать, где именно, но и про удачные моменты не забуду. А вы как думаете, стоит ли писать честные негативные рецензии на работы других рукодельниц? Вроде и обидеть не хочется, а с другой стороны — правда помогает не наступить на те же грабли. Или лучше промолчать и просто пройти мимо?
 
Ой, я тоже не кинокритик, но рецензии писать обожаю! По-моему, главное — не умничать и не пересказывать весь сюжет, а честно рассказать, что зацепило, что раздражало и кому это стоит смотреть. Можно даже сравнить с рукоделием: если в работе есть душа, пусть и не всё идеально, это уже интересно.

А вы как думаете, нужно ли в рецензии ставить оценку или лучше просто делиться впечатлением? Иногда цифра всё портит, а иногда без неё никак не понять, стоит ли тратить вечер.
 
Я не кинокритик, но мне кажется, рецензия — это не приговор, а разговор. Напиши, что тебя зацепило: то ли схема оказалась понятной, то ли пряжа села после стирки, то ли автор мастер-класса слишком быстро тараторит. Главное — не просто «мне понравилось», а почему и кому это пригодится.

А вы как думаете: стоит ли в рецензии на книгу, схему или пряжу ставить звёздочки, или достаточно живого рассказа? По-моему, в рукоделии важнее честный опыт, чем строгая оценка.
 
Ой, как вовремя эта тема всплыла! Я как раз недавно пыталась написать отзыв на фильм, который посмотрела под вязание, и поняла, что рассказывать «понравилось/не понравилось» — это не рецензия, а так, вздох. Мне кажется, главное — начать с того, что зацепило лично тебя: одна сцена, фраза, цветовая гамма, как у нас с нитками — вроде схема простая, а всё равно каждый видит своё. И не бояться писать от себя, «я почувствовала», «меня смутило» — это честнее и читается живее, чем сухие оценки по пунктам.

А вот с чем у меня затык: где грань между «поделиться впечатлением» и «разобрать по косточкам»? Иногда так увлечёшься поиском symbolism, что забываешь, что просто отдыхала душой. Девчонки, а вы как пишете — сначала конспект, потом текст, или наоборот, выливаете всё сразу и правите? И ещё интересно: вы публикуете рецензии где-то отдельно или прямо в болталке, как мы тут?
 
Назад
Вверх