Marina_Novikov
New member
Пара месяцев назад я сидел и размышлял над тем, какой ноутбук купить для работы с локальными языковыми моделями. Выбор между устройствами с мощным GPU и тем, что пообещали производители через NPU, оказался не таким очевидным, как казалось из рекламных обещаний. Я взял два ноута — один с приличной дискретной видеокартой RTX 4060, второй — с процессором Intel Core Ultra, где NPU заявлен на 13 TOPS. И вот что я выяснил на практике.
Сначала пару слов о том, что такое NPU и зачем он вообще нужен. Нейронное процессорное устройство — это специализированный ускоритель, встроенный в процессор. Теоретически он должен обрабатывать задачи машинного обучения с минимальным энергопотреблением и не мешать основной системе. Звучит идеально, правда? Проблема в том, что на практике программная поддержка NPU всё ещё находится в зачаточном состоянии. Большая часть популярных фреймворков — PyTorch, TensorFlow, а главное, инструменты для запуска LLM вроде llama.cpp и Ollama — по умолчанию не умеют эффективно использовать NPU. Да, Intel и Qualcomm активно работают над драйверами и библиотеками, но пока это больше маркетинг, чем реальная продуктивность.
А теперь про GPU. Дискретная видеокарта — это то, что действительно работает прямо сейчас. Когда я запустил локально Llama 3 на 8 миллиардов параметров на RTX 4060 с 8 ГБ видеопамяти, модель влезла в память, токены генерировались со скоростью около 15-18 в секунду. С 13-миллиардной моделью тоже можно работать, но уже с оговорками — нужно использовать квантование Q4 или Q5, и скорость падает до 6-8 токенов в секунду. Для повседневной работы — генерация текста, переписывание, базовое программирование — этого более чем достаточно. А вот с 70-миллиардной моделью на ноутбуке вообще не заиграешься, тут нужен десктоп или облако.
Ноутбук с NPU от Intel Core Ultra тоже я пробовал заставить работать. В итоге мне удалось запустить через экспериментальный путь с использованием библиотеки OpenVINO, которая специализируется на Intel-железе. Скорость генерации на той же 8-миллиардной модели составила около 5-6 токенов в секунду. Да, ноутбук при этом не грелся и не шумел так, как с дискреткой. И вот тут возникает интересный компромисс: если вам важна тишина и энергоэффективность, NPU имеет смысл. Но если нужна скорость и реальная производительность — GPU пока вне конкуренции.
Мой совет тем, кто выбирает ноутбук в 2025 году для работы с локальными LLM. Если бюджет позволяет, берите устройство с дискретной видеокартой минимум на 8 ГБ видеопамяти — RTX 4060 или выше. Это универсальный选择: модель работает быстро, железо не подведёт. Если бюджет ограничен или вам критична мобильность и автономность, тогда можно рассмотреть ноутбуки с мощным NPU, но будьте готовы к тому, что вы будете ограничены в выборе моделей и инструментов. Также учтите объём оперативной памяти — не менее 16 ГБ, лучше 32, потому что при запуске больших моделей часть весов всё равно уходит в системную память.
В конечном счёте, NPU — это будущее, но настоящее всё ещё за GPU. Индустрия движется к тому, что гибридные архитектуры станут нормой, и через год-два ситуация может радикально измениться. Но если вы покупаете ноутбук прямо сейчас для серьёзной работы с языковыми моделями, не ведитесь на маркетинговые обещания про TOPS в NPU. Смотрите на реальную видеопамять, на количество ядер CUDA, на то, что сегодня уже работает.
А вы пробовали запускать локальные LLM на ноутах с NPU? Может, кто-то уже нашёл рабочий путь, который я пропустил? Буду рад узнать, как у других обстоит дело с реальными скоростями и удобством работы!
Сначала пару слов о том, что такое NPU и зачем он вообще нужен. Нейронное процессорное устройство — это специализированный ускоритель, встроенный в процессор. Теоретически он должен обрабатывать задачи машинного обучения с минимальным энергопотреблением и не мешать основной системе. Звучит идеально, правда? Проблема в том, что на практике программная поддержка NPU всё ещё находится в зачаточном состоянии. Большая часть популярных фреймворков — PyTorch, TensorFlow, а главное, инструменты для запуска LLM вроде llama.cpp и Ollama — по умолчанию не умеют эффективно использовать NPU. Да, Intel и Qualcomm активно работают над драйверами и библиотеками, но пока это больше маркетинг, чем реальная продуктивность.
А теперь про GPU. Дискретная видеокарта — это то, что действительно работает прямо сейчас. Когда я запустил локально Llama 3 на 8 миллиардов параметров на RTX 4060 с 8 ГБ видеопамяти, модель влезла в память, токены генерировались со скоростью около 15-18 в секунду. С 13-миллиардной моделью тоже можно работать, но уже с оговорками — нужно использовать квантование Q4 или Q5, и скорость падает до 6-8 токенов в секунду. Для повседневной работы — генерация текста, переписывание, базовое программирование — этого более чем достаточно. А вот с 70-миллиардной моделью на ноутбуке вообще не заиграешься, тут нужен десктоп или облако.
Ноутбук с NPU от Intel Core Ultra тоже я пробовал заставить работать. В итоге мне удалось запустить через экспериментальный путь с использованием библиотеки OpenVINO, которая специализируется на Intel-железе. Скорость генерации на той же 8-миллиардной модели составила около 5-6 токенов в секунду. Да, ноутбук при этом не грелся и не шумел так, как с дискреткой. И вот тут возникает интересный компромисс: если вам важна тишина и энергоэффективность, NPU имеет смысл. Но если нужна скорость и реальная производительность — GPU пока вне конкуренции.
Мой совет тем, кто выбирает ноутбук в 2025 году для работы с локальными LLM. Если бюджет позволяет, берите устройство с дискретной видеокартой минимум на 8 ГБ видеопамяти — RTX 4060 или выше. Это универсальный选择: модель работает быстро, железо не подведёт. Если бюджет ограничен или вам критична мобильность и автономность, тогда можно рассмотреть ноутбуки с мощным NPU, но будьте готовы к тому, что вы будете ограничены в выборе моделей и инструментов. Также учтите объём оперативной памяти — не менее 16 ГБ, лучше 32, потому что при запуске больших моделей часть весов всё равно уходит в системную память.
В конечном счёте, NPU — это будущее, но настоящее всё ещё за GPU. Индустрия движется к тому, что гибридные архитектуры станут нормой, и через год-два ситуация может радикально измениться. Но если вы покупаете ноутбук прямо сейчас для серьёзной работы с языковыми моделями, не ведитесь на маркетинговые обещания про TOPS в NPU. Смотрите на реальную видеопамять, на количество ядер CUDA, на то, что сегодня уже работает.
А вы пробовали запускать локальные LLM на ноутах с NPU? Может, кто-то уже нашёл рабочий путь, который я пропустил? Буду рад узнать, как у других обстоит дело с реальными скоростями и удобством работы!