Обычно статьи про локальные нейросети пишут владельцы видеокарт с 24 ГБ памяти. У большинства людей дома карта попроще. Поэтому здесь всё проверено на скромном компьютере:
| Что | Мой тестовый компьютер |
|---|---|
| Процессор | AMD Ryzen 5 5600G (6 ядер) |
| Оперативная память | 32 ГБ |
| Видеокарта | AMD Radeon RX 6500 XT, 4 ГБ видеопамяти |
| Система | Windows 10 22H2 |
Спойлер: на такой карте вполне можно пользоваться нейросетью каждый день. Но выбор модели решает всё: одна и та же видеокарта выдаёт от 7 до 43 токенов в секунду в зависимости от модели.
Зачем нейросеть на своём компьютере
- Приватность. Текст не уходит на чужие серверы. Можно спокойно вставлять рабочие документы, переписку, личные заметки.
- Бесплатно и без лимитов. Ни подписок, ни «вы исчерпали запросы на сегодня».
- Работает без интернета. Модель скачивается один раз.
Честно о минусах: маленькая локальная модель заметно глупее больших облачных сервисов. Она хорошо справляется с письмами, пересказом, переводом, простыми объяснениями и черновиками. Сложные рассуждения и точные факты лучше перепроверять.
Шаг 1. Установить Ollama
Ollama - бесплатная программа, которая скачивает и запускает нейросети одной командой.
Требования: Windows 10 22H2 или новее, около 4 ГБ на диске под саму программу (у меня установка заняла 2,7 ГБ) плюс место под модели, от 2 до 7 ГБ на каждую.
Установить можно двумя способами:
- скачать установщик с сайта ollama.com и запустить;
- или одной командой в PowerShell:
winget install --id Ollama.OllamaПосле установки Ollama работает в фоне, его значок появляется в трее. Проверка в PowerShell:
ollama --versionollama version is 0.34.1Шаг 2. Проверить, что Ollama видит видеокарту
Это важно: если видеокарта не подхватилась, всё будет работать на процессоре в 3-4 раза медленнее.
Нажмите Win+R, введите %LOCALAPPDATA%\Ollama и откройте файл server.log. Найдите строку со словами inference compute. У меня она такая:
msg="inference compute" id=0 library=Vulkan name=Vulkan0
description="AMD Radeon(TM) RX 6500 XT" type=discrete total="4.0 GiB" available="3.4 GiB"Видеокарта найдена, работает через Vulkan, доступно 3,4 ГБ из 4: остальное занимает сама Windows под изображение на мониторе.
Шаг 3. Первая модель
ollama run gemma4:e2bOllama скачает модель (7,2 ГБ) и откроет чат прямо в терминале. Пишете вопрос, получаете ответ. Выход из чата: /bye.
Полезные команды:
| Команда | Что делает |
|---|---|
ollama list |
список скачанных моделей |
ollama ps |
какие модели сейчас загружены и сколько из них на видеокарте |
ollama pull имя |
скачать модель без запуска |
ollama rm имя |
удалить модель |
ollama run имя --verbose |
после ответа показать скорость |
ollama run имя --think=false |
отключить «рассуждения вслух» |
Вот как выглядит --verbose после ответа:
total duration: 24.1626716s
load duration: 11.9889492s
prompt eval count: 37 token(s)
prompt eval rate: 112.08 tokens/s
eval count: 383 token(s)
eval rate: 32.35 tokens/sГлавная цифра здесь eval rate: скорость, с которой модель пишет ответ. Для комфортного чтения хватает 10-15 токенов в секунду, при 30 и выше текст появляется быстрее, чем успеваешь читать.
А ollama ps показывает, поместилась ли модель в видеопамять:
NAME ID SIZE PROCESSOR CONTEXT
gemma4:e2b 7fbdbf8f5e45 6.4 GB 74%/26% CPU/GPU 409674%/26% CPU/GPU значит, что на видеокарту влезла только четверть модели. Если бы влезла целиком, было бы 100% GPU.
Какую модель выбрать для видеокарты на 4 ГБ
Я скачал семь популярных небольших моделей и прогнал каждую одинаково: один и тот же вопрос на русском, контекст 4096 токенов, три запуска подряд, в таблицу шёл средний по скорости из трёх. Потом повторил всё с отключённой видеокартой.
| Модель | Скачать | На видеокарте | Видеокарта, ток/с | Процессор, ток/с | Русский язык |
|---|---|---|---|---|---|
| granite4.2:3b | 2,2 ГБ | 100 % | 43,3 | 10,1 | средне |
| llama3.2:3b | 2,0 ГБ | 96 % | 42,4 | 10,3 | плохо |
| gemma4:e2b | 7,2 ГБ | 26 % | 32,5 | 13,2 | хорошо |
| qwen3:4b | 2,5 ГБ | 78 % | 17,9 | 8,1 | многословно |
| qwen3.5:2b | 2,7 ГБ | 67 % | 15,6 | 8,6 | с ошибками |
| gemma3:4b | 3,3 ГБ | 46 % | 12,2 | 8,1 | хорошо |
| qwen3.5:4b | 3,4 ГБ | 51 % | 7,2 | 6,5 | лучше всех |
Вопрос был такой: «Объясни простыми словами, чем отличается оперативная память от видеопамяти и почему для нейросети на компьютере важен объём видеопамяти». Оценка русского языка субъективная, по этому ответу:
- llama3.2:3b быстрая, но вставляет в русский текст английские и даже испанские слова: «temporary данных», «heavily используются», «слишком pequeя».
- qwen3.5:2b пишет гладко, но путает факты: у неё «процессор сам загружает фото из видеопамяти».
- qwen3:4b даже с отключёнными рассуждениями начала отвечать фразой «Хорошо, мне нужно объяснить...» и рассуждала прямо в ответе.
- granite4.2:3b отвечает по делу, но упрощённо.
- gemma3:4b и gemma4:e2b дали понятные ответы с удачными сравнениями («оперативная память как рабочий стол»).
- qwen3.5:4b написала самый аккуратный и грамотный текст, но медленнее всех.
Три вывода
1. Модель должна поместиться в видеопамять целиком. Когда granite4.2:3b и llama3.2:3b помещаются на карту полностью, они работают в 4 раза быстрее, чем на процессоре. А qwen3.5:4b, которая помещается наполовину, на видеокарте почти не быстрее процессора: 7,2 против 6,5. Половина модели на процессоре тормозит всё.
2. gemma4:e2b - исключение и лучший выбор для 4 ГБ. Она весит 7,2 ГБ и помещается на карту только на четверть, но всё равно выдаёт 32 токена в секунду при хорошем русском языке. Скорее всего, дело в архитектуре: буква «e» в названии означает «effective», то есть по-настоящему считается только около 2 миллиардов параметров. Заметная часть размера модели - справочные таблицы, которые просто читаются из памяти, и им не так страшно лежать в оперативной памяти, а не в видеопамяти. Нужно только 16 ГБ оперативной памяти или больше: в работе модель заняла 6,4 ГБ.
3. Меньше контекст - выше скорость. Контекст - это сколько текста модель «держит в голове» за один разговор. Если уменьшить его с 4096 до 2048 токенов, освобождается видеопамять. gemma3:4b ускорилась с 12,2 до 15,9 токена в секунду, qwen3.5:2b с 15,6 до 19,0. Для коротких вопросов этого хватает, для работы с длинными документами нет.
Итого для карты на 4 ГБ
- на каждый день: gemma4:e2b;
- когда важнее качество текста, чем скорость: qwen3.5:4b;
- если оперативной памяти мало (8 ГБ): gemma3:4b или granite4.2:3b.
Шаг 4. Удобный чат в браузере: Open WebUI
Чат в терминале работает, но неудобен: нет истории, нет форматирования. Нормальный интерфейс, похожий на ChatGPT, даёт Open WebUI. Он сам находит Ollama и все скачанные модели.
Самый простой способ на Windows без Docker - поставить через Python.
- Установите Python 3.12 с python.org. Галочку «Add python.exe to PATH» можно не ставить.
- В PowerShell создайте для Open WebUI отдельное окружение и установите его:
py -3.12 -m venv C:\open-webui
C:\open-webui\Scripts\pip install open-webuiУстановка скачивает много зависимостей и занимает около 2,3 ГБ.
- Запустите:
C:\open-webui\Scripts\open-webui serveПервый запуск длится минуту-две: Open WebUI докачивает служебную модель для работы с документами. Когда в окне перестанут бежать строки, откройте в браузере http://localhost:8080.
- Создайте учётную запись. Первый пользователь становится администратором. Данные хранятся только у вас на компьютере, никуда не отправляются.

Интерфейс на русском. Модели из Ollama уже в списке, выбираются в строке ввода:

Пример настоящего ответа gemma4:e2b на бытовую задачу:

Строка «Рассуждение заняло 17 секунд» означает, что модель сначала подумала. Сами рассуждения можно развернуть и посмотреть.
Open WebUI занимает в памяти около 750 МБ. Чтобы открыть чат в следующий раз, снова выполните команду из пункта 3. Окно PowerShell не закрывайте, пока пользуетесь чатом.
Если у вас уже есть Docker, Open WebUI можно запустить в контейнере. Этот способ описан в официальной документации проекта.
А как же LM Studio?
LM Studio - популярная альтернатива: обычная программа с окнами, где модели ищутся и скачиваются кнопками. Внутри используется тот же движок llama.cpp, что и в Ollama, так что выводы про видеопамять из этой статьи верны и для неё. Если командная строка пугает, начните с LM Studio. Если нужен чат в браузере, доступ с телефона или подключение нейросети к другим программам, удобнее Ollama.
Где лежат модели и как их перенести
По умолчанию модели лежат в C:\Users\ИМЯ\.ollama\models. Семь моделей из этой статьи заняли почти 22 ГБ. Если диск C маленький:
- Панель управления → «Изменение переменных среды текущего пользователя».
- Создайте переменную
OLLAMA_MODELSсо значением, например,D:\ollama-models. - Закройте Ollama через значок в трее и запустите снова.
Уже скачанные модели после этого нужно скачать заново или перенести папку вручную.
Частые вопросы
Нужна ли видеокарта вообще?
Нет. На процессоре Ryzen 5 5600G модели выдавали 6-13 токенов в секунду, это медленно, но пользоваться можно. Видеокарта ускоряет в 2-4 раза, если модель в неё помещается.
Сколько нужно оперативной памяти?
Для моделей из этой статьи хватит 16 ГБ. С 8 ГБ берите модели до 3 ГБ и закройте браузер с сотней вкладок.
Работает ли на встроенной графике Ryzen или Intel?
По умолчанию Ollama встроенную графику не использует, работает на процессоре или дискретной видеокарте. Включить её можно переменной OLLAMA_IGPU_ENABLE, но в этой статье я её не проверял.
Модель отвечает на английском. Что делать?
Пишите вопрос на русском и при необходимости добавьте «Отвечай на русском». Если модель всё равно сбивается, возьмите другую: из протестированных лучше всего с русским у gemma4:e2b, gemma3:4b и qwen3.5:4b.
Можно ли дать нейросети свои документы?
Можно, в Open WebUI есть загрузка файлов прямо в чат. Подробный разбор будет в отдельной статье про чат с собственными документами на своём компьютере.

Комментарии
Пока никто не написал. Будьте первым.