Домашний IT своими рукамиПроверено руками, а не пересказано
Технологии
для осознанной жизни
Подписаться
Нейросети

Нейросеть на своём компьютере: Ollama с нуля и честные замеры на видеокарте с 4 ГБ

Как установить Ollama на Windows, какую модель выбрать для видеокарты с 4 ГБ и как сделать чат в браузере. Замеры 7 моделей на видеокарте и процессоре.

10 минут чтения Обсудить
Ollama в терминале на домашнем компьютере: нейросети локально, приватно и без облака
Проверено: сентябрь 2026, Ollama 0.34.1, Open WebUI 0.11.3, Windows 10 22H2, AMD RX 6500 XT 4 ГБ. Все цифры - собственные замеры, скриншоты с реальной установки.
Содержание статьи
  1. Зачем нейросеть на своём компьютере
  2. Шаг 1. Установить Ollama
  3. Шаг 2. Проверить, что Ollama видит видеокарту
  4. Шаг 3. Первая модель
  5. Какую модель выбрать для видеокарты на 4 ГБ
  6. Шаг 4. Удобный чат в браузере: Open WebUI
  7. А как же LM Studio?
  8. Где лежат модели и как их перенести
  9. Частые вопросы

Обычно статьи про локальные нейросети пишут владельцы видеокарт с 24 ГБ памяти. У большинства людей дома карта попроще. Поэтому здесь всё проверено на скромном компьютере:

Что Мой тестовый компьютер
Процессор AMD Ryzen 5 5600G (6 ядер)
Оперативная память 32 ГБ
Видеокарта AMD Radeon RX 6500 XT, 4 ГБ видеопамяти
Система Windows 10 22H2

Спойлер: на такой карте вполне можно пользоваться нейросетью каждый день. Но выбор модели решает всё: одна и та же видеокарта выдаёт от 7 до 43 токенов в секунду в зависимости от модели.

Зачем нейросеть на своём компьютере

  • Приватность. Текст не уходит на чужие серверы. Можно спокойно вставлять рабочие документы, переписку, личные заметки.
  • Бесплатно и без лимитов. Ни подписок, ни «вы исчерпали запросы на сегодня».
  • Работает без интернета. Модель скачивается один раз.

Честно о минусах: маленькая локальная модель заметно глупее больших облачных сервисов. Она хорошо справляется с письмами, пересказом, переводом, простыми объяснениями и черновиками. Сложные рассуждения и точные факты лучше перепроверять.

Шаг 1. Установить Ollama

Ollama - бесплатная программа, которая скачивает и запускает нейросети одной командой.

Требования: Windows 10 22H2 или новее, около 4 ГБ на диске под саму программу (у меня установка заняла 2,7 ГБ) плюс место под модели, от 2 до 7 ГБ на каждую.

Установить можно двумя способами:

  • скачать установщик с сайта ollama.com и запустить;
  • или одной командой в PowerShell:
PowerShell
winget install --id Ollama.Ollama

После установки Ollama работает в фоне, его значок появляется в трее. Проверка в PowerShell:

PowerShell
ollama --version
Вывод
ollama version is 0.34.1

Шаг 2. Проверить, что Ollama видит видеокарту

Это важно: если видеокарта не подхватилась, всё будет работать на процессоре в 3-4 раза медленнее.

Нажмите Win+R, введите %LOCALAPPDATA%\Ollama и откройте файл server.log. Найдите строку со словами inference compute. У меня она такая:

Вывод
msg="inference compute" id=0 library=Vulkan name=Vulkan0
description="AMD Radeon(TM) RX 6500 XT" type=discrete total="4.0 GiB" available="3.4 GiB"

Видеокарта найдена, работает через Vulkan, доступно 3,4 ГБ из 4: остальное занимает сама Windows под изображение на мониторе.

Шаг 3. Первая модель

PowerShell
ollama run gemma4:e2b

Ollama скачает модель (7,2 ГБ) и откроет чат прямо в терминале. Пишете вопрос, получаете ответ. Выход из чата: /bye.

Полезные команды:

Команда Что делает
ollama list список скачанных моделей
ollama ps какие модели сейчас загружены и сколько из них на видеокарте
ollama pull имя скачать модель без запуска
ollama rm имя удалить модель
ollama run имя --verbose после ответа показать скорость
ollama run имя --think=false отключить «рассуждения вслух»

Вот как выглядит --verbose после ответа:

Вывод
total duration:       24.1626716s
load duration:        11.9889492s
prompt eval count:    37 token(s)
prompt eval rate:     112.08 tokens/s
eval count:           383 token(s)
eval rate:            32.35 tokens/s

Главная цифра здесь eval rate: скорость, с которой модель пишет ответ. Для комфортного чтения хватает 10-15 токенов в секунду, при 30 и выше текст появляется быстрее, чем успеваешь читать.

А ollama ps показывает, поместилась ли модель в видеопамять:

Вывод
NAME          ID              SIZE      PROCESSOR          CONTEXT
gemma4:e2b    7fbdbf8f5e45    6.4 GB    74%/26% CPU/GPU    4096

74%/26% CPU/GPU значит, что на видеокарту влезла только четверть модели. Если бы влезла целиком, было бы 100% GPU.

Какую модель выбрать для видеокарты на 4 ГБ

Я скачал семь популярных небольших моделей и прогнал каждую одинаково: один и тот же вопрос на русском, контекст 4096 токенов, три запуска подряд, в таблицу шёл средний по скорости из трёх. Потом повторил всё с отключённой видеокартой.

Скорость моделей на видеокарте RX 6500 XT и на процессоре
Скорость ответа, токенов в секунду. Больше - лучше.
Модель Скачать На видеокарте Видеокарта, ток/с Процессор, ток/с Русский язык
granite4.2:3b 2,2 ГБ 100 % 43,3 10,1 средне
llama3.2:3b 2,0 ГБ 96 % 42,4 10,3 плохо
gemma4:e2b 7,2 ГБ 26 % 32,5 13,2 хорошо
qwen3:4b 2,5 ГБ 78 % 17,9 8,1 многословно
qwen3.5:2b 2,7 ГБ 67 % 15,6 8,6 с ошибками
gemma3:4b 3,3 ГБ 46 % 12,2 8,1 хорошо
qwen3.5:4b 3,4 ГБ 51 % 7,2 6,5 лучше всех

Вопрос был такой: «Объясни простыми словами, чем отличается оперативная память от видеопамяти и почему для нейросети на компьютере важен объём видеопамяти». Оценка русского языка субъективная, по этому ответу:

  • llama3.2:3b быстрая, но вставляет в русский текст английские и даже испанские слова: «temporary данных», «heavily используются», «слишком pequeя».
  • qwen3.5:2b пишет гладко, но путает факты: у неё «процессор сам загружает фото из видеопамяти».
  • qwen3:4b даже с отключёнными рассуждениями начала отвечать фразой «Хорошо, мне нужно объяснить...» и рассуждала прямо в ответе.
  • granite4.2:3b отвечает по делу, но упрощённо.
  • gemma3:4b и gemma4:e2b дали понятные ответы с удачными сравнениями («оперативная память как рабочий стол»).
  • qwen3.5:4b написала самый аккуратный и грамотный текст, но медленнее всех.

Три вывода

1. Модель должна поместиться в видеопамять целиком. Когда granite4.2:3b и llama3.2:3b помещаются на карту полностью, они работают в 4 раза быстрее, чем на процессоре. А qwen3.5:4b, которая помещается наполовину, на видеокарте почти не быстрее процессора: 7,2 против 6,5. Половина модели на процессоре тормозит всё.

2. gemma4:e2b - исключение и лучший выбор для 4 ГБ. Она весит 7,2 ГБ и помещается на карту только на четверть, но всё равно выдаёт 32 токена в секунду при хорошем русском языке. Скорее всего, дело в архитектуре: буква «e» в названии означает «effective», то есть по-настоящему считается только около 2 миллиардов параметров. Заметная часть размера модели - справочные таблицы, которые просто читаются из памяти, и им не так страшно лежать в оперативной памяти, а не в видеопамяти. Нужно только 16 ГБ оперативной памяти или больше: в работе модель заняла 6,4 ГБ.

3. Меньше контекст - выше скорость. Контекст - это сколько текста модель «держит в голове» за один разговор. Если уменьшить его с 4096 до 2048 токенов, освобождается видеопамять. gemma3:4b ускорилась с 12,2 до 15,9 токена в секунду, qwen3.5:2b с 15,6 до 19,0. Для коротких вопросов этого хватает, для работы с длинными документами нет.

Итого для карты на 4 ГБ

  • на каждый день: gemma4:e2b;
  • когда важнее качество текста, чем скорость: qwen3.5:4b;
  • если оперативной памяти мало (8 ГБ): gemma3:4b или granite4.2:3b.

Шаг 4. Удобный чат в браузере: Open WebUI

Чат в терминале работает, но неудобен: нет истории, нет форматирования. Нормальный интерфейс, похожий на ChatGPT, даёт Open WebUI. Он сам находит Ollama и все скачанные модели.

Самый простой способ на Windows без Docker - поставить через Python.

  1. Установите Python 3.12 с python.org. Галочку «Add python.exe to PATH» можно не ставить.
  2. В PowerShell создайте для Open WebUI отдельное окружение и установите его:
PowerShell
py -3.12 -m venv C:\open-webui
C:\open-webui\Scripts\pip install open-webui

Установка скачивает много зависимостей и занимает около 2,3 ГБ.

  1. Запустите:
PowerShell
C:\open-webui\Scripts\open-webui serve

Первый запуск длится минуту-две: Open WebUI докачивает служебную модель для работы с документами. Когда в окне перестанут бежать строки, откройте в браузере http://localhost:8080.

  1. Создайте учётную запись. Первый пользователь становится администратором. Данные хранятся только у вас на компьютере, никуда не отправляются.
Регистрация в Open WebUI
Регистрация в Open WebUI

Интерфейс на русском. Модели из Ollama уже в списке, выбираются в строке ввода:

Выбор модели в Open WebUI
Выбор модели в Open WebUI

Пример настоящего ответа gemma4:e2b на бытовую задачу:

Ответ gemma4:e2b в Open WebUI
Ответ gemma4:e2b в Open WebUI

Строка «Рассуждение заняло 17 секунд» означает, что модель сначала подумала. Сами рассуждения можно развернуть и посмотреть.

Open WebUI занимает в памяти около 750 МБ. Чтобы открыть чат в следующий раз, снова выполните команду из пункта 3. Окно PowerShell не закрывайте, пока пользуетесь чатом.

Если у вас уже есть Docker, Open WebUI можно запустить в контейнере. Этот способ описан в официальной документации проекта.

А как же LM Studio?

LM Studio - популярная альтернатива: обычная программа с окнами, где модели ищутся и скачиваются кнопками. Внутри используется тот же движок llama.cpp, что и в Ollama, так что выводы про видеопамять из этой статьи верны и для неё. Если командная строка пугает, начните с LM Studio. Если нужен чат в браузере, доступ с телефона или подключение нейросети к другим программам, удобнее Ollama.

Где лежат модели и как их перенести

По умолчанию модели лежат в C:\Users\ИМЯ\.ollama\models. Семь моделей из этой статьи заняли почти 22 ГБ. Если диск C маленький:

  1. Панель управления → «Изменение переменных среды текущего пользователя».
  2. Создайте переменную OLLAMA_MODELS со значением, например, D:\ollama-models.
  3. Закройте Ollama через значок в трее и запустите снова.

Уже скачанные модели после этого нужно скачать заново или перенести папку вручную.

Частые вопросы

Нужна ли видеокарта вообще?

Нет. На процессоре Ryzen 5 5600G модели выдавали 6-13 токенов в секунду, это медленно, но пользоваться можно. Видеокарта ускоряет в 2-4 раза, если модель в неё помещается.

Сколько нужно оперативной памяти?

Для моделей из этой статьи хватит 16 ГБ. С 8 ГБ берите модели до 3 ГБ и закройте браузер с сотней вкладок.

Работает ли на встроенной графике Ryzen или Intel?

По умолчанию Ollama встроенную графику не использует, работает на процессоре или дискретной видеокарте. Включить её можно переменной OLLAMA_IGPU_ENABLE, но в этой статье я её не проверял.

Модель отвечает на английском. Что делать?

Пишите вопрос на русском и при необходимости добавьте «Отвечай на русском». Если модель всё равно сбивается, возьмите другую: из протестированных лучше всего с русским у gemma4:e2b, gemma3:4b и qwen3.5:4b.

Можно ли дать нейросети свои документы?

Можно, в Open WebUI есть загрузка файлов прямо в чат. Подробный разбор будет в отдельной статье про чат с собственными документами на своём компьютере.

OllamaOpen WebUIлокальная нейросетьGemmaQwenвидеокарта
Статья помогла?

Комментарии

Без регистрации. Комментарии проходят проверку перед публикацией, ссылки не публикуются.

Пока никто не написал. Будьте первым.