
Главное за минуту
- Локальные модели Ollama поддерживают автономный чат в VS Code через BYOK.
- Для Open WebUI заранее подготовь модели и локальные службы обработки документов.
- OFFLINE_MODE не блокирует внешние соединения: сетевую изоляцию настраивают отдельно.
Как использовать Ollama на своём компьютере без интернета
Для работы без интернета используй локальные модели Ollama: VS Code поддерживает с ними автономный чат, а для Open WebUI нужно заранее подготовить модели и локальные службы. Скачивание нужных компонентов и проверку их работы проведи до отключения сети.
Где будет выполняться модель
При локальном запуске модель выполняется на твоём компьютере. Скорость зависит от его оборудования: большие модели работают медленно без мощного GPU, то есть графического процессора. Поэтому выбор локального варианта связан с проверкой компьютера, а не с одним фактом установки программы.
Облачные модели выполняются на серверах Ollama и не требуют скачивания. По данным сервиса, они быстро работают на любом компьютере. Это другой вариант выполнения: название Ollama встречается и в локальном, и в облачном сценарии, поэтому при настройке обращай внимание на выбранную модель.
Какой сценарий тебе нужен
В инструкции по настройке агенту предлагается сначала спросить, что пользователь хочет создать. Затем он должен рекомендовать локальные модели, облачные или оба варианта и объяснить выбор. Для этого гайда исходная задача конкретнее: подготовить работу на компьютере без подключения к интернету.
- Для чата и редактирования кода используй переключатель моделей в чате VS Code.
- Для Open WebUI подготовь локальную службу выполнения модели и отдельно обработку документов.
- Для разбора устройства RAG-приложения можно запустить пример Docker, который подбирает сочетания вина и еды.

Что подготовить перед установкой и отключением сети
Подготовку начни при доступном интернете. Руководство Open WebUI предлагает подключить локальный сервер выполнения модели, скачать выбранную модель и отправить тестовое сообщение. До этого отключать сеть для проверки автономного сценария рано: сначала нужны сами компоненты и проверка их совместной работы.
Проверь оборудование по документации
Инструкция Ollama предлагает перед настройкой прочитать индекс документации. После установки в ней предусмотрена проверка GPU и памяти компьютера по документации оборудования. Используй именно этот этап для оценки своей машины: приведённые дальше условия Docker относятся к отдельному примеру запуска.
Если локальные модели будут работать медленно, инструкция Ollama рекомендует облачные. Однако облачная модель выполняется на серверах сервиса. Для задачи без интернета такое предложение меняет исходный сценарий, поэтому его нужно рассматривать отдельно от подготовки локальной модели.
Подготовь доступ к Open WebUI
Руководство по автономному режиму начинается с рабочей установки Open WebUI и прав администратора. Это важно для дальнейших действий: выбор модели эмбеддингов в описанном примере выполняется через административные настройки документов. Подготовь этот доступ до перехода к проверке документов.
Способ входа должен оставаться доступным внутри изолированной сети. Если используется внешний поставщик идентификации, проверь вход до отключения доступа к нему. Возможность открыть интерфейс и возможность войти выбранным способом нужно учитывать при подготовке автономной установки.
- Подготовь рабочую установку Open WebUI.
- Обеспечь административный доступ к настройкам.
- Проверь метод входа, который останется доступным в изолированной сети.
Варианты из руководства Docker: условия на 7 октября 2026 года
| Окружение | Рекомендованное размещение Ollama и условия |
|---|---|
| Linux с Docker Engine | В контейнере при CUDA-совместимом GPU и хотя бы 8 GB оперативной памяти. |
| Windows 10/11 с Docker Desktop | В контейнере при CUDA-совместимом GPU и хотя бы 8 GB оперативной памяти. |
| Linux с Docker Desktop | Вне контейнера, с установкой и запуском на основной машине. |

Как установить Ollama и применять обновления
Инструкция установки начинается с проверки наличия команды ollama. Если команда отсутствует, предлагается установить CLI, то есть инструмент командной строки: на macOS и Linux через shell-скрипт, на Windows через PowerShell. Конкретный способ выбирай по своей операционной системе.
Установи инструмент командной строки
Установочный сценарий в источнике включает не один запуск установщика. После появления CLI инструкция требует сверить GPU и память с документацией, а затем определить задачу для выбора моделей. Такой порядок связывает установку с тем, что ты собираешься запускать на компьютере.
- Открой индекс документации Ollama, указанный на официальной странице установки.
- Установи Ollama CLI способом для своей ОС, если команда ollama отсутствует.
- Проверь GPU и память компьютера по документации Ollama.
Примени обновление на macOS или Windows
На macOS и Windows Ollama автоматически скачивает обновления. Для применения скачанного обновления предусмотрено отдельное действие в меню приложения. В инструкции скачивание и применение описаны раздельно: после получения обновления нужно воспользоваться пунктом Restart to update.
Открой пункт Ollama на панели задач или в строке меню.
Нажми Restart to update.
Обнови Linux или скачай версию вручную
Для обновления Ollama на Linux повторно запусти установочный скрипт с официальной страницы. Это описанный в FAQ способ обновления Linux; действие через Restart to update относится к приведённому выше сценарию приложения на macOS и Windows.
В FAQ также предусмотрена ручная установка обновления: можно скачать последнюю версию самостоятельно. Если выбираешь этот путь, ориентируйся на актуальную версию на официальной странице загрузки. Ручное скачивание указано как дополнительный способ получения обновления.
Как подключить локальные модели к VS Code
На дату проверки, 7 октября 2026 года, встроенный провайдер Ollama в VS Code помечен устаревшим. Для локальных моделей документация направляет к официальному расширению издателя Ollama в Visual Studio Marketplace. При настройке ориентируйся на этот вариант подключения.
Установи официальное расширение
Провайдер подключает модели к интерфейсу выбора в VS Code. Редактор моделей открывается через Manage Language Models в переключателе чата или команду Chat: Manage Language Models в палитре команд. После установки доступ настраивается по инструкции самого расширения.
- Открой редактор моделей командой Chat: Manage Language Models.
- Выбери Install Model Providers.
- Выбери официальное расширение от издателя Ollama.
- Нажми Install у выбранного расширения.
- Настрой доступ к моделям по инструкции расширения.
- Выбери нужную модель в поле ввода чата.
Раздели чат и другие функции редактора
BYOK здесь означает использование собственных моделей. В документации VS Code этот вариант позволяет работать без входа в GitHub и без плана Copilot, включая полностью автономные сценарии с локальными моделями Ollama. Это основание для настройки локального чата в редакторе.
Область BYOK ограничена чатом и служебными задачами. Семантический поиск, подсказки с автодополнением кода и функции, основанные на эмбеддингах, по-прежнему требуют аккаунта GitHub. Не переноси условия автономного чата на эти возможности редактора: для них документация сохраняет отдельное требование.
Проверь, где появилась модель
Модели установленного расширения должны появиться в переключателе чата и редакторе моделей. Если этого не произошло, документация предлагает перезагрузить VS Code. Для использования с агентами действует дополнительное условие: модель должна поддерживать вызов инструментов, иначе её не покажут в переключателе.
Как управлять выбором модели и рассуждениями в VS Code
Переключатель в поле ввода чата меняет модель для разговоров и редактирования кода. Помимо ручного выбора, VS Code описывает автоматический: редактор учитывает сложность задачи и доступность моделей в реальном времени. Для настройки конкретной модели используй её доступные параметры.
Что означает Thinking Effort
Некоторые модели поддерживают Thinking Effort, то есть настройку объёма рассуждений для отдельного запроса. Возможность зависит от модели. В документации она описана для моделей с рассуждением, поэтому отсутствие соответствующего подменю само по себе ещё не указывает на ошибку подключения.
Повышение уровня рассуждений увеличивает число токенов рассуждения и расход ИИ-кредитов. Это условие из документации VS Code на дату проверки, 7 октября 2026 года. Его не следует превращать в утверждение о стоимости локального запуска Ollama: здесь речь о расходе при настройке рассуждений.
Измени уровень для поддерживаемой модели
У моделей без рассуждения, например GPT-4.1 и GPT-4o, подменю Thinking Effort отсутствует. Эти названия приведены в документации как примеры такого ограничения. Не ищи у них настройку по инструкции для модели с рассуждением.
- Открой переключатель моделей в поле ввода чата.
- Выбери модель с рассуждением.
- Нажми стрелку > рядом с названием модели.
- Выбери уровень в подменю Thinking Effort.
Когда рассматривают Custom Endpoint
В VS Code также описан Custom Endpoint, вариант подключения с выбором типа API. Он поддерживает Chat Completions, Responses и Anthropic Messages API; тип выбирается для провайдера или отдельной модели. Для локальной Ollama документация при этом отдельно рекомендует официальное расширение.
Как подготовить Open WebUI к автономному чату и документам
Локальный запуск интерфейса Open WebUI не делает локальными подключённые к нему службы. До отключения интернета подготовь инференс, то есть выполнение модели, эмбеддинги для работы с документами и извлечение их содержимого. Обычный чат и обработку файлов проверяют отдельно.
Подготовь модель и необходимые службы
Автономная работа с документами требует скачанной модели эмбеддингов или доступной локальной службы эмбеддингов, а также локального извлечения содержимого. Если включено переранжирование, для повторного упорядочивания результатов нужен локальный переранжировщик. Последнее требование действует при включённой функции, а не автоматически для установки.
- Подключи локальный сервер выполнения модели к установленному Open WebUI.
- Скачай модель, которую собираешься использовать.
- Отправь тестовое сообщение.
- Настрой локальное извлечение содержимого документов.
- Настрой локальные эмбеддинги.
- Скачай дополнительные модели переранжирования или речи, если они нужны.
- Проверь работу выбранных дополнительных моделей.
Скачай модель для обработки документов
В Admin Settings → Documents выбери локальную модель эмбеддингов и воспользуйся элементом скачивания. В руководстве в качестве примера указана sentence-transformers/all-MiniLM-L6-v2. Это пример выбора в настройках документов; модель для обычного чата проверяется своим тестовым сообщением.
Для проверки загрузи небольшой PDF с текстом или текстовый файл. После обработки задай вопрос, ответ на который находится в файле. Такой тест соответствует проверке документов из руководства; успешный разговор без файла не подтверждает готовность этой части установки.
Проверь сохранность данных при перезапуске
Данные приложения и кеши моделей должны находиться в постоянном хранилище. До отключения интернета перезапусти установку и проверь, что она использует это хранилище. Этот шаг в руководстве идёт до автономного теста, пока нужные компоненты ещё можно подготовить с доступной сетью.

Как включить автономный режим и проверить изоляцию
Переменные автономного режима задают после подготовки моделей и зависимостей, затем Open WebUI перезапускают. Само включение такого режима не равно запрету внешних соединений. Настройки приложения и ограничения сети выполняют разные задачи, поэтому проверка нужна для обеих частей.
Что меняет OFFLINE_MODE
OFFLINE_MODE=true устанавливает HF_HUB_OFFLINE=1, отключает проверку версии и принудительно переводит все три флага *_AUTO_UPDATE в false. Это описанное поведение на дату проверки, 7 октября 2026 года. Переменную задают через конфигурацию окружения используемого развёртывания.
При HF_HUB_OFFLINE=1 отсутствующие модели скачать нельзя. Из-за этого новая установка может успешно запуститься, но дать сбой при первой загрузке документа или вопросе по нему. Появившийся интерфейс ещё не подтверждает, что модели для обработки файлов подготовлены.
Чем ограничить внешние подключения
Переменные автономного режима не блокируют исходящие соединения. Внешние API моделей, поставщики авторизации OAuth, веб-поиск, инструменты и другие настроенные службы могут обращаться в сеть, если она это разрешает. Поэтому значение OFFLINE_MODE не служит доказательством отсутствия внешнего доступа.
Для запрета внешнего доступа руководство предлагает правила межсетевого экрана, настройки контейнерной сети или физическую изоляцию. Выбор зависит от развёртывания. Результат проверяют отдельно через межсетевой экран или сетевой мониторинг, а не по тому, что чат продолжает отвечать.
Проведи проверку после отключения интернета
- Перезапусти Open WebUI и локальные службы.
- Проверь журналы на отсутствующие зависимости и попытки скачивания.
- Войди выбранным автономным способом.
- Выбери локальную модель.
- Отправь обычное сообщение для проверки ответа после перезапуска.
- Подтверди блокировку внешнего доступа через межсетевой экран или сетевой мониторинг.
Что делать, если компьютер уже отключён от интернета
Для уже отключённой машины руководство Open WebUI предлагает подготовить компоненты на другом, подключённом компьютере. Там скачивают образ или пакеты приложения, файлы моделей и зависимости с учётом операционной системы и оборудования целевой машины. Это отдельный путь подготовки автономной установки.
Подготовь комплект для целевой машины
При скачивании ориентируйся на компьютер, где будет работать Open WebUI, включая его ОС и оборудование. Руководство перечисляет не один файл модели, а приложение, модели и зависимости. Учитывай этот состав при подготовке переноса с подключённой машины на изолированную.
- Скачай образ или пакеты приложения для целевой ОС и оборудования.
- Скачай файлы моделей для целевой установки.
- Скачай необходимые зависимости.
Сохрани устройство кешей
При переносе кешей сохраняй структуру каталогов, символические ссылки и файлы, на которые они указывают. Процесс Open WebUI должен иметь право читать перенесённые файлы. В руководстве эти условия выделены отдельно: наличие файлов и доступ приложения к ним нужно учитывать вместе.
После подготовки моделей и зависимостей задай переменные автономного режима в конфигурации окружения и перезапусти Open WebUI. Порядок здесь существенен: при HF_HUB_OFFLINE=1 установка не сможет скачать отсутствующие модели во время первой обработки документа.
Как запустить пример RAG-приложения через Docker
В руководстве Docker пример RAG-приложения выступает сомелье и подбирает сочетания вина и еды. Для его работы нужны база Qdrant и служба языковой модели. Рассматривай этот раздел как запуск конкретного приложения с указанными зависимостями, а не как продолжение настройки чата VS Code.
Выбери размещение Ollama
Руководство рекомендует Ollama в контейнере для Linux с установленным непосредственно в системе Docker Engine или Windows 10/11 с Docker Desktop, при наличии CUDA-совместимого GPU и хотя бы 8 GB оперативной памяти. Эти условия на дату проверки, 7 октября 2026 года, относятся к рекомендации данного руководства.
Для Docker Desktop на Linux руководство рекомендует запускать Ollama вне контейнера. В этом варианте Ollama устанавливают и запускают на основной машине. Не смешивай его с описанным условием Linux и Docker Engine: источник различает эти варианты окружения.
Подготовь модель вне контейнера
Служба Ollama в примере изначально не содержит моделей. До использования RAG-приложения модель необходимо скачать. Для сценария вне контейнера в руководстве приведена команда ollama pull llama2; это конкретная модель из примера, а не рекомендация для оборудования без проверки.
- Установи Ollama на основной машине.
- Запусти Ollama на основной машине.
- Выполни ollama pull llama2.
Получи проект и запусти приложение
Руководство использует репозиторий winy и запуск через Docker Compose. При вынесенной на основную машину Ollama перед запуском нужно изменить docker-compose.yaml: удалить службу ollama и заменить значение OLLAMA в службе winy адресом своего сервера.
- Клонируй репозиторий winy командой git clone из руководства Docker.
- Удали службу ollama из docker-compose.yaml, если запускаешь Ollama вне контейнера.
- Замени значение OLLAMA в службе winy адресом своего сервера для этого варианта запуска.
- Выполни docker compose up --build из каталога winy.
- Открой приложение в браузере на localhost:8501.
Почему модель не появляется или документы не обрабатываются
Выбирай проверку по месту сбоя. Для VS Code документация отдельно описывает Restricted Mode, появление моделей расширения и поддержку инструментов. Для Open WebUI успешный чат не подтверждает работоспособность документов, поэтому отсутствие ответа по файлу требует отдельной проверки.
В VS Code виден Auto или пропала модель
Вызов инструментов является условием появления модели при работе с агентами в чате. Если модель его не поддерживает, она не будет показана в соответствующем переключателе. Этот случай отличается от отсутствия моделей расширения после установки, для которого предлагается перезагрузка редактора.
- Проверь доверие к рабочему пространству: в Restricted Mode недоверенного пространства переключатель показывает только Auto.
- Восстанови доверие к пространству, которому доверяешь, чтобы вернуть полный список моделей.
- Перезагрузи VS Code, если модели расширения не появились после настройки.
- Проверь поддержку вызова инструментов, если модель нужна для агентов в чате.
Чат работает, но ответ по файлу не приходит
Если проверка документов не проходит при работающем чате, проверь выбранных провайдеров извлечения содержимого и эмбеддингов, права на кеши и руководство по устранению проблем обработки документов. Именно эти направления проверки перечислены в инструкции Open WebUI.
Дополнительно учитывай момент включения автономного режима: отсутствующие модели при HF_HUB_OFFLINE=1 не скачиваются. Поэтому успешный старт новой установки может смениться ошибкой на первой загрузке документа или вопросе по нему. Начальный запуск интерфейса не исключает такой сценарий.
Какие условия облака и ограничения стоит перепроверить
Условия облачных моделей ниже приведены на дату проверки, 7 октября 2026 года. Они пригодятся, если после оценки оборудования ты решишь рассмотреть облако: инструкция Ollama рекомендует его при медленной работе локальных моделей. Выполнение при этом переносится на серверы сервиса.
Как распознать облачный вариант
В CLI название облачной модели заканчивается на:cloud; в источнике приведена gemma4:cloud. При обращении из кода приложения вызывают API на домене ollama.com. Эти признаки помогают различать описанный облачный способ обращения и сценарий с локальной моделью.
- Бесплатный план включает gemma4:cloud; при отсутствии платного плана инструкция предлагает начинать с неё.
- Большинство остальных облачных моделей требуют платного плана или купленных кредитов.
- Для выбранных облачных моделей предлагается выполнить ollama signin или создать ключ в настройках Ollama.
Когда описанный сценарий не совпадает с твоей задачей
Если тебе нужны семантический поиск или автодополнение кода без аккаунта GitHub, условия BYOK для чата не покрывают эти функции. Если рассчитываешь на быструю большую локальную модель без мощного GPU, учитывай предупреждение Ollama о медленной работе на таком оборудовании.
Руководство по автономному Open WebUI подготовлено сообществом и не поддерживается командой Open WebUI. Учитывай его статус при настройке: документ описывает подготовку и проверки, но не является обещанием поддержки этого сценария командой продукта.
Что сверить с официальными страницами перед настройкой
Перед установкой сверяй требования к GPU и памяти с документацией Ollama, а подключение VS Code с инструкцией официального расширения. Если выбираешь облачную модель, проверь текущие условия плана на официальной странице сервиса: приведённые здесь условия относятся к дате проверки.

Частые вопросы
Можно ли пользоваться локальной Ollama в VS Code без Copilot?
Да. BYOK в VS Code позволяет использовать собственные модели без плана Copilot и без входа в GitHub, включая полностью автономный чат с локальными моделями Ollama. Для семантического поиска, автодополнения кода и функций на основе эмбеддингов сохраняется требование аккаунта GitHub.
Будет ли большая модель быстро работать на обычном компьютере?
Скорость локального выполнения зависит от оборудования. Ollama предупреждает, что большие модели медленно работают без мощного GPU. После установки инструкция предлагает проверить GPU и память по документации; при ожидаемой медленной работе она рекомендует рассмотреть облачные модели.
Почему в переключателе VS Code отображается только Auto?
Документация описывает такое поведение для недоверенного рабочего пространства в Restricted Mode. Восстановление доверия возвращает полный список моделей. Если проблема касается моделей установленного расширения, которые не появились после настройки, предусмотрена другая проверка: перезагрузка VS Code.
Достаточно ли включить OFFLINE_MODE=true?
Для запрета внешних подключений этого недостаточно: переменные автономного режима не блокируют исходящую сеть. Используй подходящие правила межсетевого экрана, контейнерную сеть или физическую изоляцию, затем отдельно проверь блокировку. Перед включением режима подготовь модели и зависимости.
Почему Open WebUI отвечает в чате, но не по PDF?
Успешный обычный чат не подтверждает готовность обработки документов. Проверь провайдеров извлечения содержимого и эмбеддингов, а также права доступа к кешам. При HF_HUB_OFFLINE=1 недостающая модель не скачается, и ошибка может появиться при первой загрузке документа или запросе по нему.
Можно ли подготовить уже отключённый компьютер?
Руководство предлагает скачать приложение, модели и зависимости на подключённой машине с учётом целевой ОС и оборудования. При переносе кешей нужно сохранить каталоги, символические ссылки и их цели, а процессу Open WebUI обеспечить возможность чтения перенесённых файлов.
Нужно ли скачивать модель для примера Docker отдельно?
Да: служба Ollama в примере изначально пустая, поэтому до использования RAG-приложения модель нужно скачать. Для варианта с Ollama на основной машине руководство приводит ollama pull llama2 и изменение подключения в docker-compose.yaml на адрес своего сервера.
Есть ли бесплатная облачная модель Ollama?
На дату проверки, 7 октября 2026 года, бесплатный план включает gemma4:cloud. Большинство остальных облачных моделей требуют платного плана или купленных кредитов. Уточни текущие условия на официальной странице сервиса; облачные модели выполняются на серверах Ollama.
Источники и проверка
- ollama/docs/faq.mdx at main · ollama/ollama, github.com (первоисточник). Прочитано 7 октября 2026.
- Download Ollama on Linux, ollama.com (первоисточник). Прочитано 7 октября 2026.
- AI language models in VS Code, code.visualstudio.com (первоисточник). Прочитано 7 октября 2026.
- Запуск Ollama с Open WebUI на оборудовании Intel: инструкция для Windows и Ubuntu, builders.intel.com. Прочитано 7 октября 2026.
- Run Open WebUI Offline / Open WebUI, docs.openwebui.com. Прочитано 7 октября 2026.
- Build a RAG application using Ollama and Docker, docs.docker.com. Прочитано 7 октября 2026.
Подготовлено с помощью ИИ по первоисточникам и проверено автоматически: факты, числа и цитаты сверены с источниками. Человек статью перед выходом не читал. Если нашёл ошибку, напиши через контакты.