
Главное за минуту
- NVIDIA заявляет бесплатный доступ к NIM API для неограниченного прототипирования на DGX Cloud.
- Модель можно открыть в Preview, затем получить API-ключ и запустить предложенный код.
- Для производственного использования предлагаются NVIDIA AI Enterprise и конечные точки партнёров.
Что бесплатно в NVIDIA Build и как здесь устроены модели
В NVIDIA Build можно начать с бесплатного доступа к размещённым NIM API: NVIDIA заявляет неограниченное прототипирование на DGX Cloud. Открой модель в каталоге, попробуй её через Preview, затем получи ключ для запросов из кода; условия бесплатного доступа приведены на 7 октября 2026 года.
Что означает NIM
NVIDIA NIM предоставляет контейнеры для самостоятельного размещения микросервисов инференса, то есть выполнения запросов к моделям. Речь идёт о предобученных и настроенных моделях с ускорением на GPU. В описании перечислены облака, центры обработки данных, RTX AI PC и рабочие станции.
Микросервисы предоставляют стандартные API для подключения к приложениям и рабочим процессам. NVIDIA также описывает оптимизацию задержки ответа и пропускной способности под сочетание модели и GPU. Это характеристика конкретной связки модели и оборудования, а не обещание одинаковой скорости при разных развёртываниях.
Где выполняется запрос из браузера
В стартовом руководстве используется микросервис, который NVIDIA разместила в собственной среде DGX Cloud. Когда ты отправляешь вопрос через интерфейс модели, запрос поступает к этому API. Ответ появляется в области Preview под твоим текстом.
Самостоятельное размещение устроено иначе: ты скачиваешь микросервис NIM для своего развёртывания. В качестве другого варианта NVIDIA предлагает выделенные конечные точки Hugging Face в выбранном облаке. Конечная точка здесь означает адрес, через который приложение обращается к микросервису.
Как выбрать направление работы
- Для прототипирования через размещённый API начни с доступа, который NVIDIA описывает как бесплатный.
- Для разработки и тестирования с API и контейнерами используй возможности NVIDIA Developer Program.
- Для самостоятельного размещения рассматривай скачиваемые микросервисы NIM.

Что подготовить перед получением доступа
Доступ к размещённым NVIDIA API NIM и контейнерам для разработки и тестирования связан с членством в NVIDIA Developer Program. В описанном процессе получения ключа вступление в программу происходит при регистрации.
Если NVIDIA Account уже есть
При получении ключа укажи адрес электронной почты, связанный с существующим NVIDIA Account. После этого интерфейс предложит войти. Следуй этой ветке регистрации, если собираешься использовать уже созданную учётную запись.
Если NVIDIA Developer API Key уже получен, стартовое руководство разрешает перейти к работе с кодом. Получение нового ключа в таком сценарии можно пропустить: в руководстве этот переход обозначен как шаг 4.
Если учётной записи ещё нет
Для NVIDIA API Catalog предлагается создать бесплатную учётную запись и войти. При регистрации нового NVIDIA Account интерфейс попросит задать пароль и выполнить дальнейшие инструкции на экране. Бесплатность учётной записи указана в описании доступа к каталогу на дату проверки, 7 октября 2026 года.
В процессе получения ключа потребуется ввести электронную почту во всплывающем окне и нажать Next. Регистрация включает вступление в Developer Program, поэтому этот этап связан и с учётной записью, и с доступом к инструментам разработчика.
Что понадобится для перехода к коду
- Подготовь среду Python или текстовый редактор, куда можно вставить код со страницы модели.
- Предусмотри безопасное место для сохранения полученного ключа: это прямо предусмотрено руководством.
- Для интеграции LangChain подготовь настройку NVIDIA_API_KEY в окружении; README запрещает помещать ключ в исходный код или URL.

Как выбрать модель и отправить вопрос через Preview
Стартовое руководство использует llama-3.1-8b-instruct, но разрешает пройти тот же сценарий с любой моделью из NVIDIA API Catalog. Пример ниже сохраняет выбор модели из инструкции, чтобы названия на странице было проще сопоставить с действиями.
Найди модель в каталоге
Каталог позволяет искать микросервисы по типу модели, отрасли или названию через строку поиска. Если ты пришёл попробовать конкретную модель из руководства, используй поиск. Если модель ещё не выбрана, начни с разделов по типу или отрасли.
- Открой NVIDIA Build в браузере.
- Введи llama-3 в строку поиска.
- Выбери meta/llama-3.1-8B-instruct.
- Нажми Acknowledge & Continue, если появится предупреждение об использовании сторонних моделей.
Отправь собственный запрос
Вкладка Preview находится в левой части страницы модели. Здесь можно выбрать предложенный вопрос или написать собственный текст. Для первого знакомства с ответом модели достаточно предусмотренного веб-интерфейса.
- Открой вкладку Preview.
- Введи свой вопрос в поле Type text here.
- Нажми Send.
Где искать результат
Ответ должен появиться в Preview под отправленным запросом. В этом сценарии текст обрабатывает API модели, размещённый на NVIDIA DGX Cloud. Именно эту область страницы использует руководство для просмотра результата обращения к модели.
Если пока не хочется формулировать собственный запрос, выбери один из примеров вопросов в Preview. Такой вариант взаимодействия также предусмотрен инструкцией. Собственный текст и предложенный пример относятся к одному браузерному сценарию работы с микросервисом.
Как получить API-ключ и выполнить запрос из Python
На странице модели предусмотрены получение ключа и копирование примера Python. Пройди получение ключа, если его ещё нет, затем используй код из правой панели. Для владельца готового NVIDIA Developer API Key руководство предусматривает переход к этапу работы с кодом.
Получи ключ на странице модели
- Нажми Get API Key в правой панели страницы модели.
- Введи адрес электронной почты во всплывающем окне.
- Нажми Next.
- Выполни предложенные на экране действия для входа или создания NVIDIA Account.
- Нажми Copy Key в окне с новым ключом.
- Сохрани скопированный ключ в безопасном месте.
Перенеси пример в свою среду
Стартовая инструкция предлагает Python-код из панели справа на странице модели. В нём предусмотрено место для ключа и пример текста запроса. Последовательность ниже относится именно к этому примеру; для LangChain дальше используется настройка ключа через окружение.
- Нажми Copy Code.
- Вставь скопированный код в среду Python или текстовый редактор.
- Замени API_KEY_REQUIRED_IF_EXECUTING_OUTSIDE_NGC своим API-ключом, как указано в стартовом руководстве.
- Замени предложенный текст запроса собственным.
- Запусти код.
Как получить ключ через профиль для LangChain
README интеграции LangChain описывает путь через меню профиля и страницу API Keys. Он заканчивается сохранением ключа под именем NVIDIA_API_KEY. Используй этот вариант, когда следуешь инструкции подключения пакета, а не браузерному примеру страницы модели.
- Открой меню профиля.
- Выбери API Keys.
- Нажми Generate API Key.
- Нажми Generate Key в открывшемся окне.
- Скопируй ключ после сообщения API Key Granted.
- Сохрани ключ как NVIDIA_API_KEY в окружении.
Бесплатное прототипирование и переход к производственному использованию
На 7 октября 2026 года NVIDIA заявляет бесплатный доступ к конечным точкам NIM API для неограниченного прототипирования на DGX Cloud. Сохраняй слово «прототипирование», когда оцениваешь это предложение: именно к нему относится формулировка о бесплатном доступе.
Что даёт Developer Program
Членство в NVIDIA Developer Program открывает размещённые NVIDIA API NIM и контейнеры для разработки и тестирования. Это позволяет рассматривать размещённый API и контейнеры как варианты работы на этапе подготовки приложения. Назначение доступа в описании программы сформулировано именно через разработку и тестирование.
Что предлагается для рабочего приложения
Для производственного использования NVIDIA предлагает AI Enterprise с безопасностью, стабильностью API и поддержкой. Другой указанный вариант: выделенные корпоративные конечные точки NIM у партнёров NVIDIA. Перед переходом к такому использованию проверь актуальные условия выбранного предложения на официальной странице.
NIM также описан как часть NVIDIA AI Enterprise. В материале об интеграции LangChain эта платформа представлена как решение для разработки и развёртывания ИИ-приложений производственного уровня. Это контекст корпоративного варианта, который стоит учитывать отдельно от знакомства с моделью через Preview.
Какие варианты сравнить перед выбором
Цены и условия выбранного варианта уточняй на официальной странице сервиса перед подключением. Формулировка бесплатного предложения выше относится к проверке на 7 октября 2026 года и к указанному в ней сценарию прототипирования.
- Бесплатный доступ к размещённым NIM API для прототипирования на DGX Cloud.
- Скачивание микросервисов для самостоятельного размещения.
- Выделенные конечные точки Hugging Face в выбранном облаке.
- NVIDIA AI Enterprise или корпоративные конечные точки партнёров для производственного использования.
Как подключить NVIDIA API к LangChain
Пакет langchain-nvidia-ai-endpoints содержит интеграции LangChain для чат-моделей и эмбеддингов NVIDIA AI Foundation Models, размещённых в NVIDIA API Catalog. Для приложения на LangChain это предусмотренный способ обращаться к таким моделям через интеграцию пакета.
Установи интеграцию и настрой доступ
Для размещённого каталога интеграция использует стандартный адрес NVIDIA API и требует NVIDIA_API_KEY. README отдельно указывает, что ключ нужно задавать в окружении, а не помещать в исходный код или URL. При настройке LangChain следуй именно этому способу передачи ключа.
- Выполни команду pip install langchain_nvidia_ai_endpoints.
- Задай NVIDIA_API_KEY в окружении.
- Запроси available_models, чтобы получить список моделей, доступных с текущими API-учётными данными.
Проверь формат входных данных модели
Модели с Completions API принимают промпт вместо сообщений. Промпт здесь означает текст запроса, который передаётся модели. Если собираешь интеграцию вокруг такого API, ориентируйся на этот формат, а не переноси структуру сообщений из другого примера без проверки.
Через available_models можно запросить модели, доступные с текущими учётными данными. Этот список полезен при выборе модели для интеграции: он привязан к используемому API-доступу. Получай его в том окружении, для которого настраиваешь приложение.
Выбери способ получения ответа
Модели, представленные через NVIDIA API, поддерживают потоковую выдачу. В интеграции также предусмотрен batch для параллельных запросов и асинхронные методы invoke, stream и batch. Эти возможности относятся к способу взаимодействия приложения с моделью.
- Потоковая выдача предусмотрена для получения ответа в режиме stream.
- Метод batch предназначен для обработки параллельных запросов.
- Асинхронные варианты доступны для invoke, stream и batch.

Как проверить подключение через Doctor
Перед отправкой промптов README рекомендует предварительную проверку Doctor. Она работает на чтение: использует настройки адреса, ключ и GET /v1/models. Запросов на выполнение модели и телеметрии использования эта проверка не отправляет.
Что именно проверяется
Doctor использует NVIDIA_BASE_URL либо стандартный адрес размещённого сервиса, а также NVIDIA_API_KEY. Через GET /v1/models он получает сведения о моделях. Поэтому результат нужно читать как предварительную проверку подключения и доступных метаданных, сохраняя ограничения этого способа.
Если в метаданных доступен тип модели, Doctor проверяет его. Когда тип неизвестен, результат обозначается UNKNOWN. Проверка не пытается определить тип модели через генерацию ответа, поэтому UNKNOWN нужно учитывать именно в этом контексте.
Какие параметры предусмотрены
Значения --capability задают, какую возможность ты проверяешь: чат, эмбеддинги, completions или ranking. Они перечислены в README как допустимые значения параметра. Выбирай соответствующее значение при проверке нужного тебе типа взаимодействия с моделью.
- Запусти предварительную проверку Doctor перед отправкой промптов.
- Выбери для --capability значение chat, embeddings, completions или ranking в соответствии с проверяемой возможностью.
- Используй --help для просмотра параметров проверки.
- Укажи --timeout 10 для медленного развёртывания, как предлагает README.
Почему успешная проверка ещё не равна ответу модели
Успешное прохождение предварительной проверки не доказывает, что запрос к модели выполнится. Doctor не отправляет запрос инференса, поэтому его результат нельзя считать подтверждением успешной генерации. Для проверки самого ответа используй сценарий обращения к модели, например запуск кода со страницы каталога.
Отдельно учитывай особенность каталога: модели с выделенными конечными точками могут отсутствовать в /models. Их маршрутизация в коннекторе зависит от известного ему реестра размещённых моделей. Отсутствие такой модели в этом списке нужно рассматривать с учётом данного исключения.
Что меняется при самостоятельном размещении NIM
Микросервисы NIM распространяются через NVIDIA NGC Catalog как контейнерные образы для отдельной модели или семейства моделей. При самостоятельном размещении работа начинается с такого микросервиса, а подключение приложения настраивается на адрес собственного развёртывания.
Какие модели и средства развёртывания предусмотрены
NVIDIA описывает развёртывание LLM, поддерживаемых vLLM, SGLang или TensorRT-LLM. В эту формулировку включены модели, дообученные сообществом, и модели, дообученные на собственных данных. При выборе модели учитывай условие поддержки перечисленными средствами выполнения.
Для наблюдения за работой NIM доступны подробные метрики, которые можно использовать в панелях мониторинга. Для масштабирования в Kubernetes предусмотрены Helm charts и руководства. Эти инструменты относятся к сопровождению и масштабированию развёртывания.
Как задать адрес в интеграции
Для собственного NIM интеграция принимает корень развёртывания или базовый адрес совместимого с OpenAI API с окончанием /v1. Оба варианта приводятся к /v1. При настройке нужно передать базовый адрес сервиса, сохранив различие между ним и путём отдельной операции.
Если в конструкторе явно задан base_url, он имеет приоритет над NVIDIA_BASE_URL. Учитывай это, когда меняешь настройку в окружении: явный параметр конструктора определяет выбранный адрес при наличии обоих значений.
Когда собственному NIM нужен ключ
Самостоятельное развёртывание может допускать анонимный доступ. Если оно требует bearer-аутентификацию, то есть передачу ключа при обращении, нужно задать NVIDIA_API_KEY. Условие зависит от требований конкретного развёртывания.
Коннектор LlamaIndex тоже может подключаться к локальным экземплярам NIM наряду с микросервисами, размещёнными NVIDIA. Поэтому сценарий переранжирования, описанный дальше, предусмотрен для подключения к обоим вариантам размещения.
Что проверить, если интеграция не работает
Начни с настроек, для которых README задаёт явные правила: базового адреса, способа передачи ключа и формата входных данных. Эти проверки помогают сопоставить конфигурацию приложения с требованиями интеграции, не подменяя их предположением о причине сбоя.
В base_url попал путь отдельной операции
В качестве базового URL запрещено передавать /models, /chat/completions, /embeddings, /completions, /ranking, /rankings или /reranking. Это пути отдельных операций, а не корни развёртывания. Для самостоятельного NIM используй допустимый вариант базового адреса, описанный в предыдущем разделе.
- Проверь значение base_url на наличие пути отдельной операции.
- Проверь, не переопределяет ли явный base_url настройку NVIDIA_BASE_URL.
- Для размещённого API проверь наличие NVIDIA_API_KEY в окружении.
Код передаёт путь к изображению
Локальные пути изображений больше не принимаются напрямую. Если прежний код передавал такой путь, README предлагает самостоятельно прочитать доверенный локальный файл и передать его содержимое как data URI с base64. Это требование касается формата передачи изображения в обновляемом коде.
Используй предусмотренный формат data:image/...;base64,... для содержимого доверенного файла. В этом сценарии входом становится подготовленное представление изображения, а не строка с его локальным расположением. Сохраняй условие о доверенных файлах из инструкции.
Модель или формат запроса не совпали с ожиданиями
- Запроси available_models для списка моделей, доступных с текущими API-учётными данными.
- Учти, что модель с выделенной конечной точкой может отсутствовать в /models.
- Проверь использование промпта вместо сообщений, если обращаешься к Completions API.
- Для медленного развёртывания используй рекомендованный параметр Doctor --timeout 10.
Как использовать NIM для поиска по документам и готовых рабочих процессов
Помимо обращения к чат-модели, источники описывают интеграции для приложений с генерацией, дополненной поиском, или RAG. В примере LlamaIndex модель NVIDIA Retrieval QA Ranking Model подключается через NVIDIARerank для переранжирования найденных результатов.
Что делает интеграция LlamaIndex
Пакет llama-index-postprocessor-nvidia-rerank содержит интеграции LlamaIndex для приложений с моделями на микросервисах NVIDIA NIM. В приведённом примере используется NVIDIARerank. Это конкретный компонент сценария работы с результатами поиска.
Для переранжирования перечислены задачи объединения результатов из нескольких источников данных и повышения точности для одного источника. Рассматривай его, если работа приложения связана с упорядочиванием найденных материалов в таких сценариях. Заявленное назначение не заменяет проверку результатов на твоих данных.
- В примере NVIDIARerank задан параметр top_n = 4.
- В примере поискового движка задан similarity_top_k = 20.
- Переранжировщик подключён к поисковому движку через node_postprocessors.
Как читать параметры и результаты примеров
Значения top_n = 4 и similarity_top_k = 20 относятся к приведённому примеру настройки. Сохраняй этот контекст при чтении: первое значение задано у NVIDIARerank, второе у поискового движка, к которому подключён переранжировщик.
В интеграции LangChain результаты переранжирования представлены отдельными объектами Document. Оценка релевантности находится в metadata["relevance_score"]. Это предусмотренное место для чтения оценки в полученных объектах.
Другой описанный подход использует LLM для создания гипотетического документа. Затем поиск извлекает документы, похожие на сгенерированный. Здесь модель участвует в подготовке материала для поиска; это отдельный сценарий из материала об интеграции LangChain.
Когда посмотреть NVIDIA AI Blueprints
NVIDIA AI Blueprints представляют собой готовые настраиваемые рабочие процессы для создания и развёртывания ИИ-агентов и других приложений генеративного ИИ. Рассматривай их, если тебе нужен описанный рабочий процесс приложения, который затем можно настраивать.
Blueprints можно развернуть одним нажатием через NVIDIA Launchables. Также предусмотрено скачивание для локального развёртывания на ПК и рабочих станциях либо для разработки в собственном центре обработки данных или частном облаке. Выбирай вариант по предполагаемому месту разработки и размещения.
Когда сменить сценарий и что уточнить перед подключением
Выбирай дальнейший путь по задаче: прототипирование через размещённый API, собственное развёртывание или производственное использование. NVIDIA описывает эти варианты отдельно и связывает их с разными предложениями доступа и размещения.
Когда нужен другой вариант размещения
Если задача заключается в самостоятельном размещении модели, переходи к скачиваемым микросервисам NIM. Браузерный сценарий из стартового руководства обращается к среде NVIDIA DGX Cloud, а собственное размещение предусмотрено через контейнеры.
Если приложение готовится к производственному использованию, изучи NVIDIA AI Enterprise и корпоративные конечные точки партнёров. Именно в этом контексте NVIDIA предлагает безопасность, стабильность API и поддержку.
Какие условия уточнить на официальной странице
Перед использованием из России проверь на официальной странице сервиса поддерживаемые страны и условия доступа для своего региона. Перед оплатой проверь условия выбранного предложения. Не принимай решение о доступе на основании одной формулировки о бесплатном прототипировании.
Актуальные цены и условия использования уточняй перед подключением. Бесплатное прототипирование в этом гайде описано по формулировке NVIDIA на 7 октября 2026 года; она относится к NIM API на DGX Cloud.
Что считать завершением первого знакомства
- В браузерном сценарии результатом служит ответ в Preview под отправленным вопросом.
- При переходе к Python руководство заканчивает основной сценарий запуском кода с собственным запросом.
- В интеграции LangChain предварительная проверка Doctor остаётся отдельной проверкой и не доказывает успешность инференса.
Варианты доступа и размещения NIM на дату проверки
| Вариант | Что описано | Контекст использования |
|---|---|---|
| Размещённые NIM API | Бесплатный доступ для неограниченного прототипирования на DGX Cloud. | Прототипирование; условия на 7 октября 2026 года. |
| NVIDIA Developer Program | Доступ к размещённым NVIDIA API NIM и контейнерам. | Разработка и тестирование. |
| Скачиваемые микросервисы NIM | Контейнерные образы для модели или семейства моделей через NVIDIA NGC Catalog. | Самостоятельное размещение. |
| Конечные точки Hugging Face | Выделенные конечные точки в выбранном облаке. | Размещение экземпляров в предпочитаемом облаке. |
| NVIDIA AI Enterprise | Предложение с безопасностью, стабильностью API и поддержкой. | Производственное использование. |

Частые вопросы
NVIDIA Build действительно даёт бесплатный API?
На 7 октября 2026 года NVIDIA заявляет бесплатный доступ к NIM API для неограниченного прототипирования на DGX Cloud. Перед подключением проверь актуальные условия на официальной странице.
Можно попробовать модель через браузер?
Да. Во вкладке Preview можно выбрать пример вопроса либо ввести собственный текст и нажать Send. Ответ появляется под запросом.
Где получить API-ключ?
В стартовом руководстве ключ получают через Get API Key на странице модели. README LangChain также описывает путь через меню профиля, API Keys и Generate API Key.
Нужно ли получать ключ заново, если он уже есть?
Если NVIDIA Developer API Key уже есть, стартовое руководство предлагает перейти к шагу 4, посвящённому работе с кодом.
Как хранить ключ при использовании LangChain?
Задай NVIDIA_API_KEY в окружении. README интеграции прямо указывает не помещать ключ в исходный код или URL.
Почему Doctor показывает UNKNOWN?
Так обозначается неизвестный тип модели. Doctor проверяет доступные метаданные и не определяет тип через генерацию ответа.
Успешный Doctor означает, что модель точно ответит?
Нет. Успешная предварительная проверка не доказывает работоспособность инференса; Doctor не отправляет запрос на генерацию.
Можно подключить LlamaIndex к локальному NIM?
Да. Описанный коннектор поддерживает подключение к локальным экземплярам NIM наряду с микросервисами, размещёнными NVIDIA.
Что выбрать для производственного приложения?
NVIDIA предлагает AI Enterprise с безопасностью, стабильностью API и поддержкой либо выделенные корпоративные конечные точки NIM у партнёров. Условия выбранного варианта проверь перед подключением.
Источники и проверка
- Условия пробного использования NVIDIA API: лимиты, ограничения и обработка данных, assets.ngc.nvidia.com (первоисточник). Прочитано 7 октября 2026.
- NIM for Developers, developer.nvidia.com (первоисточник). Прочитано 7 октября 2026.
- API Catalog Quickstart Guide, docs.api.nvidia.com (первоисточник). Прочитано 7 октября 2026.
- langchain-nvidia/libs/ai-endpoints/README.md at main · langchain-ai/langchain-nvidia, github.com (первоисточник). Прочитано 7 октября 2026.
- LangChain Integrates NVIDIA NIM for GPU-optimized LLM Inference in RAG, langchain.com (первоисточник). Прочитано 7 октября 2026.
- NVIDIA NIMs, developers.llamaindex.ai. Прочитано 7 октября 2026.
Подготовлено с помощью ИИ по первоисточникам и проверено автоматически: факты, числа и цитаты сверены с источниками. Человек статью перед выходом не читал. Если нашёл ошибку, напиши через контакты.