NVIDIA: Nemotron 3 Ultra

nvidia/nemotron-3-ultra-550b-a55b-20260604

Модальности

Цена ввод / вывод

— / —за 1M токенов

Контекст1M

Релиз4 июн. 2026 г.

Провайдеры

Одна и та же модель может быть доступна у разных провайдеров. Маршрутизация выбирает эндпоинт по политике, цене, задержке и доступности.

Нет активных эндпоинтов для этой модели.

Производительность

Пропускная способность — скорость генерации (ток/с, выше лучше). Задержка — полный round-trip (ниже лучше). TTFT — время до первого токена (ниже лучше). Графики разбиты по провайдерам — нажмите expand для деталей.

Пропускная способность—лучший провайдер

Задержка—P50, лучший провайдер

Регион

Период

Пропускная способность

Выше — лучше

Загрузка…

Задержка

Ниже — лучше

Загрузка…

E2E задержка

Ниже — лучше

Загрузка…

TTFT

Ниже — лучше

Загрузка…

Ошибки tool call

Ниже — лучше

Загрузка…

Ошибки structured output

Ниже — лучше

Загрузка…

Тарифы

Базовая цена за миллион токенов. Эффективная цена учитывает prompt caching: повторяющийся контекст тарифицируется по ставке cache_read.

Ввод (list)—за 1M токенов

Вывод—за 1M токенов

Эффективная цена ввода

Фактическая стоимость prompt + cache_read на миллион токенов.

Ниже — лучше

Загрузка…

Cache read токены

Доля контекста, прочитанного из кэша провайдера.

Загрузка…

Бенчмарки

Результаты на стандартизированных оценках. Проценты и ранги показывают положение модели среди моделей каталога.

Агентные задачи27.4%

Программирование49.3%

Индекс интеллекта37.8%

Arena	Категория	Elo	Win rate	Ранг
models	3d	1211	43.0%	#41
models	Svg	1139	38.1%	#43
models	Gamedev	1190	38.4%	#54
models	Uicomponent	1166	36.7%	#56
models	Codecategories	1168	36.0%	#61
models	Dataviz	1162	37.7%	#63
models	Website	1131	31.2%	#76

Активность

Объём запросов и токенов к модели за последние 7 дней.

Запросы

Число обращений к модели.

Загрузка…

Токены

Prompt и completion суммарно.

—

Загрузка…

Доступность

Доля успешных ответов за период. Мониторинг эндпоинтов и автоматический fallback при ошибках upstream.

Успешные запросы

Процент ответов без ошибки.

Выше — лучше

Загрузка…

Быстрый старт

Готовый код для вызова модели. API совместим с OpenAI — достаточно указать base_url LLM Router. Меняется только slug модели: nvidia/nemotron-3-ultra-550b-a55b-20260604.

curl -s "https://llmmart.ru/api/v1/v1/chat/completions" \
  -H "Authorization: Bearer $LLM_ROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b-20260604",
    "messages": [
      {"role": "user", "content": "Привет!"}
    ]
  }'

Нужен API-ключ организации — создайте ключ в личном кабинете или см. инструкцию. Подробнее: первый запрос к модели и примеры SDK.

Ещё модели от Nvidia

Все модели (14)

NVIDIA: Nemotron 3 Ultra

Провайдеры

Производительность

Пропускная способность

Задержка

E2E задержка

TTFT

Ошибки tool call

Ошибки structured output

Тарифы

Эффективная цена ввода

Cache read токены

Бенчмарки

Активность

Запросы

Токены

Доступность

Успешные запросы

Быстрый старт

Ещё модели от Nvidia

NVIDIA: Llama Nemotron Rerank VL 1B V2 (free)

NVIDIA: Nemotron 3.5 Content Safety (free)

NVIDIA: Nemotron 3 Ultra (free)

NVIDIA: Parakeet TDT 0.6B v3

NVIDIA: Nemotron 3 Nano Omni (free)

NVIDIA: Nemotron 3 Super

NVIDIA: Nemotron 3 Super (free)

NVIDIA: Llama Nemotron Embed VL 1B V2 (free)

NVIDIA: Nemotron 3 Nano 30B A3B

NVIDIA: Nemotron 3 Nano 30B A3B (free)

NVIDIA: Nemotron Nano 12B 2 VL (free)

NVIDIA: Llama 3.3 Nemotron Super 49B V1.5