NVIDIA Nemotron 3 Ultra: 550 миллиардов параметров и 140 токенов в секунду на открытых весах
# NVIDIA Nemotron 3 Ultra: 550 миллиардов параметров и 140 токенов в секунду на открытых весах
3 июня 2026 года NVIDIA выпустила Nemotron 3 Ultra — 550-миллиардную Mixture-of-Experts модель с 55 миллиардами активных параметров на токен. Первая frontier-scale модель с открытыми весами, построенная на гибриде Mamba-2 и Transformer, а не на чистом Transformer. 512 экспертов на слой, 1 миллион токенов контекста, претрейнинг в NVFP4 и throughput в 5 раз выше конкурентов своего класса.
По Intelligence Index от Artificial Analysis модель набирает **48 баллов** — девятое место из 89 протестированных. Лидер среди американских open-weight моделей, но на шесть баллов позади китайской Kimi K2.6.
***
## Гибрид, который окупается
Nemotron 3 Ultra построен на архитектуре, которой год назад не существовало в таком масштабе. NVIDIA чередует MoE-слои с Mamba-2 слоями — Mamba-2 хранит константное состояние на каждом шаге генерации независимо от длины контекста. Attention-слои оставлены выборочно, только там, где нужен фактологический retrieval.
Результат: **5.9x** throughput против GLM-5.1, **4.8x** против Kimi-K2.6 и **1.6x** против Qwen-3.5 на 8K входных / 64K выходных токенах. Замеры NVIDIA с TRT-LLM, конкуренты — на vLLM, все на NVFP4 и GB200.
Artificial Analysis замерил **140.3 токена в секунду** на выходе при времени до первого токена **1.33 секунды**. NVIDIA утверждает 300+ tok/s на предрелизном DeepInfra эндпоинте.
Архитектурный трюк — **LatentMoE**: токены проецируются в меньшее латентное пространство, где происходит expert routing и вычисления. All-to-all коммуникация снижается в четыре раза. Сэкономленный бюджет NVIDIA реинвестирует в число экспертов: **512 на слой**, **22 активных на токен** — против 128-256 у DeepSeek или Llama.
Multi-Token Prediction (MTP) — два shared-weight heads предсказывают несколько будущих токенов за один проход. Это native speculative decoding без отдельной draft-модели.
> LatentMoE — не бесплатная оптимизация. NVIDIA жертвует частью expressiveness ради throughput. Где этот trade-off окупается, а где нет — пока открытый вопрос.
***
## MOPD: десять учителей вместо одного
Пост-тренинг Nemotron 3 Ultra — возможно, более важная часть релиза, чем архитектура. NVIDIA применила **Multi-Teacher On-Policy Distillation (MOPD)**: одна student-модель обучается от десяти специализированных teacher-моделей.
Pipeline: SFT → Unified RLVR → MOPD Warmup → MOPD → MTP Boosting. На этапе MOPD student генерирует собственные rollouts по всем доменам, каждый teacher выдаёт dense token-level оценку. Процесс асинхронный: генерация rollout, teacher scoring и student update работают в конвейере.
Пять teacher-слотов: general (student RLVR policy самообучается), RLHF chat, instruction-following, reasoning и SWE. Под каждым — собственный training pipeline. Запуск MOPD требует **224 узла**: 64 training + 128 vLLM + 12 Gym + 20 teachers, с TP=8, EP=64, CP=8.
NVIDIA провела две итерации MOPD. В первой учителя получили специализированные пайплайны. Во второй — переинициализировались от улучшенного student. MOPD работает, когда student rollouts остаются в пределах teacher support — перед дистилляцией нужен короткий SFT warmup.
Результат: base model на GPQA набирала **31.8%**, post-trained версия — **87%**. Рост в 2.7 раза.
Полный MOPD pipeline невоспроизводим end-to-end. Промежуточные чекпоинты teacher-моделей не опубликованы. NVIDIA выпустила финальные чекпоинты и рецепты для одного representative pass.
***
## Бенчмарки: один независимый, остальное — под вопросом
На старте только **один** бенчмарк независимо подтверждён — Artificial Analysis Intelligence Index.
AA Intelligence Index: **48 баллов**. Выше всех US open-weight моделей — Gemma 4 31B (**39**), Nemotron 3 Super (**36**), gpt-oss-120b (**33**). Ниже Kimi K2.6 (**54**).
Остальное — vendor-stated:
**SWE-Bench Verified**: пик **71.9%**, реальный диапазон — **65.0-70.4%** в зависимости от agent harness. Разные фреймворки дают разный результат.
**GPQA Diamond: 87%**, **MMLU-Pro: 86.8%**, **HLE без инструментов: 26.7%**, с инструментами — **37.4%**. RULER на 1M токенов — **94.7%**. PinchBench — **91%**.
Terminal Bench 2.1 — **56.4%** против **67.2%** у Kimi K2.6. IOI 2025 — **570 баллов**, уровень топ-3 человека в соревновательном программировании.
Значительная часть capability claims требует community-репликации. Это займёт недели.
Пока мы знаем точно: модель быстрая, но не самая умная среди open-weight. Это главный вопрос к модели на старте.
***
## Рынок: быстрее всех, но не дешевле
Nemotron 3 Ultra занимает свою позицию. Не самая умная (Kimi K2.6 выше), не самая дешёвая (Llama 4 дешевле в 3-4 раза), но самая быстрая в своём классе.
Цены разнятся: OpenRouter — **$0.50/$2.50** за миллион токенов, Hugging Face (Together AI) — **$0.60/$3.60**, Vercel AI Gateway — **$0.60/$2.40**. Artificial Analysis blended rate — **~$0.52/M** при соотношении cache/input/output 7:2:1.
Для сравнения: Llama 4 Maverick — **$0.15-0.20/M**, DeepSeek V3 — **$0.27/M**, GPT-4o mini — **$0.15/$0.60**.
Экономика самохостинга: при объёмах выше **200M токенов в месяц** self-hosting выгоднее API. NVIDIA NIM — **$4,500/GPU/year** или **~$1/GPU/hour**, что меняет cost model с per-token на per-GPU.
Железо: **8x GB200/B200** или **16x H100** для BF16, **4x GB200** для NVFP4. NVFP4 оптимален только на Blackwell — на Hopper работает как W4A16.
NVIDIA заявляет **30% снижение стоимости** на агентские задачи. Digital Applied зафиксировал **2.3x verbosity** — модель генерирует больше токенов на задачу, и экономия на throughput частично съедается лишними словами.
Проверять — не NVIDIA.
> Nemotron 3 Ultra — первая модель, которая делает ставку на скорость как на основной дифференциатор. Не универсальный рекордсмен. Скоростной.
***
## Что не так: доверие, verbosity и текст без картинок
Модель **text-only**. Нет поддержки изображений — Llama 4 и Gemini 3 Flash мультимодальны из коробки.
Knowledge cutoff: September 2025 (pretraining), May 2026 (SFT).
1M контекст — архитектурный потолок. Сервис-провайдеры его не гарантируют: от 128K до 1M в зависимости от платформы.
Полный MOPD pipeline невоспроизводим: промежуточные чекпоинты teacher-моделей не опубликованы. NVIDIA обещает рецепты, но не полную воспроизводимость.
Экосистема fine-tuning на старте: меньше адаптеров и community-моделей, чем у Llama 4. Unsloth выпустила оптимизированную версию, но этого недостаточно.
Главный риск — разрыв между vendor-stated и независимо подтверждёнными цифрами. Пока community не реплицирует бенчмарки, значительная часть заявленных возможностей остаётся неподтверждённой.
***
## Куда это идёт
Nemotron 3 Ultra открывает три направления.
**Архитектурный сдвиг.** NVIDIA доказала, что гибрид Mamba-Transformer масштабируется до frontier-уровня. Llama 5, Qwen 4 и DeepSeek V5 включат Mamba-подобные слои в следующие итерации.
**Новый стандарт пост-тренинга.** MOPD с десятью учителями и асинхронной конвейеризацией — blueprint для open-source моделей. Принцип multi-teacher on-policy distillation войдёт в стандартный инструментарий, даже если конкретный пайплайн невоспроизводим.
**Ниша для агентов.** Для long-running агентных задач latency критичнее одноразового качества. Nemotron 3 Ultra — первая модель, спроектированная под этот сценарий. Ближайшие месяцы покажут, реальна ли эта ниша.
Модель не доминирует по бенчмаркам. Но она задаёт архитектурное направление и доказывает: throughput может быть дифференциатором.
***
### Источники
[NVIDIA Technical Blog](https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/) · [Hugging Face model card](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) · [Technical Report](https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf) · [Artificial Analysis](https://artificialanalysis.ai/models/nvidia-nemotron-3-ultra-550b-a55b) · [Digital Applied](https://www.digitalapplied.com/blog/nvidia-nemotron-3-ultra-550b-open-reasoning-model-2026) · [MarkTechPost](https://www.marktechpost.com/2026/06/04/nvidia-ai-releases-nemotron-3-ultra-an-open-550b-mixture-of-experts-hybrid-mamba-transformer-for-long-running-agents/) · [Dataconomy](https://dataconomy.com/ai-models/nvidia-nemotron-3-ultra-550b-a55b/) · [CloudPrice](https://cloudprice.net/models/nvidia-nemotron-3-ultra-550b-a55b) · [NVIDIA MOPD Guide](https://docs.nvidia.com/nemotron/nightly/nemotron/ultra3/mopd.html) · [NVIDIA NeMo-RL GitHub](https://github.com/NVIDIA-NeMo/RL/blob/ultra-v3/docs/guides/nemotron-3-ultra.md) · [Awesome Agents](https://awesomeagents.ai/models/nvidia-nemotron-3-ultra-550b/) · [Beri.net TCO](https://www.beri.net/article/2026-06-04-nvidia-nemotron-3-ultra-550b-open-frontier-agent-model) · [NVIDIA Research](https://research.nvidia.com/labs/nemotron/Nemotron-3-Ultra/)
*Исследование проведено в ИИ среде, июнь 2026.*