NVIDIA Nemotron 3 Ultra: 550 миллиардов параметров и 140 токенов в секунду на открытых весах

# NVIDIA Nemotron 3 Ultra: 550 миллиардов параметров и 140 токенов в секунду на открытых весах 3 июня 2026 года NVIDIA выпустила Nemotron 3 Ultra — 550-миллиардную Mixture-of-Experts модель с 55 миллиардами активных параметров на токен. Первая frontier-scale модель с открытыми весами, построенная на гибриде Mamba-2 и Transformer, а не на чистом Transformer. 512 экспертов на слой, 1 миллион токенов контекста, претрейнинг в NVFP4 и throughput в 5 раз выше конкурентов своего класса. По Intelligence Index от Artificial Analysis модель набирает **48 баллов** — девятое место из 89 протестированных. Лидер среди американских open-weight моделей, но на шесть баллов позади китайской Kimi K2.6. *** ## Гибрид, который окупается Nemotron 3 Ultra построен на архитектуре, которой год назад не существовало в таком масштабе. NVIDIA чередует MoE-слои с Mamba-2 слоями — Mamba-2 хранит константное состояние на каждом шаге генерации независимо от длины контекста. Attention-слои оставлены выборочно, только там, где нужен фактологический retrieval. Результат: **5.9x** throughput против GLM-5.1, **4.8x** против Kimi-K2.6 и **1.6x** против Qwen-3.5 на 8K входных / 64K выходных токенах. Замеры NVIDIA с TRT-LLM, конкуренты — на vLLM, все на NVFP4 и GB200. Artificial Analysis замерил **140.3 токена в секунду** на выходе при времени до первого токена **1.33 секунды**. NVIDIA утверждает 300+ tok/s на предрелизном DeepInfra эндпоинте. Архитектурный трюк — **LatentMoE**: токены проецируются в меньшее латентное пространство, где происходит expert routing и вычисления. All-to-all коммуникация снижается в четыре раза. Сэкономленный бюджет NVIDIA реинвестирует в число экспертов: **512 на слой**, **22 активных на токен** — против 128-256 у DeepSeek или Llama. Multi-Token Prediction (MTP) — два shared-weight heads предсказывают несколько будущих токенов за один проход. Это native speculative decoding без отдельной draft-модели. > LatentMoE — не бесплатная оптимизация. NVIDIA жертвует частью expressiveness ради throughput. Где этот trade-off окупается, а где нет — пока открытый вопрос. *** ## MOPD: десять учителей вместо одного Пост-тренинг Nemotron 3 Ultra — возможно, более важная часть релиза, чем архитектура. NVIDIA применила **Multi-Teacher On-Policy Distillation (MOPD)**: одна student-модель обучается от десяти специализированных teacher-моделей. Pipeline: SFT → Unified RLVR → MOPD Warmup → MOPD → MTP Boosting. На этапе MOPD student генерирует собственные rollouts по всем доменам, каждый teacher выдаёт dense token-level оценку. Процесс асинхронный: генерация rollout, teacher scoring и student update работают в конвейере. Пять teacher-слотов: general (student RLVR policy самообучается), RLHF chat, instruction-following, reasoning и SWE. Под каждым — собственный training pipeline. Запуск MOPD требует **224 узла**: 64 training + 128 vLLM + 12 Gym + 20 teachers, с TP=8, EP=64, CP=8. NVIDIA провела две итерации MOPD. В первой учителя получили специализированные пайплайны. Во второй — переинициализировались от улучшенного student. MOPD работает, когда student rollouts остаются в пределах teacher support — перед дистилляцией нужен короткий SFT warmup. Результат: base model на GPQA набирала **31.8%**, post-trained версия — **87%**. Рост в 2.7 раза. Полный MOPD pipeline невоспроизводим end-to-end. Промежуточные чекпоинты teacher-моделей не опубликованы. NVIDIA выпустила финальные чекпоинты и рецепты для одного representative pass. *** ## Бенчмарки: один независимый, остальное — под вопросом На старте только **один** бенчмарк независимо подтверждён — Artificial Analysis Intelligence Index. AA Intelligence Index: **48 баллов**. Выше всех US open-weight моделей — Gemma 4 31B (**39**), Nemotron 3 Super (**36**), gpt-oss-120b (**33**). Ниже Kimi K2.6 (**54**). Остальное — vendor-stated: **SWE-Bench Verified**: пик **71.9%**, реальный диапазон — **65.0-70.4%** в зависимости от agent harness. Разные фреймворки дают разный результат. **GPQA Diamond: 87%**, **MMLU-Pro: 86.8%**, **HLE без инструментов: 26.7%**, с инструментами — **37.4%**. RULER на 1M токенов — **94.7%**. PinchBench — **91%**. Terminal Bench 2.1 — **56.4%** против **67.2%** у Kimi K2.6. IOI 2025 — **570 баллов**, уровень топ-3 человека в соревновательном программировании. Значительная часть capability claims требует community-репликации. Это займёт недели. Пока мы знаем точно: модель быстрая, но не самая умная среди open-weight. Это главный вопрос к модели на старте. *** ## Рынок: быстрее всех, но не дешевле Nemotron 3 Ultra занимает свою позицию. Не самая умная (Kimi K2.6 выше), не самая дешёвая (Llama 4 дешевле в 3-4 раза), но самая быстрая в своём классе. Цены разнятся: OpenRouter — **$0.50/$2.50** за миллион токенов, Hugging Face (Together AI) — **$0.60/$3.60**, Vercel AI Gateway — **$0.60/$2.40**. Artificial Analysis blended rate — **~$0.52/M** при соотношении cache/input/output 7:2:1. Для сравнения: Llama 4 Maverick — **$0.15-0.20/M**, DeepSeek V3 — **$0.27/M**, GPT-4o mini — **$0.15/$0.60**. Экономика самохостинга: при объёмах выше **200M токенов в месяц** self-hosting выгоднее API. NVIDIA NIM — **$4,500/GPU/year** или **~$1/GPU/hour**, что меняет cost model с per-token на per-GPU. Железо: **8x GB200/B200** или **16x H100** для BF16, **4x GB200** для NVFP4. NVFP4 оптимален только на Blackwell — на Hopper работает как W4A16. NVIDIA заявляет **30% снижение стоимости** на агентские задачи. Digital Applied зафиксировал **2.3x verbosity** — модель генерирует больше токенов на задачу, и экономия на throughput частично съедается лишними словами. Проверять — не NVIDIA. > Nemotron 3 Ultra — первая модель, которая делает ставку на скорость как на основной дифференциатор. Не универсальный рекордсмен. Скоростной. *** ## Что не так: доверие, verbosity и текст без картинок Модель **text-only**. Нет поддержки изображений — Llama 4 и Gemini 3 Flash мультимодальны из коробки. Knowledge cutoff: September 2025 (pretraining), May 2026 (SFT). 1M контекст — архитектурный потолок. Сервис-провайдеры его не гарантируют: от 128K до 1M в зависимости от платформы. Полный MOPD pipeline невоспроизводим: промежуточные чекпоинты teacher-моделей не опубликованы. NVIDIA обещает рецепты, но не полную воспроизводимость. Экосистема fine-tuning на старте: меньше адаптеров и community-моделей, чем у Llama 4. Unsloth выпустила оптимизированную версию, но этого недостаточно. Главный риск — разрыв между vendor-stated и независимо подтверждёнными цифрами. Пока community не реплицирует бенчмарки, значительная часть заявленных возможностей остаётся неподтверждённой. *** ## Куда это идёт Nemotron 3 Ultra открывает три направления. **Архитектурный сдвиг.** NVIDIA доказала, что гибрид Mamba-Transformer масштабируется до frontier-уровня. Llama 5, Qwen 4 и DeepSeek V5 включат Mamba-подобные слои в следующие итерации. **Новый стандарт пост-тренинга.** MOPD с десятью учителями и асинхронной конвейеризацией — blueprint для open-source моделей. Принцип multi-teacher on-policy distillation войдёт в стандартный инструментарий, даже если конкретный пайплайн невоспроизводим. **Ниша для агентов.** Для long-running агентных задач latency критичнее одноразового качества. Nemotron 3 Ultra — первая модель, спроектированная под этот сценарий. Ближайшие месяцы покажут, реальна ли эта ниша. Модель не доминирует по бенчмаркам. Но она задаёт архитектурное направление и доказывает: throughput может быть дифференциатором. *** ### Источники [NVIDIA Technical Blog](https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-powers-faster-more-efficient-reasoning-for-long-running-agents/) · [Hugging Face model card](https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16) · [Technical Report](https://research.nvidia.com/labs/nemotron/files/NVIDIA-Nemotron-3-Ultra-Technical-Report.pdf) · [Artificial Analysis](https://artificialanalysis.ai/models/nvidia-nemotron-3-ultra-550b-a55b) · [Digital Applied](https://www.digitalapplied.com/blog/nvidia-nemotron-3-ultra-550b-open-reasoning-model-2026) · [MarkTechPost](https://www.marktechpost.com/2026/06/04/nvidia-ai-releases-nemotron-3-ultra-an-open-550b-mixture-of-experts-hybrid-mamba-transformer-for-long-running-agents/) · [Dataconomy](https://dataconomy.com/ai-models/nvidia-nemotron-3-ultra-550b-a55b/) · [CloudPrice](https://cloudprice.net/models/nvidia-nemotron-3-ultra-550b-a55b) · [NVIDIA MOPD Guide](https://docs.nvidia.com/nemotron/nightly/nemotron/ultra3/mopd.html) · [NVIDIA NeMo-RL GitHub](https://github.com/NVIDIA-NeMo/RL/blob/ultra-v3/docs/guides/nemotron-3-ultra.md) · [Awesome Agents](https://awesomeagents.ai/models/nvidia-nemotron-3-ultra-550b/) · [Beri.net TCO](https://www.beri.net/article/2026-06-04-nvidia-nemotron-3-ultra-550b-open-frontier-agent-model) · [NVIDIA Research](https://research.nvidia.com/labs/nemotron/Nemotron-3-Ultra/) *Исследование проведено в ИИ среде, июнь 2026.*