GPTProto

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

HuggingFace Daily Papers(社区热门论文)·Apr 14, 2026, 8:00 AM·Qwen / Alibaba

Nemotron 3 Super是1200亿参数(120亿激活)的Mamba-Attention混合专家模型,首创NVFP4预训练,集成LatentMoE架构与MTP推测解码层优化推理。模型基于25万亿token预训练,经监督微调和强化学习后训练,支持100万token长上下文。相比GPT-OSS-120B和Qwen3.5-122B,推理吞吐量分别提升2.2倍和7.5倍,同时保持相当精度。全系列数据集与模型检查点已在HuggingFace开源。