Modelos / SEÑAL VERIFICADA
NVIDIA lanza Nemotron 3.5 Lightning: un MoE abierto de 30B con 3B activos pensado para agentes siempre activos
NVIDIA presentó Nemotron 3.5 Lightning, un MoE abierto de 30B con solo 3B activos para agentes de larga duración: hasta 4x la velocidad de salida de modelos similares, 1M de contexto y pesos, datos y recetas abiertos.

NVIDIA presentó Nemotron 3.5 Lightning, el primer modelo de la familia Nemotron 3.5: un Mixture-of-Experts abierto de 30B parámetros totales con solo 3B activos, diseñado para agentes de larga duración que ejecutan tareas de alto volumen y especializadas. La promesa central es velocidad: NVIDIA afirma hasta 4x la velocidad de salida de modelos de tamaño similar.
La apuesta es explícitamente agéntica. El anuncio argumenta que los agentes de larga duración pasan la mayor parte del tiempo ejecutando, no razonando: llamando herramientas, validando resultados y delegando trabajo. Para ese perfil de uso, un modelo pequeño y veloz que corre en una sola GPU tiene más sentido que uno gigante, y es la primera vez que la línea Nemotron enfoca su modelo chico directamente a ese caso.
Datos técnicos de la model card oficial:
- Arquitectura híbrida MoE con capas interleaved de Mamba-2 y MoE, más capas selectivas de Attention.
- 30B totales, 3B activos, pre-entrenado con más de 20T tokens.
- Hasta 1M tokens de contexto.
- Corre en una sola GPU: 1x DGX Spark (GB10) o 1x H100; soporta Blackwell, Hopper y Ampere vía W4A16.
- Licencia OpenMDW-1.1, lista para uso comercial.
- Idiomas: inglés y lenguajes de código, más español, francés, alemán, italiano y japonés.
En benchmarks agénticos, NVIDIA reporta en la model card SWE-bench Verified 52.8 y PinchBench 85.4 en el checkpoint BF16, con 24.6 en Terminal-Bench 2.1. En el anuncio, la compañía cita 86% de precisión en PinchBench completando 10.000 tareas 35% más rápido que Qwen3.6 35B a precisión similar. El modelo llega con estrategias de speculative decoding incluidas: DSpark para baja concurrencia, MTP y DFlash.
El lanzamiento viene acompañado de dos piezas de ecosistema:
- NeMo Switchyard, una librería open source de model routing: usar modelos frontier para razonamiento y planificación, y Lightning para la ejecución de alto volumen. Repo en NVIDIA-NeMo/Switchyard.
- Nemotron-RL-Agentic-Terminal-Pivot, el dataset agéntico de RL abierto que se usó para post-entrenar sus capacidades de coding agent, publicado en Hugging Face.
NVIDIA destaca también el post-entrenamiento con NeMo para dominios: cybersecurity, coding, legal y energía, con partners como CodeRabbit y Harvey.
Nota Model Watch: el modelo ya figura en el dashboard de Artificial Analysis con Intelligence Index 23.6 y precio de entrada 0, listado como open weights. En Model Watch se puede contrastar contra el resto del campo.
Para más detalles:
